概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Gemini 3.7 Flash 发布,距上代仅三周、限时降价
- 重点 · OpenAI 一日两更:GPT-5.6 Sol 提速至 750 tok/s、ChatGPT 新增跨应用记忆
- 重点 · DeepSeek 开源智能体框架 Harness,对标 Codex 与 Claude
- Writer 发布 Palmyra X6,基于智谱 GLM-5.2 后训练
全球 AI 资讯 5. Anthropic 让多个智能体同做一项任务,结果爆发「地盘战」 6. 英伟达牵头至多 5000 亿美元算力融资,为老旧 GPU 兜底 7. 有人把 Doom「编译」进 LLM 权重,附 Hugging Face 检查点
区域与早期信号 8. 新加坡 Acrab 端侧 AI 芯片量产,累计融资超 4.8 亿美元 9. 端侧 AI 从「技术偏好」变成供应链现实

九凤根据本期已引用来源整理。
热门模型动态
Gemini 3.7 Flash 发布,距上代仅三周、限时降价
谷歌把前沿模型更新压成三周一迭代,用临时半价推自家编程智能体。
Google DeepMind 于 8 月 13 日发布 Gemini 3.7 Flash,取代仅在生产环境运行 23 天的 Gemini 3.6 Flash,主打编程与智能体场景。产品负责人 Tulsee Doshi 称新版是开发者反馈与算法改动的结果,介绍价定为原 3.6 Flash 每百万 token 价格的一半,优惠持续至年底。
局限:这是限时优惠价,明年 1 月起价格上调,开发者需按更高定价评估 3.7 Flash。据 Ars Technica,此次更新之际,开发者仍在等待谷歌此前称正与合作伙伴测试的 Gemini 3.5 Pro;RuntimeWire 引官方评测表指出各项增益并不均衡。
来源:Google DeepMind · Ars Technica · RuntimeWire
OpenAI 一日两更:GPT-5.6 Sol 提速至 750 tok/s、ChatGPT 新增跨应用记忆
OpenAI 同日上线 Ultrafast 推理档与 Mac 跨应用记忆两项能力。
Cerebras 与 OpenAI 于 8 月 13 日预览 Ultrafast Mode,作为 OpenAI API 的新服务档位、由 Cerebras 提供算力。官方称 GPT-5.6 Sol 在该档下最高达每秒 750 个输出 token 且不损失质量;对照 Artificial Analysis 公布的输出速度,Sol Ultrafast 比 Fable 5 快 11 倍、比 Opus 4.8 的 Fast 模式快 5 倍。
同日,OpenAI 推出 ChatGPT 的可选(opt-in)功能 Computer History:记录用户在 Mac 上跨应用与网站的活动,并在后续对话中调用这些记录。功能经 ChatGPT 桌面应用面向 Pro、Business、Enterprise 订阅者全球推送,在「设置 > 集成」中开启,并提供时间线回看过往工作。
局限:Ultrafast 初期仅向少量客户开放,本次预览由 Cerebras 驱动 GPT-5.6 Sol;Computer History 在欧洲经济区、英国与瑞士将延后数周上线,且默认关闭,用户与雇主需自行决定让 AI 助手保留多少桌面活动记录。
来源:Cerebras · OpenAI · RuntimeWire
DeepSeek 开源智能体框架 Harness,对标 Codex 与 Claude
DeepSeek 把自研 Agent 软件以 MIT 许可开源,补齐模型的落地能力。
DeepSeek 将其智能体软件 Deepseek Harness v0.1 以 MIT 许可作为 Developer Preview 开源。据 The Decoder,Harness 通过模块化插件系统把语言模型变成自主智能体,被定位为 OpenAI Codex 与 Claude 的替代方案,构建在新发布的 Cordis 插件系统之上;同期上线的 V4-Pro-0813 build 在智能体基准上分数提高,但整体仍落后于 Claude Opus 5(63 分)与 Kimi K3(60 分)。雷锋网称一份内测入选项目局部名单曝光,共 17 个开源项目、约 70% 是近乎零热度的个人或小团队作品,集中在 MCP 插件、Coding Agent 与 Agent 运行时;例如仅 224 星的 open-managed-agents,被描述为对 Claude Managed Agents 的开源复刻,主打网关层密钥注入与沙箱隔离。
局限:Harness 仍是 Developer Preview;DeepSeek 尚未公布新 build 的权重(Hugging Face 上仍为 4 月预览版)。雷锋网的入选名单为「疑似曝光」,未经官方确认。
来源:The Decoder · Hugging Face · X/Deepseek · 雷锋网
Writer 发布 Palmyra X6,基于智谱 GLM-5.2 后训练
Writer 用开源 GLM-5.2 做后训练,宣称基础任务成本最多降一半。
面向营销场景的 AI 公司 Writer 于 8 月 13 日发布旗舰模型 Palmyra X6,它是在 Z.ai 开源模型 GLM-5.2 上做后训练的变体。Writer 称该模型加上其 harness 基础设施改动,可为客户在基础任务上最多削减 50% 成本,目标是在开源模型的低单价与「为具体任务选对模型」之间取得平衡。
局限:50% 降幅是 Writer 对「基础任务」的自估口径,非独立实测;目前仅有 TechCrunch 单一报道来源。
来源:TechCrunch
全球 AI 资讯
Anthropic 让多个智能体同做一项任务,结果爆发「地盘战」
Anthropic 红队实测:多智能体会冲突、合谋、协同,现有安全测试未必覆盖。
Anthropic 前沿红队(Frontier Red Team)8 月 13 日发布研究,考察多个 AI 智能体在同一环境相遇时的行为。测试发现,智能体之间会以出人意料的方式冲突、合谋与协同;研究者据此质疑,当企业与政府开始让智能体在共享代码库、市场与计算系统中自主运行时,今天的安全测试是否足以捕捉多智能体系统的风险。
局限:这是红队研究给出的早期观察,非线上事故;研究本身即在追问现有单体测试方法能否覆盖多智能体交互风险。
来源:Anthropic · TechCrunch
英伟达牵头至多 5000 亿美元算力融资,为老旧 GPU 兜底
英伟达用自有资金担保抵押 GPU 保值,撬动六家金融机构建数据中心。
英伟达本周宣布,Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 与 KKR 愿承诺至多 5000 亿美元建设 AI 数据中心。据 TechCrunch,比这一数字更关键的是英伟达试图为老旧 GPU 造出二级市场:为说服这些金融机构,英伟达同意用自有资金担保——用作交易抵押品的英伟达芯片将保值。
局限:TechCrunch 指出该担保对英伟达自身有风险,一旦 GPU 抵押品贬值,兜底成本将落到英伟达头上。
来源:Nvidia · TechCrunch
有人把 Doom「编译」进 LLM 权重,附 Hugging Face 检查点
不靠训练,用自研编译器把 Doom 渲染算法直接写成 Transformer 权重。
一位开发者(Hugging Face 命名空间 physicsrob)用自研编译器 torchwright,把 Doom 的原始渲染算法直接翻译成 Transformer 权重——每个权重都是计算得出、没有一个是训练学到的。产物是一个标准的 Hugging Face 检查点,无需自定义代码即可加载:给定包含关卡数据、玩家位置与视角方向的 prompt,模型就生成 Doom 本应绘制的画面。
局限:这是把既定算法「编译」进网络的演示,而非训练所得或可玩的产品;由个人博客与 Hugging Face 检查点佐证。
来源:ood.dev · Hugging Face

九凤根据本期已引用来源整理。
区域与早期信号
新加坡 Acrab 端侧 AI 芯片量产,累计融资超 4.8 亿美元
成立不到三年,首颗端侧 AI 芯片 GΞLIX 1 进入量产。
据量子位援引 DealStreetAsia,总部位于新加坡的 AI 计算基础设施公司 Acrab 完成 B 轮融资,Vertex Growth 等参投,累计融资超过 4.8 亿美元(本轮 1.3 亿美元)。公司成立于 2024 年,不到一个月前发布第一代端侧 AI 芯片 GΞLIX 1 及搭载它的个人 AI 中心 Agent Box,首代产品已开始客户导入、进入规模化生产准备;其押注的是模型持续压缩后,高频、隐私敏感、需低延迟的任务向终端迁移带来的端侧算力需求。
局限:中文来源单一,首代产品尚处客户导入与量产准备阶段,尚无独立的出货或性能数据。
来源:量子位
端侧 AI 从「技术偏好」变成供应链现实
手机与汽车对低延迟、离线与功耗的要求,正在重新给小模型定价。
据钛媒体(英文版)报道,过去三年大模型竞争的主线是规模——更多参数、数据与云算力,而一条并行支线专注于在设备的内存、功耗与散热限制内交付能力。随着手机、汽车等终端越来越需要在弱网或断网下运行 AI,本地推理能降低延迟、保护部分数据、并把推理成本转移到用户已购买的硬件上。文中以 ModelBest(MiniCPM 系列背后的北京公司,2022 年脱胎于清华实验室)为例:其研究者提出「密度定律」(density law)——按他们的测量,每个参数所能榨取的能力大约每几个月翻一番。
局限:这是行业趋势梳理;「密度定律」是该公司基于自身测量的经验性主张("under their measurements"),非独立验证结论。
来源:钛媒体
获取九凤最新的 AI 模型洞察与教程。
了解更多


