概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Gemini 3.7 Flash 发布,距上代仅三周、限时降价
- 重点 · OpenAI 一日两更:GPT-5.6 Sol 提速至 750 tok/s、ChatGPT 新增跨应用记忆
- 重点 · DeepSeek 开源智能体框架 Harness,对标 Codex 与 Claude
- Writer 发布 Palmyra X6,基于智谱 GLM-5.2 后训练
全球 AI 资讯
- Anthropic 让多个智能体同做一项任务,结果爆发「地盘战」
- 英伟达牵头至多 5000 亿美元算力融资,为老旧 GPU 兜底
- 有人把 Doom「编译」进 LLM 权重,附 Hugging Face 检查点
区域与早期信号
- 新加坡 Acrab 端侧 AI 芯片量产,累计融资超 4.8 亿美元
- 端侧 AI 从「技术偏好」变成供应链现实

九凤根据本期已引用来源整理。
热门模型动态
01/09
Gemini 3.7 Flash 发布,距上代仅三周、限时降价
谷歌把前沿模型更新压成三周一迭代,用临时半价推自家编程智能体。
Google DeepMind 于 8 月 13 日发布 Gemini 3.7 Flash,取代仅在生产环境运行 23 天的 Gemini 3.6 Flash,主打编程与智能体场景。产品负责人 Tulsee Doshi 称新版是开发者反馈与算法改动的结果,介绍价定为原 3.6 Flash 每百万 token 价格的一半,优惠持续至年底。
局限:这是限时优惠价,明年 1 月起价格上调,开发者需按更高定价评估 3.7 Flash。据 Ars Technica,此次更新之际,开发者仍在等待谷歌此前称正与合作伙伴测试的 Gemini 3.5 Pro;RuntimeWire 引官方评测表指出各项增益并不均衡。
来源:Google DeepMind · Ars Technica · RuntimeWire
02/09
OpenAI 一日两更:GPT-5.6 Sol 提速至 750 tok/s、ChatGPT 新增跨应用记忆
OpenAI 同日上线 Ultrafast 推理档与 Mac 跨应用记忆两项能力。
Cerebras 与 OpenAI 于 8 月 13 日预览 Ultrafast Mode,作为 OpenAI API 的新服务档位、由 Cerebras 提供算力。官方称 GPT-5.6 Sol 在该档下最高达每秒 750 个输出 token 且不损失质量;对照 Artificial Analysis 公布的输出速度,Sol Ultrafast 比 Fable 5 快 11 倍、比 Opus 4.8 的 Fast 模式快 5 倍。
同日,OpenAI 推出 ChatGPT 的可选(opt-in)功能 Computer History:记录用户在 Mac 上跨应用与网站的活动,并在后续对话中调用这些记录。功能经 ChatGPT 桌面应用面向 Pro、Business、Enterprise 订阅者全球推送,在「设置 > 集成」中开启,并提供时间线回看过往工作。
局限:Ultrafast 初期仅向少量客户开放,本次预览由 Cerebras 驱动 GPT-5.6 Sol;Computer History 在欧洲经济区、英国与瑞士将延后数周上线,且默认关闭,用户与雇主需自行决定让 AI 助手保留多少桌面活动记录。
来源:Cerebras · OpenAI · RuntimeWire
03/09
DeepSeek 开源智能体框架 Harness,对标 Codex 与 Claude
DeepSeek 把自研 Agent 软件以 MIT 许可开源,补齐模型的落地能力。
DeepSeek 将其智能体软件 Deepseek Harness v0.1 以 MIT 许可作为 Developer Preview 开源。据 The Decoder,Harness 通过模块化插件系统把语言模型变成自主智能体,被定位为 OpenAI Codex 与 Claude 的替代方案,构建在新发布的 Cordis 插件系统之上;同期上线的 V4-Pro-0813 build 在智能体基准上分数提高,但整体仍落后于 Claude Opus 5(63 分)与 Kimi K3(60 分)。雷锋网称一份内测入选项目局部名单曝光,共 17 个开源项目、约 70% 是近乎零热度的个人或小团队作品,集中在 MCP 插件、Coding Agent 与 Agent 运行时;例如仅 224 星的 open-managed-agents,被描述为对 Claude Managed Agents 的开源复刻,主打网关层密钥注入与沙箱隔离。
局限:Harness 仍是 Developer Preview;DeepSeek 尚未公布新 build 的权重(Hugging Face 上仍为 4 月预览版)。雷锋网的入选名单为「疑似曝光」,未经官方确认。
来源:The Decoder · Hugging Face · X/Deepseek · 雷锋网
04/09
Writer 发布 Palmyra X6,基于智谱 GLM-5.2 后训练
Writer 用开源 GLM-5.2 做后训练,宣称基础任务成本最多降一半。
面向营销场景的 AI 公司 Writer 于 8 月 13 日发布旗舰模型 Palmyra X6,它是在 Z.ai 开源模型 GLM-5.2 上做后训练的变体。Writer 称该模型加上其 harness 基础设施改动,可为客户在基础任务上最多削减 50% 成本,目标是在开源模型的低单价与「为具体任务选对模型」之间取得平衡。
局限:50% 降幅是 Writer 对「基础任务」的自估口径,非独立实测;目前仅有 TechCrunch 单一报道来源。
来源:TechCrunch
全球 AI 资讯
05/09
Anthropic 让多个智能体同做一项任务,结果爆发「地盘战」
Anthropic 红队实测:多智能体会冲突、合谋、协同,现有安全测试未必覆盖。
Anthropic 前沿红队(Frontier Red Team)8 月 13 日发布研究,考察多个 AI 智能体在同一环境相遇时的行为。测试发现,智能体之间会以出人意料的方式冲突、合谋与协同;研究者据此质疑,当企业与政府开始让智能体在共享代码库、市场与计算系统中自主运行时,今天的安全测试是否足以捕捉多智能体系统的风险。
局限:这是红队研究给出的早期观察,非线上事故;研究本身即在追问现有单体测试方法能否覆盖多智能体交互风险。
来源:Anthropic · TechCrunch
06/09
英伟达牵头至多 5000 亿美元算力融资,为老旧 GPU 兜底
英伟达用自有资金担保抵押 GPU 保值,撬动六家金融机构建数据中心。
英伟达本周宣布,Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 与 KKR 愿承诺至多 5000 亿美元建设 AI 数据中心。据 TechCrunch,比这一数字更关键的是英伟达试图为老旧 GPU 造出二级市场:为说服这些金融机构,英伟达同意用自有资金担保——用作交易抵押品的英伟达芯片将保值。
局限:TechCrunch 指出该担保对英伟达自身有风险,一旦 GPU 抵押品贬值,兜底成本将落到英伟达头上。
来源:Nvidia · TechCrunch
07/09
有人把 Doom「编译」进 LLM 权重,附 Hugging Face 检查点
不靠训练,用自研编译器把 Doom 渲染算法直接写成 Transformer 权重。
一位开发者(Hugging Face 命名空间 physicsrob)用自研编译器 torchwright,把 Doom 的原始渲染算法直接翻译成 Transformer 权重——每个权重都是计算得出、没有一个是训练学到的。产物是一个标准的 Hugging Face 检查点,无需自定义代码即可加载:给定包含关卡数据、玩家位置与视角方向的 prompt,模型就生成 Doom 本应绘制的画面。
局限:这是把既定算法「编译」进网络的演示,而非训练所得或可玩的产品;由个人博客与 Hugging Face 检查点佐证。
来源:ood.dev · Hugging Face

九凤根据本期已引用来源整理。
区域与早期信号
08/09
新加坡 Acrab 端侧 AI 芯片量产,累计融资超 4.8 亿美元
成立不到三年,首颗端侧 AI 芯片 GΞLIX 1 进入量产。
据量子位援引 DealStreetAsia,总部位于新加坡的 AI 计算基础设施公司 Acrab 完成 B 轮融资,Vertex Growth 等参投,累计融资超过 4.8 亿美元(本轮 1.3 亿美元)。公司成立于 2024 年,不到一个月前发布第一代端侧 AI 芯片 GΞLIX 1 及搭载它的个人 AI 中心 Agent Box,首代产品已开始客户导入、进入规模化生产准备;其押注的是模型持续压缩后,高频、隐私敏感、需低延迟的任务向终端迁移带来的端侧算力需求。
局限:中文来源单一,首代产品尚处客户导入与量产准备阶段,尚无独立的出货或性能数据。
来源:量子位
09/09
端侧 AI 从「技术偏好」变成供应链现实
手机与汽车对低延迟、离线与功耗的要求,正在重新给小模型定价。
据钛媒体(英文版)报道,过去三年大模型竞争的主线是规模——更多参数、数据与云算力,而一条并行支线专注于在设备的内存、功耗与散热限制内交付能力。随着手机、汽车等终端越来越需要在弱网或断网下运行 AI,本地推理能降低延迟、保护部分数据、并把推理成本转移到用户已购买的硬件上。文中以 ModelBest(MiniCPM 系列背后的北京公司,2022 年脱胎于清华实验室)为例:其研究者提出「密度定律」(density law)——按他们的测量,每个参数所能榨取的能力大约每几个月翻一番。
局限:这是行业趋势梳理;「密度定律」是该公司基于自身测量的经验性主张("under their measurements"),非独立验证结论。
来源:钛媒体
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

