概览
本期共 10 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · SpaceXAI 发布 Grok 4.6,AA 指数追平 GPT-5.6
- 重点 · DeepSeek 8 月 16 日上调 V4 API 价格,分峰谷两档计费
- 重点 · Claude 文本水印悄然落地,已有开发者发布 Mac 移除工具
- 微信灰测原生助手「小微」,底层 WeLM 传已扩至 6170 亿参数
全球 AI 资讯 5. OpenAI 试推可赠送的 ChatGPT 额度 6. 25 位前沿实验室研究者示警:自动化 AI 研究的多个里程碑已被跨过 7. AllenAI 开放 OlmoEarth 嵌入导出,代码与权重同步开源 8. OneAdvanced 在英国主权 AWS 上自托管 Llama 4,部署逾 50 个智能体
区域与早期信号 9. 智源 FlagOS 完成 Qwen3.8-2.4T 的九款芯片 Day0 适配(中文来源) 10. Brex 提出「与运行时无关」的 AI 工作流模式

九凤根据本期已引用来源整理。
热门模型动态
SpaceXAI 发布 Grok 4.6,AA 指数追平 GPT-5.6
SpaceXAI 用一次后训练升级把 Grok 4.6 推到前沿梯队,61 分追平 GPT-5.6 Sol,价格却低六成以上。
SpaceXAI(xAI)于 8 月 12 日发布 Grok 4.6。据 The Decoder,它在 Artificial Analysis 智能指数上得 61 分,较 Grok 4.5 提升 5 分,追平 OpenAI 的 GPT-5.6 Sol,仅次于 Anthropic 的 Claude Opus 5(63)与 Claude Fable 5(62)。在衡量真实电脑知识工作的 GDPval-AA v2 榜上排第二,Elo 1753,完成复杂任务约需 53 步(Opus 5 约 103 步)。定价为每百万 token 输入/输出 2/6 美元,较 Opus 5(5/25)与 GPT-5.6 Sol(5/30)便宜六成以上;发布首周 Grok Build 与 Cursor 内配额翻倍。MarkTechPost 指出这是在 Grok 4.5 基座不变前提下的后训练升级——重跑更长的监督微调轨迹并在智能体环境做强化学习,并新增高于原档位的 xhigh 推理档。
模型已在 xAI API(grok-4.6)、Grok Build(默认模型)、Cursor 全档位上线,并可经 OpenRouter、Vercel、Cloudflare 路由。局限也很明确:没有开放权重、没有自托管路径,气隙部署无从谈起;它是后训练迭代而非更大的新基座。
来源:The Decoder · MarkTechPost · xAI 文档
DeepSeek 8 月 16 日上调 V4 API 价格,分峰谷两档计费
新价目表按 UTC 时段分峰谷,谷时比峰时低一半,但所有谷时价仍高于今天的价格。
据 RuntimeWire,梁文锋的 DeepSeek 将于 8 月 16 日 16:00 UTC 起上调 V4 系列 API 价格,并引入分时价目表,把弹性算力任务引导到非高峰时段。DeepSeek 在 X 上把高峰时段定义为 UTC 01:00–04:00 与 06:00–10:00,每天共 7 小时,其余 17 小时为谷时;官方称谷时比峰时低 50%。但这只是两个新档位之间的差距——价目表里每一档谷时价都高于 DeepSeek 今天的收费。以 V4-Flash 为例,当前每百万 token 缓存命中输入 0.0028 美元、未命中输入 0.14 美元、输出 0.28 美元,谷时新价分别升至 0.007、0.22、0.66 美元;谷时输出价 V4-Flash 涨 136%、V4-Pro 涨 128%。
也就是说,最便宜的谷时窗口也比现价贵,「低 50%」只是相对新的峰时档而非较今日降价。RuntimeWire 提醒,按计划运行的工作负载应在 8 月 16 日前重新核算单位成本。
来源:RuntimeWire · DeepSeek 官方 X
Claude 文本水印悄然落地,已有开发者发布 Mac 移除工具
Anthropic 把 EU 驱动的机器可读水印推向全球 Claude 输出,一款本地改写工具随即上线,但检测器尚未公开、无法独立验证。
Ars Technica 报道,Anthropic 正把机器可读水印嵌入 Claude 生成的文本,目前肉眼不可见,会标记任何经 Claude 处理过的内容——甚至包括 Claude 仅做过润色的人类写作。RuntimeWire 补充,ReadMultiplex 创始人 Brian Roemmele(@BrianRoemmele)于 8 月 12 日在 X 发布了一款仅限 Mac 的工具与本地改写流程,名为「AI Watermarks Cleaner」,配合本地运行模型的 LM Studio 使用;据其描述,该流程依赖本地改写而非简单删除元数据或隐藏 Unicode 字符,会先分离可见格式再重写正文。
局限在于:Anthropic 至今未公开用于检测水印的检测器,因此这款清除工具是否真的有效无法被独立验证;Ars 也强调水印「目前」不可见,措辞留有后续变化的余地。
来源:Ars Technica · RuntimeWire · Brian Roemmele 的 X
微信灰测原生助手「小微」,底层 WeLM 传已扩至 6170 亿参数
Pandaily 称微信 AI 团队的 WeLM 已转向稀疏 MoE 架构、参数规模增至 6170 亿,但仍属灰度测试。
据 Pandaily,微信已开始灰度测试嵌入应用内的原生 AI 助手「小微」(Xiaowei),其底层是微信 AI 团队长期研发的大模型 WeLM。报道称 WeLM 已从稠密结构转向稀疏 MoE 架构,参数规模悄然增长到 6170 亿。
需要说明的是,这是素材较薄的一条:6170 亿参数出自 Pandaily 依据模型解码的推断,微信并未公开 WeLM 的正式规格;「小微」目前也只是灰度测试,尚未面向全量用户开放。
来源:Pandaily
全球 AI 资讯
OpenAI 试推可赠送的 ChatGPT 额度
用一次性领取链接为他人购买预付用量,Windows 客户端里已埋好购买入口。
RuntimeWire 的独家调查显示,OpenAI 正逐步向个人版 ChatGPT 用户推出「为他人购买额度」功能:通过一次性领取链接把预付用量送给别人。OpenAI 已上线一篇帮助中心文章,说明购买、发放、兑换、过期与退款规则;RuntimeWire 另行检查了 OpenAI Windows 应用随附的 Electron 归档,发现专门的礼品额度模块、直达购买地址 https://chatgpt.com/gifts/credits、名为 purchase_flow_enabled 与 desktop_beacon_enabled 的远程开关,以及主屏、个人资料、用量设置里的入口。产品研究者 Tibor Blaho 也在 X 上标记了这个上线页面。
局限:功能仍在逐步放量,RuntimeWire 自己的账号并未启用,需人为满足本地显示条件才渲染出「Gift credits」横幅;兑换后额度进入接收者的个人 ChatGPT 余额。
来源:RuntimeWire · OpenAI 帮助中心 · Tibor Blaho 的 X
25 位前沿实验室研究者示警:自动化 AI 研究的多个里程碑已被跨过
一项访谈研究显示,20/25 位受访者把「AI 研究自动化」列为最严重且紧迫的风险,其点名的部分里程碑已经实现。
The Decoder 报道,IAPS 研究员 Severin Field 访谈了来自 OpenAI、Anthropic、Google DeepMind、Meta 及美国高校的 25 位研究者,主题是递归自我改进(RSI,即系统强到能造出更强的自身版本、如此循环)。25 人中有 20 人把 AI 研究自动化列为最严重、最紧迫的 AI 风险之一。受访者反复援引非营利机构 METR 的 Task Horizon 基准作为衡量进展的首选指标——AI 智能体能独立完成的任务时长大约每 6 个月翻一番。Field 在其博客中总结这份 2025 年夏末的访谈研究时写道,如今几个被点名的里程碑已经被跨过,RSI 已不能再被当作营销噱头。
局限:这是一份基于 25 人访谈的定性研究加回顾性博客,RSI 的定义与紧迫性在业内仍有争议。
来源:The Decoder · 访谈研究(arXiv)
AllenAI 开放 OlmoEarth 嵌入导出,代码与权重同步开源
地球观测基础模型 OlmoEarth 现可从 Studio 直接计算并导出嵌入向量,源码、权重与论文一并公开。
Hugging Face 博客上,AllenAI(Ai2)介绍了 OlmoEarth 嵌入:其地球观测建模平台 OlmoEarth Studio 现在可以计算并导出嵌入向量——对地观测数据的紧凑数值表示,由开源的 OlmoEarth 基础模型产生。这些嵌入是低成本利用 OlmoEarth 的入口,可支撑相似性检索、分割、无监督探索等下游任务;地表特征相近的位置得到相近的向量,差异大的则相距很远。团队称源码与模型权重连同研究论文一并公开,社区可核查嵌入的具体生成方式。
局限:性能表现来自 AllenAI 自身的基准测试与一项独立评估(论文),仍需更多第三方复现。

图片来源:huggingface;已转存至九凤 R2。
来源:Hugging Face 博客 · 源码(GitHub) · 独立评估(arXiv)
OneAdvanced 在英国主权 AWS 上自托管 Llama 4,部署逾 50 个智能体
为确保数据不出英国,OneAdvanced 自托管 Llama 4 Maverick 与 Llama Guard 4,跑起 50 多个专用智能体。
AWS 机器学习博客的案例显示,服务逾 1 万家客户的英国企业软件商 OneAdvanced,在完全自控的 AWS 基础设施上、于 Amazon SageMaker AI 自托管开放权重模型 Llama 4 Maverick 与 Llama Guard 4,原因是当时这两款模型尚未通过英国区域的托管服务提供。方案配套一条基于 Amazon Aurora PostgreSQL + pgvector 的 RAG 管道、由 Strands Agents SDK 驱动的 50 多个专用智能体,以及运行在 Amazon ECS 上的工具层,目标是确保没有数据离开英国。
局限:自托管是被动选择(托管服务当时在英国区不可用),且内容出自 AWS 官方博客的自述案例。
来源:AWS 机器学习博客 · pgvector(GitHub) · Llama(Hugging Face)
区域与早期信号
智源 FlagOS 完成 Qwen3.8-2.4T 的九款芯片 Day0 适配(中文来源)
面向刚开源的 2.4T MoE,众智 FlagOS 在 9 款国内外 AI 芯片上完成 Day0 适配,并新增统一 INT8 量化。
据雷锋网,智源众智 FlagOS 社区对阿里刚开源的超大规模 MoE 模型 Qwen3.8-2.4T-A95B 完成 Day0 多芯片适配,覆盖平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、隧原共 9 款芯片,提供 BF16/FP8/INT8 等多种精度版本。为承接比上代扩大约 6 倍的参数规模,FlagOS 技术栈新增面向多芯片的统一 INT8 量化,通过 FlagOS-Compressor 打通 FP8/BF16 原生权重到 INT8 的两条压缩路径。社区称迄今已累计完成 7 支头部模型团队、12 款主流开源模型、10 款芯片的跨芯 Day0 适配。
局限:本条为中文单一信源;精度对齐(称与英伟达 CUDA FP8 版本误差在对齐区间内)等为社区自述,尚无独立验证。Qwen3.8-2.4T 模型本身的发布此前已单独报道,本条聚焦芯片适配而非模型能力。
来源:雷锋网
Brex 提出「与运行时无关」的 AI 工作流模式
把持久化运行时当作接口后的插件,让生产可靠性与评估迭代速度不再互相拖累。
InfoQ 刊出 Brex AI 工作流平台的工程实践:AI 工作流的独特难点在于 LLM 步骤的输出质量会随每次提示词微调或模型变更而漂移,必须靠离线评估验证;而生产持久化需要重量级、分布式的持久运行时,评估迭代却需要能在几秒内重跑数百次的轻量级、进程内短暂循环——两者相互矛盾。Brex 的做法是把运行时抽象成接口后的插件:该平台用 TypeScript 编写、由 5 名工程师维护,工作进程跑在 Kubernetes 上并接入 Temporal Cloud 执行长时智能体,智能体经 Vercel AI SDK 访问统一 LLM 网关。
局限:这是单家公司(Brex)的工程模式,作者指出只有当你拥有多个工作流、真正的生产级可靠性要求与严谨评估流程时才真正见效。
来源:InfoQ 中文 · InfoQ 英文原文
获取九凤最新的 AI 模型洞察与教程。
了解更多


