概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · 四个 Claude Code 智能体协作,代码基准达 62.1%
- 重点 · MiniMax H3 团队 Reddit AMA:2K 输出模型将发布,图像模型在路上
- 重点 · 谷歌否认 Gemini 用私人文档训练,泄露原因待查
- Gemini Robotics 2 驱动三种机型,Apollo 2 灵巧度 32%–92%
- 阿里通义 App 上线五项免费功能,万相 3.0 开启公测
全球 AI 资讯 6. 菲尔兹奖得主加入 OpenAI 做 AI 安全 7. Airbnb 称 AI 把功能上线周期压缩 60% 8. Cohere Health 用 Amazon Bedrock AgentCore 把临床政策数字化
区域与早期信号 9. 中国 AI 手机分级首批过审,L3 只是起点

九凤根据本期已引用来源整理。
热门模型动态
四个 Claude Code 智能体协作,代码基准达 62.1%
Coral AI Labs 的 AgentRadio 让四个 Opus 4.6 智能体边执行边交换发现,在代码理解基准上做到 62.1%,代价是约六倍推理成本。
Coral AI Labs 联合创始人 Caelum Forder 与 Peter Carroll 于 7 月 30 日发布 AgentRadio 论文:四个运行 Anthropic Opus 4.6 的 Claude Code 智能体在执行期间互相交换发现时,解决了某代码理解基准 124 道任务中的 62.1%;同一实验里单个 Opus 4.6 智能体只做到 32.3%,而 Scale AI 公开榜上单个 Opus 4.8 智能体得分 57.2%。其做法是把消息监听作为后台操作系统进程运行,新消息在智能体的执行步骤之间插入,不打断正在进行的命令。
局限:RuntimeWire 指出,这一结果比 VentureBeat 报道后流传的说法要窄——AgentRadio 并未证明 Opus 4.6 整体强于 Opus 4.8,也没有证明四智能体系统能稳定胜过更新的模型,它只是在这 124 道代码理解任务上、胜过了单个 Opus 4.8 的一种配置;Scale 现有榜单上已有单智能体配置超过 62.1%,且多智能体带来约六倍推理成本。

图片来源:GitHub;已转存至九凤 R2。
来源:RuntimeWire · VentureBeat · GitHub
MiniMax H3 团队 Reddit AMA:2K 输出模型将发布,图像模型在路上
MiniMax H3 团队在 Reddit AMA 上回应开源下一步:用于线上 2K 输出的模型「会发布,且不会太久」,图像模型也在路上。
8 月 7 日晚,MiniMax H3 团队在 Reddit r/StableDiffusion 举行 AMA,参与者包括 H3 研究负责人 dacongya、研究员 Luigi/Nero/Kiro、系统工程师 Reynor 与开发者关系负责人 Ryanlee,帖子累积 300 多条评论后被标记为 Finished。H3 是 MiniMax 7 月 31 日发布的全模态视频生成模型,可同时理解文本、图像、视频、声音上下文,生成最长 15 秒、最高 2K 分辨率、带原生双声道的视频。针对社区最关心的「用于最终 2K 输出的模型会不会发布」,Ryanlee 答复「会,而且不会太久」;2K 背后的方案叫 In-context Regeneration,不走独立超分路线,而是结合多模态上下文重新生成高分辨率的文字与纹理。
局限:开放权重后,社区拿到的版本仍无法完整复现线上 2K 能力;图像模型、Sparse Attention 开放时间、4 步版本等仍停留在「在考虑/在路上」,AMA 未给出确定日期。
来源:InfoQ 中文(Chinese-language source)
谷歌否认 Gemini 用私人文档训练,泄露原因待查
一名独立游戏开发者称 Gemini 说出只存在于私人 Google Docs 的未公开角色,谷歌否认扫描或用私人文档训练模型。
据 Windows Report 报道、IT之家 8 月 8 日转述:一名独立游戏开发者发现有玩家用 Gemini 搜索其工作室在研游戏的信息时,Gemini 给出了未公开角色「Vantage Tripod」。开发者称该角色只存在于一份私人 Google Docs 文档,此前从未上传公开渠道,也不在游戏文件中。谷歌回应称,公司不会扫描私人 Google Docs 文档、也不会用它们训练 Gemini,只有用户主动请求时 Gemini 才会访问 Workspace 文件;并表示若有人把公开文档链接发到互联网,网页可能被搜索爬虫收录,用户可自行控制 Workspace 权限。
局限:Gemini 究竟如何得知未公开信息,目前仍无定论,事件真实原因有待进一步调查;以上为开发者单方陈述与谷歌否认,尚无第三方验证。
来源:IT之家(Chinese-language source)
Gemini Robotics 2 驱动三种机型,Apollo 2 灵巧度 32%–92%
谷歌 7 月 30 日用同一个 Gemini Robotics 2 checkpoint 驱动三种机器人配置,其中两种是 Apptronik 人形机器人 Apollo 2,公开的灵巧度成绩在 32% 到 92% 之间。
据 RuntimeWire 报道:谷歌 DeepMind 在 7 月 30 日的公告中发布 Gemini Robotics 2,并用同一个模型 checkpoint 控制三种不同配置——两种是 Apptronik 的人形机器人 Apollo 2(分别配 SharpaWave 手与 Inspire 手),第三种是装 Robotiq 夹爪的 Franka Duo 机器人,以此展示同一模型可跨不同机型迁移;32% 到 92% 的灵巧度成绩出自两种 Apollo 2 配置。这兑现了双方 2024 年 12 月宣布的分工:Apptronik 提供本体、部署场景与物理训练数据,谷歌提供负责感知指令、规划任务与控制动作的模型;公告由谷歌机器人负责人 Carolina Parada 撰写。
局限:RuntimeWire 指出,商用可靠性仍是卡点——32% 到 92% 的成绩区间本身说明部分任务远未达到稳定可用;这是一次演示性质的测试,而非量产部署数据。
来源:RuntimeWire · Google DeepMind
阿里通义 App 上线五项免费功能,万相 3.0 开启公测
阿里 8 月 7 日在通义 App 上线五项由 Qwen3.8-MAX 驱动的功能且暂时免费,次日阿里云把视频模型万相(Wan)3.0 开放公测。
据 Pandaily 报道:8 月 7 日阿里在通义(Qwen)App 上线五项新功能,全部由新旗舰 Qwen3.8-MAX 驱动,且目前全部免费;次日(8 月 8 日)阿里云把 Wan 3.0 视频模型开放公测,同时把目光投向企业付费买家。
局限:本条为素材有限的快讯,五项功能的具体形态、Wan 3.0 公测的用量与企业定价细节均未在报道中展开;「暂时免费」意味着后续商业化条款尚未确定。
来源:Pandaily
全球 AI 资讯
菲尔兹奖得主加入 OpenAI 做 AI 安全
数论学家、新科菲尔兹奖得主 Jacob Tsimerman 离开多伦多大学加入 OpenAI 研究 AI 安全,他去年发表过关于「灭绝性事件」的论文。
据 The Decoder 报道:新科菲尔兹奖得主、多伦多大学数论学家 Jacob Tsimerman 将加入 OpenAI 研究 AI 安全。他认为 AI 是极具变革性的技术,社会需要在安全上投入远多于现在的努力;数学家能贡献很多,因为 AI 目前主要靠经验运作,对系统实际如何工作几乎没有保证。他去年发表过一篇关于「omnicide events」(AI 可能导致人类灭绝的情形)的论文,并说「恐慌不是正确的反应,但我们需要诚实评估风险」,还相信 AI 很快会在数学研究上超过人类。
局限:AI 是否构成灭绝级风险在专家间仍有争议;前 DeepMind CEO Demis Hassabis 评价近期 AI 的数学进展是进步、但还不算 AlphaGo「第 37 手」那样的根本性突破,要达到那种程度 AI 需攻克千禧年大奖难题。
来源:The Decoder · arXiv
Airbnb 称 AI 把功能上线周期压缩 60%
Airbnb 在财报电话会上称 AI 把从构想到上线功能的时间缩短 60%,同时正测试带开关的 AI 搜索。
据 TechCrunch 报道:Airbnb 联合创始人兼 CEO Brian Chesky 在最新财报电话会上说,得益于 AI,公司把从构想到最终上线功能的时间缩短了 60%;今年早些时候公司曾表示 AI 已在编写其 60% 的代码。面向消费者侧,Airbnb 正测试一项带开关(toggle)的全新 AI 搜索体验。
局限:报道指出 Airbnb 在把 AI 功能推给消费者界面这件事上步子偏慢,这项 AI 搜索仍处于测试阶段;「缩短 60%」为公司自述,未有独立核验。
来源:TechCrunch
Cohere Health 用 Amazon Bedrock AgentCore 把临床政策数字化
Cohere Health 在 AgentCore 上搭建多租户智能体架构,把用于事前授权的临床政策从静态文档转成机器可读的结构化数据。
据 AWS 官方博客:临床智能公司 Cohere Health 基于 Amazon Bedrock AgentCore 构建了多租户智能体架构,使用 AgentCore Runtime 的 MicroVM 安全隔离、通过 AgentCore Gateway 统一工具访问。它针对的是事前授权(prior authorization,即医保在覆盖某些医疗服务或药品前要求的审批)——这是医疗中最依赖人工的流程之一,因为规则被困在静态、非结构化的文档里、难以自动化,每年影响数亿名患者。把这些临床政策用标准术语数字化成结构化、机器可读的数据,可缓解这一运营瓶颈。
局限:政策内容随临床领域、地域、业务线与医保方而异并持续演变,落地需保持临床监督;本文为 AWS 官方案例博客,来自厂商视角,未含第三方评测数据。
区域与早期信号
中国 AI 手机分级首批过审,L3 只是起点
中国 AI 终端智能分级测试 7 月首批通过 11 款设备,含华为、摩托罗拉、荣耀、vivo、OPPO、小米、阶跃九款手机,L3 被定位为起跑线。
据 Pandaily 报道:中国国家级「AI 终端智能分级」测试 7 月首批通过 11 款移动设备,其中包括来自华为、Motorola、荣耀、vivo、OPPO、小米与阶跃星辰(Stepfun)的九款智能手机;报道把 L3 描述为「AI 智能体手机」的起跑线,而非终点。
局限:本条素材有限,分级标准细则、L3 与更高等级的能力界定、测试方法均未在报道中展开;目前仅有单一英文行业媒体(Pandaily)报道,未见官方分级标准原文,属区域性早期信号。
来源:Pandaily
获取九凤最新的 AI 模型洞察与教程。
了解更多


