概览
本期共 11 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · GPT-6 Astra 两项智能体基准登顶,无人机五项首次全通
- 重点 · Cognition 发布 SWE-2:Kimi K3 后训练,成本低 64%
全球 AI 资讯
- 重点 · AWS 开源 Pizza Bot,给后台智能体做一个收件箱
- AgentsDock 进入 Beta,从手机监督编码智能体
- Higgsfield 把 GPT 驱动的动态图形塞进 After Effects
- 研究:模型写出的推理步骤对应可分离的内部模式
- 两年课堂实验:禁用 AI 的那组两年都垫底
区域与早期信号
- 智谱完成约 50 亿美元融资,投向下一代 GLM 与完全自训练
- Figma 的安全智能体把复杂告警处理时间压掉约 70%
- 亮源新创一个多月连发三项 Physical AI 技术
- 399 美元的开源机器鸭 24 小时订单额超 260 万美元

九凤根据本期已引用来源整理。
热门模型动态
01/11
GPT-6 Astra 两项智能体基准登顶,无人机五项首次全通
Andon Labs 测得 Astra 经营自动售货机的期末余额均值 15,515 美元、接近 Claude Fable 5.1 的三倍,并成为第一个在无人机基准五项子任务上全部超过人机基线的模型。
Andon Labs 用 Vending-Bench 与 Drone-Bench 两套基准,测模型能否长期自主行动、以及能否为物理系统写软件。在模拟的自动售货机生意里,Astra 的期末银行余额均值为 15,515 美元,其中最差的一次运行也有 13,272 美元;Fable 5.1 六次运行的均值是 5,422 美元,最好的一次 9,874 美元。在 Drone-Bench 上,Astra 是第一个在全部五项子任务上超过人机基线的模型,其中包括写出让无人机自主找到并跟随特定人物的代码。
| 对象 | 期末余额均值 | 单次最好 | 单次最差 |
|---|---|---|---|
| GPT-6 Astra | 15,515 美元 | 来源未给 | 13,272 美元 |
| Claude Fable 5.1 | 5,422 美元(6 次运行) | 9,874 美元 | 来源未给 |
另一套设置 Vending-Bench Arena 让多个智能体在同一地点竞争。在这套测试里,Astra 拒绝了 GLM-5.3 提出的违法价格垄断方案,Fable 5.1 则与 GLM-5.3 达成了这一安排。
局限:The Decoder 写明 Astra 在无人机任务上的成功率仍不稳定。Andon Labs 在 X 上给出的表述是,Astra 是第一个在 Drone-Bench 五项任务上各有至少一次尝试胜过人类的模型——按「至少一次成功」计。两套基准都由 Andon Labs 自建,结果来自其自己的测试。
来源:The Decoder · Andon Labs(X)
02/11
Cognition 发布 SWE-2:Kimi K3 后训练,成本低 64%
SWE-2 在 FrontierCode 1.1 Main 拿到 50.0%,与 Fable 5.1 相差不到 1 分、成本低 64%,但只能在 Devin 里用。
Cognition(Devin 的开发方)把 SWE-2 作为自家最强编码模型发布,底座是月之暗面 2.8T 参数开放权重模型 Kimi K3,经强化学习后训练得到。
- 成绩:FrontierCode 1.1 Main 50.0%,与 Fable 5.1 差距在 1 分以内
- 成本:比 Fable 5.1 低 64%
- RL 增益:Cognition 称在 K3 之上多项基准还能加 5 到 6 分
- 新特性:首次提供可选推理强度档位,且全部在一次 RL 运行中训练
- 上代对比:SWE-1.7 的底座是 Kimi K2.7,这次基座参数量接近上代的三倍
局限:SWE-2 没有开放权重、也没有独立 API,只能在 Devin 内使用——目前是 Desktop 与 CLI,Devin Web 与 Fusion 还在推送中。50.0% 这个分数由 Cognition 自己报告。
来源:MarkTechPost · Kimi K3 论文
全球 AI 资讯
03/11
AWS 开源 Pizza Bot,给后台智能体做一个收件箱
Pizza Bot 用邮件式收件箱管理会在后台继续跑的智能体任务,Apache 2.0 开源,早期版本在亚马逊内部服务过 2000 多人。
AWS 把内部用过的智能体应用重写成开源项目 Pizza Bot:自托管,基于 DeepAgents 与 LangGraph,把做完的结果和待决策的事项分别收进收件箱。线程分 All(全部历史)、Unread(做完待看)、Action(等审批或等回答)三类,可按文件夹整理,Activity 面板能查看被派出去的子工作者。任务可以手动触发,也可以走 cron 或 webhook,调度由服务端负责;停机期间错过的 cron 周期,恢复后只补跑一次。早期版本在亚马逊内部服务过 2000 多人,用于会前准备、邮件起草、Slack 摘要、CRM 记录和调研。
可用性:提供 macOS、Windows、Linux 桌面版,以及连本地或独立后端的浏览器与终端客户端,代码按 Apache 2.0 授权。
局限:这是自托管应用,后端要自己部署;错过的定时任务只补一次,长时间停机内的多次触发不会逐个补回;需要人审的任务会停在 Action 状态等人处理。

图片来源:GitHub;已转存至九凤 R2。
来源:MarkTechPost · GitHub · AWS 开源博客
04/11
AgentsDock 进入 Beta,从手机监督编码智能体
Nvidia 高级研究科学家 Zhengyi Luo 把机器人训练的运维需求做成 AgentsDock,用手机接管 Claude Code、Codex 与 Cursor 的作业。
AgentsDock 是一个桌面加移动端的工作台,用来在研究者已有的多台机器上监督编码智能体。当前桌面版本号 0.2.13-beta.33,提供 macOS、Windows、Linux 客户端,iPhone、iPad 与 Android 为 Beta 开放。界面把图表、视频、文件和渲染出来的实验回放,与聊天、源码放在同等位置:研究者可以在手机上看训练结果,重连一个持久终端,再下一条指令,不必回到跑作业的那台机器。架构分两部分,客户端跑在电脑、手机或平板上,服务端对应公开的 AgentsServer 仓库。作者 Zhengyi "Zen" Luo 是 Nvidia 高级研究科学家,系统最初为编排机器人训练任务而写,现在他大部分机器人工作都从手机上跑。
局限:软件仍在 Beta(0.2.13-beta.33),移动端只是 Beta 开放;报道未给出正式版时间表与定价。
来源:RuntimeWire · AgentsServer 仓库
05/11
Higgsfield 把 GPT 驱动的动态图形塞进 After Effects
AI Motion Designer 的输出直接落在可编辑的 After Effects 合成里,代价是同时要有 Higgsfield、ChatGPT 和 Adobe 三份订阅。
Higgsfield 的 AI Motion Designer 于 9 月 10 日推出,随后由 Higgsfield 官方账号在 X 上推广。用户可以让这个智能体给标题做动画、拼一段 logo 揭示或加一个转场;Higgsfield 称输出会以可编辑的图层、关键帧和时间信息出现在打开的 After Effects 合成里,设计师能直接改工程,而不必重新生成一段压平的视频。按 RuntimeWire 的描述,这套流程里模型负责规划、写代码和操作电脑,Higgsfield 提供媒体生成与编辑工具。这条产品线与 Higgsfield 9 月 5 日展示的浏览器端 3D 工作台 3D Jutsu 分开,Blender 插件也是另一个产品。
局限:整套流程要求同时持有 Higgsfield、ChatGPT 与 Adobe 三份订阅;RuntimeWire 指出,它的价值取决于这种可改工程的交付方式能否省下足够工作量来抵掉这三份订阅。
来源:RuntimeWire · Higgsfield(X) · OpenAI
06/11
研究:模型写出的推理步骤对应可分离的内部模式
KAIST 与 Naver AI Lab 发现,抽取、公式回忆、演绎等推理操作在模型内部状态里可以彼此区分,中间层信号最强。
研究团队定义了八种反复出现的推理操作,包括抽取、分解、公式回忆、演绎和计算,让 Qwen2.5-7B、Qwen3-8B 和 Gemma4-31B 三个模型解数学题,把解题路径切成片段,再用 GPT-5 给每个片段打上操作标签。结论是这些步骤在模型的数值表示里确实可以分开,且信号在中间层最强。该可分离性在 Llama-3-8B 上得到复现,用 Qwen3-8B 训练出的分类器也成功迁移到 GPQA-Diamond 与 MATH-500。The Decoder 指出这对 AI 安全有意义,因为可以看到模型内部实际在做哪一步。
局限:每个片段的操作标签由 GPT-5 自动标注,不是人工标注。
来源:The Decoder
07/11
两年课堂实验:禁用 AI 的那组两年都垫底
阿姆斯特丹自由大学一门 AI 法课把学生随机分成禁用 AI、无指导用 AI、受训用 AI 三组,禁用组两年都排最后。
Vrije Universiteit Amsterdam 的 Thibault Schrepel 在自己的 Law of AI 课程里做了两年随机分组实验。任务对三组相同:四到五人一组,20 分钟内改进《欧盟 AI 法案》的一个条款,评分看实质、清晰度、比例性和创新性。第一组不能用 ChatGPT;第二组直接在文本里收到 ChatGPT 生成的修改建议,可以继续用工具但没有任何使用指导;第三组接受了法律提示工程、以及如何检查 AI 建议一致性与准确性的实操培训。两年下来,没有 AI 的那组都排在最后。Schrepel 写道「我错了」——他原本假定没有指导的 AI 使用害处大于好处。
局限:这是单一课程内的实验,任务只有 20 分钟,成绩由小组作业加同一套考试(含一份选择题)构成,样本量与评分方式都受课程条件限制。
来源:The Decoder
区域与早期信号
08/11
智谱完成约 50 亿美元融资,投向下一代 GLM 与完全自训练
融资由约 20 亿美元股份配售和约 30 亿美元可转债组成,资金指向下一代 GLM 基础模型、完全自训练体系与算力基础设施。
智谱 9 月 13 日宣布完成约 50 亿美元融资。
| 组成 | 金额 |
|---|---|
| 股份配售 | 约 20 亿美元(约 156.8 亿港币) |
| 可转债发行 | 约 30 亿美元(约 201.4 亿人民币) |
| 合计 | 约 50 亿美元(约 336.54 亿元人民币) |
公告称资金主要用于下一代 GLM 基础模型及完全自训练(Fully Self Training)体系的研发,以及大规模训练、生产推理、算力资源与相关技术基础设施的部署和升级。智谱把完全自训练描述为:下一代 GLM 在上一代 GLM 构建的环境中训练,形成递归式自我改进循环,具体投入包括自动化生成和筛选训练数据、构建任务环境、提升长程推理能力,以及国产芯片适配、算子开发和推理优化。
局限:公告只给了资金结构和投向,没有下一代 GLM 的时间表、参数或评测指标;完全自训练目前是智谱自己的表述与规划,没有第三方结果可对照。本条目前只有中文来源(Chinese-language source)。
来源:IT之家
09/11
Figma 的安全智能体把复杂告警处理时间压掉约 70%
Figma 工程团队公开了一套基于 Panther SIEM 的安全代理系统,自报复杂告警处理时间降约 70%、值班通知减少 20%。
- 调查范围:检查 AWS、Okta、GitHub、GCP 与 osquery 的审计日志,另查询 100 多个数据源,并能发起 PR
- 分诊代理:采用类似 Claude Opus 的模型,输入是完整 Slack 对话记录加自身引导内存,配一套值班工程师常用的分诊工具
- 检索栈:AWS Bedrock 知识库、Amazon Kendra、Tines,以及一个基于 Snowflake 的工具,用于取历史告警、分析 Panther 数据
- 记忆分三类:历史警报、行为指南、已习得的数据库结构,分开管理
- 另一篇文章的数字:智能体发现 100 多个此前未发现的漏洞(含两个传统工具遗漏的高危漏洞),代码审查系统准确率一个月内达 80%,第二轮审查把已知漏洞检出率提高约 30%,加入自动化指导后某些编码错误减少约 50%
局限:约 70% 的提速有一部分来自把部分告警降级;作者明确说「我们无法确切地告诉你们该怎么做」,效果取决于公司规模、面临风险和已有的反馈机制,并建议先提精确率再提召回率。代理生成的 PR 默认草稿,人工审核保留。本条目前只有中文来源(Chinese-language source)。
来源:InfoQ 中文 · AWS Bedrock 知识库文档
10/11
亮源新创一个多月连发三项 Physical AI 技术
量子位报道称,一个导航模型零样本适配四种机器人本体,训练用的 2000 多个真实场景被搬进了仿真。
亮源新创在过去一个多月连续发布 LightParkour、LightNav-0 与 Light REACT 三项技术,公司把整条路线概括为三段范式:规模化预训练、规模化对齐、规模化部署。报道界定的问题边界是换障碍、换场景、换本体,以及机器人受撞击、跌倒甚至关节损伤后能否继续工作。
报道给出的公开指标包括:2000 多个真实场景被搬进仿真环境,同一个导航模型零样本跨四种机器人本体工作;引入 Point CoT 后,8 项评测的平均任务成功率提高 8.4 个百分点、SPL 提高 5.7 个百分点;跨越障碍高度从 45 厘米提到 75 厘米,约相当于本体身高的 83%,控制频率 50 Hz。报道称官方同时发布了模型、代码和技术报告。
局限:以上指标来自官方发布与量子位的转述,尚无第三方复现;零样本跨本体是厂商的表述。本条目前只有中文来源(Chinese-language source)。
来源:量子位
11/11
399 美元的开源机器鸭 24 小时订单额超 260 万美元
Hugging Face 旗下 Pollen Robotics 的 25 厘米开源双足机器人 Microduck,开订 4 天拿到 10500 台订单,交付排期已拉到 4 个月。
Microduck 售价 399 美元(约 2800 元人民币),由 AI 社区 Hugging Face 旗下的 Pollen Robotics 开发并开源,机身 25 厘米。
| 开订时长 | 累计订单额 | 累计订单量 |
|---|---|---|
| 6 小时 | 破 100 万美元 | 来源未给 |
| 24 小时 | 超 260 万美元 | 来源未给 |
| 4 天 | 来源未给 | 10,500 台 |
高峰期每 4 秒卖出一台,新订单交付排期已拉到 4 个月。卖点不只是把能走能动的双足机器人拉到千元级:Microduck 配了一条从仿真训练到真机部署的全流程开源强化学习管线,用户可以在仿真里训练虚拟鸭子学会新动作,再把训练好的行为迁移到实体机器人上。国内二手平台已有代购挂出链接,最高报价 5567 元,约为原价两倍。
局限:这些订单数字来自钛媒体转载的专栏报道,不是 Pollen Robotics 的官方披露;排期 4 个月意味着交付进度和实际使用体验都还没被验证。本条目前只有中文来源(Chinese-language source)。
来源:钛媒体
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

