AI 热点资讯

小米直播 MiMo 强化学习训练,每小时烧 3 万美元

核心速览
  • •小米把 MiMo-V2.6 的强化学习训练搬上公开页面,36 小时烧掉 108 万美元
  • •RuntimeWire 用同一套九项任务横评五款已发布的 AI 助手
  • •OpenAI 开始测试 Sponsored Agents
  • •智谱的 Infra Agent 在 10 万卡国产集群上把端到端吞吐做到 3.2 倍。
jiufeng
2026年9月17日
19 分钟阅读
本文目录

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · 小米直播 MiMo-V2.6 强化学习训练,每小时约 3 万美元
  2. 重点 · 五款 AI 助手同题横评,Grok Bot 以 4.00 分居首
  3. 重点 · 清华与 Stable AI 发布 LimiX-2 结构化数据基础模型
  4. 腾讯开源 WeKnora,附官方 DeepSeek Harness 插件

全球 AI 资讯

  1. OpenAI 测试 Sponsored Agents,把 ChatGPT 广告变成对话
  2. OpenRouter 周 token 消耗涨到 126.2 万亿
  3. 开放权重模型公司 Arcee AI 估值超过 10 亿美元
  4. AgentCore 把生产 trace 变成系统提示改进建议

区域与早期信号

  1. GLM-5.3 驱动的 Infra Agent,在 10 万卡国产集群上做推理优化
  2. 蚂蚁集团全员接入千问办公,私有化部署在内网
2026-09-17 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

01/10

小米直播 MiMo-V2.6 强化学习训练,每小时约 3 万美元

训练页面公开花费、步数、奖励曲线与显卡故障,Pro 与 Flash 两款模型 36 小时已花掉超过 108 万美元。

罗福莉沉寂半年后官宣在小米做强化学习,并把 MiMo-V2.6 系列的 RL 训练过程做成了公开页面:花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部可查。从 Pro 模型开训算起 36 小时,两款模型合计花费超过 108 万美元,平均每小时约 3 万美元。

训练配置也一并公开:每个 Step 大约处理 20 亿 Token,由 1568 个 Prompt × 每个 Prompt 16 条 Rollout 构成,一轮就可能产生超过 2.5 万条 Rollout,而 Agent 任务的一条 Rollout 往往包含几十轮思考、工具调用与环境反馈。系统把生成、执行、评分、训练改成异步流水线,不再严格排队;代码、通用任务、视觉、Chat 可以混进同一次 RL Run,并运行在不同的 Harness 里。

公开的评测数字如下:

模型dynsam/avg@n(第 1 步)dynsam/avg@n(最新)DeepSWE v1.1 离线评测
MiMo-V2.6 Pro约 0.5650.61462.24
MiMo-V2.6 Flash约 0.5140.60360.77
DeepSeek-Flash v1.1(来源给出的参照)——74.2%

局限:Flash 从更低的起点快速追近,Pro 目前只保持小幅领先;Pro 训练完一个 Step 更慢,最新评分还没出来。两款模型在 DeepSWE v1.1 上的 62.24 与 60.77,都还落后于来源列出的 DeepSeek-Flash v1.1 的 74.2%。训练页与全部数字均由小米自行公开。

来源:量子位 · 罗福莉 X

02/10

五款 AI 助手同题横评,Grok Bot 以 4.00 分居首

九项任务、一个模型裁判、四类动作全程需要人工批准,五款产品的分数从 4.00 排到 2.46。

RuntimeWire 在 9 月 16 日跑完第一轮横评:桌面版 Grok Bot、走 iMessage 的 Instinct、云端沙箱里的 Claude Cowork、网页 harness 上的 ChatGPT Work,以及 muse.ai 上的 Muse,面对同一套九项任务,由 GPT-6 Astra Pro 一个裁判用同一把 key 打分。

规则是冷会话起步、允许访问公开网页、运行途中新的 OAuth 授权一律拒绝;发送、付款、预订、发布四类动作必须由操作者手动输入 approved 才放行,而操作者全程没有输入。共享任务之一是整理固定的五封邮件收件箱:PG&E 142.18 美元 9 月 28 日到期、Figma 180 美元 10 月 1 日、Honda 2240 美元 9 月 22 日,外加一次会议改期和一份 newsletter。五款产品里,仿冒收款人这一项全部通过。

产品运行环境得分
Grok Bot桌面应用4.00
InstinctiMessage3.55
Claude Cowork云端沙箱3.12
ChatGPT Work网页 harness2.96
Musemuse.ai2.46

局限:这只是一轮测试,RuntimeWire 自己说这是「开场,不是最后一场」,会随产品更新重跑;判分只有一位模型裁判。安全项只在产品真正跑到那一步时才成立。没有一款拿到「可无人值守通宵运行」的评级——Grok Bot 是「仅在人监督下」,其余为否。Hermes 与 OpenClaw 没参赛,因为它们是套在别人模型上的 harness;五款产品里只有两款救回了被暂停的周五摘要任务。

来源:RuntimeWire

03/10

清华与 Stable AI 发布 LimiX-2 结构化数据基础模型

4 亿参数,团队称在三个表格类基准上拿到最高 Elo。

LimiX-2 面向结构化(表格)数据,采用 Contextual Mechanism Networks 架构,发布方给出的成绩如下:

  • 参数量:4 亿
  • 架构:Contextual Mechanism Networks
  • 榜单 Elo:TabArena 1935 · BCCO 1432 · TALENT 1506

局限:这三个 Elo 分数是发布方自称的最高成绩,尚无第三方复核;目前只有 Pandaily 一则英文简讯,报道没有给出对比基线、评测协议、许可证以及权重是否开放。

来源:Pandaily

04/10

腾讯开源 WeKnora,附官方 DeepSeek Harness 插件

微信团队把一个从 RAG 走向智能体的知识平台开源,并给 DeepSeek Harness 出了官方插件。

WeKnora 由腾讯微信团队开源,定位是面向企业文档的知识平台,GitHub 上已有 2.5 万以上 star。同时放出的官方 DeepSeek Harness 插件,为企业文档检索场景增加四个只读检索工具。

局限:四个工具都是只读检索,不涉及写入或修改;这条目前只有 Pandaily 一则英文简讯,报道没有给出许可证、插件支持的模型版本,也没有企业接入规模或检索质量数据。

来源:Pandaily

全球 AI 资讯

05/10

OpenAI 测试 Sponsored Agents,把 ChatGPT 广告变成对话

用户可以从广告点进与广告主 AI agent 的标注对话,广告主接 HubSpot 做归因、接 Shopify 拿商品目录。

OpenAI 于 9 月 16 日开始测试 Sponsored Agents:人们可以从 ChatGPT 里的一条广告,进入与该广告主 AI agent 的对话,对话带有明确标注。配套集成让广告主把 ChatGPT 上的投放接到 HubSpot 的归因,以及 Shopify 的商品目录与购买数据。OpenAI 8 月 31 日曾表示 ChatGPT Ads 已达到 10 亿美元的年化收入规模。

局限:测试只对选定的美国广告主开放,公告里没有给出广告主名单、定价与效果基准,商家需要另行申请。来源同时指出,运营方真正的难题是衡量这些对话到底转化了没有,又不让付费劝说与独立回答之间的边界变模糊。

来源:RuntimeWire · OpenAI

06/10

OpenRouter 周 token 消耗涨到 126.2 万亿

自 2025 年 1 月上涨超过 25,000%,但这条曲线更多反映 token 指标本身在膨胀。

OpenRouter 的周 token 消耗量从 2025 年 1 月的 0.5 万亿涨到 126.2 万亿,涨幅超过 25,000%,图表由 OpenRouter 的 Peter Walker 提供。The Decoder 指出,推理模型在给出答案前会生成大量「思考」token,使用量的小幅上升就可能带来 token 消耗的大幅跳升,未优化的 agentic 系统尤其烧得快。OpenAI 的 GPT-5.6 Luna 近期在 OpenRouter 上的 token 消耗居首,但这不必然意味着用它的人更多,也可能只是它生成得更多。

局限:来源明确说这条曲线不能等同于实际使用量或商业价值的同等增长;数据只来自 OpenRouter 这一个分发平台,不覆盖各家模型的直连调用。

来源:The Decoder · OpenRouter X

07/10

开放权重模型公司 Arcee AI 估值超过 10 亿美元

B 轮由 Vista Equity Partners 等三家领投,金额未披露;公司最强的 Trinity Large 为 4000 亿参数、每 token 激活 130 亿。

Arcee AI 宣布完成新一轮融资,估值超过 10 亿美元。这轮 Series B 由 Vista Equity Partners、Cambium Capital 与 Emergence Capital 领投,A10 Ventures、Hitachi、IAG、微软的 M12、P7 与咨询公司 Wipro 参与。公司位于旧金山,做的是开放权重模型——公开核心数值参数,任何人都可以下载、修改并跑在自己的基础设施上。

模型侧的数字:Trinity 系列里最强的 Trinity Large 为 4000 亿参数、每 token 激活 130 亿参数;公司称去年开发这批模型花费约 2000 万美元。此外它还与美国能源部及 17 个国家实验室合作了 Genesis-Science-1。联合创始人兼 CEO Mark McQuade 对 Fortune 表示,企业不该在前沿模型的能力与自主控制之间二选一。

局限:具体融资金额没有公布,「至少 1.5 亿美元」的说法来自 Fortune 引述的一位消息人士;Trinity Large 的参数规模与约 2000 万美元的开发花费都是公司自述的数字。

来源:SiliconANGLE

08/10

AgentCore 把生产 trace 变成系统提示改进建议

先离线批量评测、再线上流量 A/B,胜出的配置才推广。

Amazon Bedrock AgentCore 的优化能力用 AgentCore Observability 记录的 agent trace 加上奖励信号,产出改写后的系统提示,再走一套固定流程:先给出 recommendations 和 configuration bundles,经离线批量评测与线上 A/B 测试验证,赢的那版才被推广。过去改一个低分 agent 靠人读长 trace、逐个调提示词、工具描述和 skill,再重跑评测。AWS 用仓库里的 market trends agent 作为示例。

文章还给出 Single Agent Reflector 与实验性开源的 Sub-Agent Reflector 在两个公开基准上的评测结果,并与 GEPA、MIPROv2 这两种提示优化方法作对比。

局限:Sub-Agent Reflector 仍是实验性的开源实现;这是此前发布文的技术配套篇,示例跑的是 AWS 自家样例仓库里的 agent,而非第三方生产环境。

agentcore-samples/02-use-cases/01-conversational-agents/market-trends-agent at main · awslabs/agentcore-samples

图片来源:GitHub;已转存至九凤 R2。

来源:AWS Machine Learning Blog · market trends agent

区域与早期信号

09/10

GLM-5.3 驱动的 Infra Agent,在 10 万卡国产集群上做推理优化

两周从首次跑通到承载全部生产流量,端到端吞吐做到 3.2 倍。

智谱首席科学家唐杰公布了一项 GLM-5.3-Flash 推理系统优化的结果:集群由超过 10 万颗国产 AI 加速器组成,从模型首次在这批硬件上运行,到完成全部生产流量承载,用了两周。大量优化工作由 GLM-5.3 驱动的 Infra Agent 完成——读系统反馈、提假设、改代码、跑实验,再按结果继续迭代。

具体手段包括:针对线性注意力与 LM Head 的节点内张量并行、用 ReplaySSM 以计算换显存、W8A8 量化与 INT8/FP8/BF16 混合精度缓存量化,以及 Encode-Prefill-Decode 分离式架构。团队称硬件利用率和单 token 成本已接近主流 NVIDIA GPU 平台的水平,GLM-5.3-Flash 还以匿名模型 Ox-Alpha 的身份在 OpenCode 与 OpenRouter 上接受真实调用检验。

优化项优化前优化后
端到端服务吞吐(相对首版)1×3.2×
Prefill+KV Transfer 性能损失超过 20%1% 以内
KDA Decode 算子1×1.71×

局限:唐杰本人说距离真正意义上的递归自我改进仍然很远,眼下只是一种早期形态。国产 AI 加速器的软件生态仍在发展,部分 Kernel 支持不足、很多资料要工程团队自行摸索;模型还需要支持 100 万 token 上下文与多模态请求。上述数字均由智谱公布,目前只有中文媒体报道。

来源:量子位 · 爱范儿

10/10

蚂蚁集团全员接入千问办公,私有化部署在内网

数万人规模的公司把千问办公当成全员智能办公 Agent 底座,方案跑在自家内网。

蚂蚁集团 9 月 17 日宣布全员接入千问办公。出于数据安全与合规要求,这次采用 K8S 私有化部署,全面运行于蚂蚁内网,支持企业自有模型接入,口径是数据不出域、日志可审计、结论可验证。方案融合蚂蚁自有的 Agent 能力,打通数字员工、蚂蚁钉、项目管理等内部服务,并衔接蚂蚁内部的 AI 安全管控底座。

千问办公方面称产品上线一个月用户数突破 3000 万,其中企业用户占比过半,已接入的企业包括长安汽车、中集安瑞科、汇付天下、传化集团、老乡鸡等。

局限:3000 万用户数与「业内首个企业级通用 Agent 产品」都是厂商口径;报道没有给出蚂蚁内部的实际使用规模、覆盖了哪些任务或效果数据;目前只有中文来源。

来源:雷锋网

用 JIUFENG 自己生成一张

在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。

免费生成图片