概览
本期共 10 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Firefox 的 AI 助手换成 Mistral Small 4
- 重点 · Salesforce 首个 CRM 推理模型 Koa 基于 Nemotron 3 Super
全球 AI 资讯
- 重点 · 扎克伯格反对协同减速,主张各家自己踩刹车
- 曼彻斯特大学用 Earth-2 做全英空气污染预报
- Google 汇总科研与健康成果:结核筛查读过 2.5 万张 X 光
- SageMaker 训练作业可以填一串备选实例
- OpenAI 把成立三个月的 Telon 列为法律 AI 部署伙伴
- 美国民调:61% 的可能选民反对建 AI 数据中心
区域与早期信号
- 豆包 2.1 Pro 更新 0915 版,接入豆包工作
- 蚂蚁灵波把具身模型押在「大脑」上,药房方案已进门店

九凤根据本期已引用来源整理。
热门模型动态
01/10
Firefox 的 AI 助手换成 Mistral Small 4
Mozilla 把 Smart Window 的底层模型交给 Mistral,先开美国、加拿大和法国。
Mistral 与 Mozilla 9 月 16 日宣布合作:Firefox 的可选 AI 浏览助手 Smart Window(beta)改由 Mistral 模型驱动。按 Mozilla 的说明,选中的型号是 Mistral Small 4,评估项里包含多语种表现。Smart Window 可以调用打开的标签页、浏览历史和用户保存的「Memories」,做页面摘要、信息比对、找回此前看过的内容以及整理标签页。
| 市场 | Smart Window 状态 |
|---|---|
| 美国 / 加拿大 | beta 用户已换上 Mistral Small 4 |
| 法国 | 首个官方支持法语的市场 |
| 英国 / 德国 | 官方称预计年内跟进 |
局限:Smart Window 仍是 beta,而且是可选功能,Mozilla 保留了用户切换模型的能力,这不是一个独占的默认位;Mistral Small 4 的参数量、上下文长度和评测分数都没有公布,官方只说评估包含多语种表现;英国和德国目前只有「年内」这一个时间说法。
来源:Mistral 官方公告 · RuntimeWire
02/10
Salesforce 首个 CRM 推理模型 Koa 基于 Nemotron 3 Super
用 Nemotron 3 Super 做监督微调加强化学习,自建 CRM Bench 上称错误少 3 倍。
Salesforce 在 Dreamforce 上发布 Koa,这是它的第一个 CRM 推理模型,发布与黄仁勋、Marc Benioff 的同台安排在同一天。按 NVIDIA 的说法,Koa 的做法是对 NVIDIA Nemotron 3 Super 做后训练。
- 训练:监督微调加强化学习,工具链用 NVIDIA NeMo RL、NeMo Gym 与 NeMo AutoModel
- 语料:Salesforce 自有的合成数据集,素材取自将近三十年的企业 CRM 部署,覆盖 14 个以上行业
- 榜单:在 Salesforce 自建的 CRM Bench 上,Koa 在 CRM 操作任务上持平或超过领先模型,错误少 3 倍
| 阶段 | 时间 | 范围 |
|---|---|---|
| 内部运行 | 已上线 | Salesforce 内部,驱动 Slack 里的员工智能体 |
| 客户试点 | 10 月 | 首批含 Formula 1、UChicago Medicine |
| 正式可用 | 2026 年冬季 | 美国区域 |
局限:CRM Bench 是 Salesforce 自建的基准,「错误少 3 倍」也是厂商口径,外部无法复现;训练语料同样是自有合成数据;客户要到 10 月的试点才真正上手,正式可用还排在冬季;这条消息来自 NVIDIA 官方博客一家。
来源:NVIDIA 官方博客
全球 AI 资讯
03/10
扎克伯格反对协同减速,主张各家自己踩刹车
他的理由是竞争、法律责任和外部评估已经够用,不需要行业公约。
Mark Zuckerberg 9 月 15 日公开反对「协同放慢前沿 AI 研发」的提议,理由是竞争、法律责任和独立评估已经让每家实验室有足够动机把模型训得安全。他的说法是:每家实验室可以自己决定什么时候该为安全工作推迟发布;用户会躲开不听指令的智能体,所以信任和对齐是产品竞争力,而不是需要行业公约兜底的义务。这场争论三天前由 Anthropic 的 Dario Amodei 用《We Must Pace the Frontier》挑起,据路透报道,Sam Altman 和 Elon Musk 随后都认可了「控速」这个大方向。
局限:到目前为止双方都只是表态,没有任何一家实验室公布可核查的减速阈值或时间表;Altman 与 Musk 的背书是路透的转述,不是他们的直接声明。
来源:RuntimeWire · Mark Zuckerberg 原帖
04/10
曼彻斯特大学用 Earth-2 做全英空气污染预报
用生成式降尺度模型绕开化学模式的算力成本。
英国去年约有 3 万人的死亡与空气污染相关。曼彻斯特大学地球与环境科学系教授 David Topping 的路径是:先用已有的化学-气候模拟生成训练数据,再在英国国家 AI 超算 Isambard-AI(位于布里斯托)上训练 NVIDIA Earth-2 的 CorrDiff——一个生成式降尺度模型——用它来出污染场。他给出的动机很直接:「一旦把化学过程放进天气模型,它们就会变得非常非常慢」,算力成本限制了空气质量预报能做多细、多频繁。
局限:训练数据来自既有的化学-气候模拟而不是新的观测,模型学的是对已有模拟结果的降尺度;这条消息出自 NVIDIA 自己的博客,没有第三方复核,也没有说这套预报什么时候进入公共服务。

图片来源:NVIDIA Blog;已转存至九凤 R2。
来源:NVIDIA 官方博客
05/10
Google 汇总科研与健康成果:结核筛查读过 2.5 万张 X 光
9 月 15 日的一篇成果汇编,数字全是自报口径。
Google 9 月 15 日发布《Building AI to accelerate science and improve lives》,把自家 AI 在科研与健康上的落地集中列了一遍。
- 结核筛查:相关筛查已在 6 个国家、40 个点位读过 2.5 万张以上 X 光片
- 科研工具:文章称相关结构预测工具已被 190 个国家的 400 万名研究者使用,用于药物发现,以及恰加斯病、利什曼病等被忽视疾病的研究
- 开源:DeepConsensus 等 AI 工具已放在 GitHub 上开源
局限:这是 Google 自己的成果汇编,所有数字都是自报口径,没有第三方核验;给出的是使用规模而不是效果——「读过 2.5 万张 X 光」只说了读过多少,本条引用的几个来源里都没有对应的准确率或假阳性率。
来源:Google AI · DeepMind · 恰加斯病与利什曼病 · DeepConsensus 代码库
06/10
SageMaker 训练作业可以填一串备选实例
一次提交最多五种实例类型,按优先级抓第一个有容量的。
AWS 给 Amazon SageMaker AI 的 Training Jobs 和 Processing Jobs 加了「实例偏好列表」:提交作业时可以按优先级写最多五种可接受的实例类型,SageMaker 会按顺序检查,在第一个有 on-demand 容量的类型上启动。此前作业绑死一种 GPU 配置,遇上高峰期首选机型没货,只能干等或手动换别的类型。
局限:只覆盖训练与处理作业,不涉及推理端点;上限是五种实例类型;AWS 的博客没有给出等待时间实际缩短多少的量化数据,也是厂商自家的一手来源。
来源:AWS 官方博客
07/10
OpenAI 把成立三个月的 Telon 列为法律 AI 部署伙伴
30 人团队派驻律所,替共同客户配模型、写提示词、搭智能体。
按 Business Insider 的报道,OpenAI 把法律 AI 服务公司 Telon 列为「select partner」,距这家公司 6 月成立只有三个月。Telon 由 Lewis Bretts 和 Tom Mellor 创办,30 人团队负责为双方共同客户配置模型、编写提示词、构建智能体并培训律师。它招募和训练「法律工程师」(其中很多人是前律师),把人派进律所和企业法务部,把 AI 工具变成能跑起来的流程。两位创始人此前在 SYKE 共事,做的也是 AI 化的法律交付。OpenAI 这一侧的公开框架是此前上线的 OpenAI Partner Network。
局限:合作的商业条款、客户数量和收入都没有公开;一手消息是 Business Insider 的报道,OpenAI 只有合作伙伴网络的公开说明;RuntimeWire 自己也点出了风险——这套模式重人力,能不能把劳动密集的法律实施变成可复用的智能体和手册,目前还没有验证。
来源:RuntimeWire · OpenAI Partner Network
08/10
美国民调:61% 的可能选民反对建 AI 数据中心
纽约时报与锡耶纳大学 9 月初调查 1503 名可能选民,强烈支持的只有 14%。
The Verge 报道的这份民调由《纽约时报》和锡耶纳大学发布,样本是 9 月初接受调查的 1503 名「可能选民」。被问到是否支持为 AI 建设数据中心时,61% 表示反对,只有 14% 表示强烈支持。The Verge 指出,两大党在这个问题上没有明显分野,2024 年投给特朗普的选民内部意见也大致对半。
局限:调查在 9 月初完成,早于最近这轮 AI 安全减速讨论,不反映争论发酵之后的态度;样本只覆盖美国「可能选民」;问题问的是笼统的「为 AI 建数据中心」,没有涉及具体项目或地点。
来源:The Verge
区域与早期信号
09/10
豆包 2.1 Pro 更新 0915 版,接入豆包工作
火山引擎自测:38.7 万行代码的仓库、1000 个历史 Issue,36 小时修好 83%。
火山引擎 9 月 16 日消息,豆包 2.1 Pro 更新到 0915 版本,新模型 API 已在火山方舟全量上线,豆包工作里可以直接选「豆包 2.1 Pro(0915 新版)」。
- 编程(厂商自测):面对开源游戏 Luanti(约 38.7 万行代码)仓库中的 1000 个真实历史 Issue,调度多个子 Agent 并行开发,近 36 小时内把 83% 修复到可合并级标准
- 多模态:视频推理、3D 物体图像识别等理解任务增强,可按庭院四季设计图生成可控制镜头的 3D 动态场景
- 成本:图像推理和视频推理的 Token 消耗较上一代减少 30% 以上,推理轮次和工具调用次数下降
- 长程 Agent:金融投研、办公自动化场景强化了证据溯源、权威信源检索、时效判断与数据核验
局限:所有数字都出自火山引擎自述,没有第三方榜单,也没有公开可复现的评测脚本;「可合并级标准」由谁判定没有说明;「国内领先水平」是厂商措辞,没有对照分数。本条目前只有中文来源。
来源:雷锋网(中文来源)
10/10
蚂蚁灵波把具身模型押在「大脑」上,药房方案已进门店
CEO 朱兴:今天的机器人还吃不了「粗粮」,能力和成本都还不够。
蚂蚁灵波在 2026 外滩大会上展示了药品拣选、物流分拣和工业上下料操作,其中药房演示的货架通道只有 80 厘米宽,相关方案已经在国大药房的零售门店部署。与围绕整机做研发的本体厂商不同,灵波把重心放在具身「大脑」:希望同一套基础模型适配不同构型、不同任务,再靠后训练降低具体场景的使用门槛。它的模型摊开是一条链——生成可交互世界的 LingBot-World、面向具身的视频生成基座 LingBot-Video,以及在此之上训练的动作模型 LingBot-VLA 2.0,外加数据管线、后训练和部署工具;自家 R 系列本体保留用于研发和生活服务探索。
局限:这些都是厂商在大会现场的说法和演示,没有公布成功率、节拍或部署台数;朱兴自己承认小卖部这类场景「也很难落地」,今天「能力和成本两个都有问题」,日常生活里产生的数据也还喂不进模型。本条目前只有中文来源。
来源:爱范儿(中文来源)
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

