概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · OpenAI 在 GitHub 公开 372 项 AI 数学成果
- 重点 · Mistral Large 4 公开预览:1.05T 参数 MoE,100 万上下文
- 重点 · 马斯克称 Grok Bot 将按任务调用外部模型
- Anthropic 网络安全验证计划扩为三档,开放 Mythos 5.1
全球 AI 资讯
- Meta 开源分配求解器 Rebalancer,日处理约 4000 万个问题
- Musubi 发布开放权重审核模型 PolicyLM-1.7B
区域与早期信号
- 上海 AI 实验室开源 Intern-Decision 决策小模型
- Gmail 安装包代码显示在测试 Gemini 自动回信智能体
- Meshy 进入 a16z 消费级 AI 应用月收入 Top 50

九凤根据本期已引用来源整理。
热门模型动态
01/09
OpenAI 在 GitHub 公开 372 项 AI 数学成果
OpenAI 把内部前沿模型生成的 372 项数学成果直接放到 GitHub 上,没有投期刊,其中部分附有 Lean 形式化证明,可供机器验证。
OpenAI 称,这 372 项成果每一项都旨在解决一个公开问题,或在这个问题上取得实质进展,内容包括对重要计算机算法的改进,以及与黎曼猜想相关的进展。成果托管在 GitHub 仓库 openai/math,附修订日志和引用。据 The Decoder 报道,成果中包含用于机器验证的 Lean 形式化。
- 生成方式:大多数成果来自「对单个智能体发出单条提示词」
- 算力消耗:平均每项约耗费 3 小时 ChatGPT Pro 算力
- 发布渠道:GitHub 仓库,不投学术期刊
局限:成果出自一个未对外开放的内部模型,报道没有给出型号。目前这些都是 OpenAI 自己的说法,没有经过期刊同行评审。OpenAI 选择用形式化验证来降低审阅成本,但学界如何复核这批成果,现在还不清楚。

图片来源:GitHub;已转存至九凤 R2。
来源:OpenAI · GitHub openai/math · The Decoder
02/09
Mistral Large 4 公开预览:1.05T 参数 MoE,100 万上下文
Mistral 于 10 月 6 日开放 Mistral Large 4(内部昵称 Le Chonk)的 API 预览,权重计划在安全测试完成后公开。
Mistral 官方模型文档写明,ML4 总参数 1.05T、激活参数 52B(MarkTechPost 的报道写作每 token 激活 49B)。据 MarkTechPost 报道,ML4 采用细粒度 MoE 架构,在 Mistral 位于欧洲的自有数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练。
- 多模态:原生图像输入,视觉编码器 1.6B
- 上下文:100 万 token
- API 价格:每百万输入 token 1.36 美元,每百万输出 token 4.18 美元
- 安全评测:在 Lakera B3 基准中抵御 93.3% 的攻击,KORABench 得分 1.691(满分 2.0)
局限:权重尚未发布,目前无法自托管。TechCrunch 称权重约三周后公开,届时安全测试已经完成;MarkTechPost 写的时间是 10 月底。TechCrunch 还称,在权重发布之前,模型只能通过一个公开的护栏端点访问。
来源:Mistral 文档 · TechCrunch · MarkTechPost
03/09
马斯克称 Grok Bot 将按任务调用外部模型
马斯克在 X 上表示,Grok Bot 会为不同任务选择「最佳后端模型」,并点名了 Claude Opus 5.5、Midjourney 和 Suno。
10 月 7 日,马斯克发帖称,SpaceX 将允许 Grok Bot 使用外部 AI 服务,按任务选择他所说的「best back end model」,以给用户更好的结果。Grok Bot 由 SpaceXAI 于 8 月 11 日以 beta 形式推出,用户可以把工作委派给它,由它在用户已连接的应用里执行操作。
局限:RuntimeWire 指出,这条帖子讲的是方向,算不上技术发布。帖子没有说明哪些任务交给哪家、选择机制怎么工作,也没有提到用户能否自选模型、能否看到是哪个服务处理了任务、能否控制发往第三方 API 的数据或关闭外部路由,定价同样没有说明。
来源:马斯克 X 帖子 · xAI:Grok Bot 发布 · RuntimeWire
04/09
Anthropic 网络安全验证计划扩为三档,开放 Mythos 5.1
Anthropic 扩大了 Cyber Verification Program,通过资格审核的安全从业者可以申请更强的网络安全能力,拦截分类器的限制也会放宽。
10 月 6 日,Anthropic 发布新版 CVP,设三个访问档位,每一档都能使用 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1,以及之后的新模型。Anthropic 说明,Opus 5.5、Fable 5.1、Sonnet 5.5 等普通可用模型带有保守的网络安全防护,会拦下大部分网络安全类工作。
- Defense Access:面向防御类工作,申请提交后几天内回复
- Red Team Access:在此基础上增加授权渗透测试,只对组织开放,审核需要几周
- Specialized Access:拦截最少,由 Anthropic 与美国政府一起逐家审核,Glasswing 成员转入这一档
局限:要先申请并通过资格审核才能使用。公告承认,普通模型在安全编码场景下仍有误拦,官方正在设法减少。
来源:Anthropic
全球 AI 资讯
05/09
Meta 开源分配求解器 Rebalancer,日处理约 4000 万个问题
Meta 开源了内部用了 9 年多、负责分片、服务器和流量放置的分配求解器 Rebalancer,许可证为 Apache 2.0。
Rebalancer 是一个带 Python 接口的 C++ 库,在给定的约束和目标下决定「哪个对象放进哪个容器」,例如机架放进哪个数据中心、任务放到哪台服务器、用户流量导向哪个数据中心。
- 规模:每天处理约 4000 万个分配问题
- 安装:
pip install rebalancer,版本 v1.0.4,支持 Python 3.12+ - 平台:提供 Linux x86-64 和 macOS 14+ ARM64 预编译包,另有 .deb、.rpm、Homebrew 包
- 配套:文档,以及调试界面 Rebalancer Explorer
局限:PyPI 上该项目仍标为 Alpha。
来源:GitHub facebook/rebalancer · MarkTechPost
06/09
Musubi 发布开放权重审核模型 PolicyLM-1.7B
Musubi 推出 1.7B 参数的开放权重决策模型,可以直接按自然语言写的内容政策审核消息,目标延迟低于 50 毫秒。
PolicyLM-1.7B 面向实时内容审核:输入一段用英文写的内容政策,它就能对消息做出判定。Musubi 称,它的成本和速度与多数社交平台使用的 AI 分类器相近;政策改动时不用重新训练模型,负责制定政策的人可以反复修改。
局限:报道没有给出许可证、准确率和评测数据,「不用重新训练」等说法目前只来自公司本身。
来源:TechCrunch
区域与早期信号
07/09
上海 AI 实验室开源 Intern-Decision 决策小模型
Intern-Decision 提供 0.8B、2B、4B 三档,不生成文本,而是输出带概率的选择、评分和「是/否」判断。
据 Pandaily 报道,模型直接返回选项、分数和「是/否」答案,并附上概率。沐曦(MetaX)提供了 Day-0 适配。
局限:目前只有一篇报道摘要,许可证、评测成绩和下载地址都还没有核实。
来源:Pandaily
08/09
Gmail 安装包代码显示在测试 Gemini 自动回信智能体
拆包结果显示,Gmail 可能会加入一个 Gemini 智能体,用来查看收件箱、起草回复,部分邮件在发送前需要用户确认。
IT之家援引 Android Authority 称,Gmail 最新版(v2026.09.28)的 APK 中出现了相关代码:AI 收件箱里的待办事项旁可能会显示「使用 Gemini」按钮,遇到需要回复的邮件时会弹出「起草回复」。Gemini 无法确定下一步时会显示「需要你的输入」状态,用户可以点「提供输入」补充信息。
局限:这些只是安装包里隐藏的字符串,功能还没有上线,谷歌也没有官方说明,最终形态可能会变。
来源:IT之家
09/09
Meshy 进入 a16z 消费级 AI 应用月收入 Top 50
AI 3D 模型公司 Meshy 在 a16z 首份消费级 AI 应用月收入榜上排第 31 名,是榜上唯一一家 AI 3D 公司。
Meshy 自研面向 3D 生成的多模态模型,可以把文本和图像转成用于游戏、电影和 3D 打印的 3D 资产。公司称年度经常性收入(ARR)已突破 1 亿美元,全球注册用户超过 1500 万;2026 年 7 月完成近 4 亿美元 B 轮融资,估值 15 亿美元。
局限:以上数据来自 Meshy 的新闻稿,两篇中文报道都没有附上 a16z 榜单原文,收入数字也没有经过独立核实。
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

