概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · OpenAI 桌面版暗藏开关,让 Codex 点亮实体状态灯
- 重点 · 千问办公落地长安汽车,线束选型从两天压到五分钟
- 重点 · 100 步 GRPO 把 350M 模型的结构化输出合规率提到 29.7%
全球 AI 资讯 4. Anthropic 再签 350 亿美元算力合同 5. funes 给编码智能体一份自己拥有的记忆 6. Diagrid Catalyst 2.0 给智能体执行加上持久化与签名校验 7. Flock 的 AI 布控名单可以按文字描述搜人
区域与早期信号 8. 影眸发布 WorldGen,把 3D 生成从单个资产推到整场景 9. 智谱把 GLM Coding Plan 的 token 订阅搬上天猫

九凤根据本期已引用来源整理。
热门模型动态
OpenAI 桌面版暗藏开关,让 Codex 点亮实体状态灯
RuntimeWire 逆向 OpenAI 桌面版 26.901.20858(build 7658),挖出一个默认关闭的隐藏配置 busy-bar-enabled,用来让 Codex 控制外接的 BUSY Bar。
RuntimeWire 对比了 build 7119 与 7658 两个安装包,定位到新增的隐藏偏好项 busy-bar-enabled,其内部描述为「Whether Codex controls a connected BUSY Bar」,标记为 hidden、默认值 false。安装包里还多出一个 busy-bar.asar 资源包,含按 BUSY Bar 屏幕尺寸制作的动画与设备状态图形,覆盖任务进行、就绪、等待、错误与断连几种状态。BUSY Bar 是 Flipper 的桌面硬件。
这是逆向发现,不是官方公告:开关被标为隐藏且默认关闭,OpenAI 没有说明是否会正式发布。RuntimeWire 同时指出,已有独立开发者自行把 Codex 接到同一款设备上(开源控制器仓库在 GitHub),这次的新点是「官方支持」,而不是第一次有人把两者接起来。
来源:RuntimeWire · busybar-codex(GitHub)
千问办公落地长安汽车,线束选型从两天压到五分钟
长安汽车在研发、生产制造、供应链、销售与服务环节接入千问办公,并要求全员使用 AI agent。
按雷锋网 9 月 3 日报道(事发 9 月 2 日),研发端工程师用千问办公做出线束选型计算工具,单车型成百上千条线束的参数计算此前由资深工程师手工完成约需两天,现在导入参数表五分钟出结果。生产端的随车文件核查小程序覆盖合格证、COC 证书、环保清单等数十项参数比对,单车人工核对从十几分钟降到一到两分钟;供应链端把连接全国数百家供应商、单项目数千条零件的包装评审流程拆成七八个自动化脚本,工作量减轻九成以上;销售与服务调研端单项目两到三万份用户样本的分类分析周期,从数天压到半天以内。
这些数字全部来自长安汽车与阿里云的内部说法,没有第三方核验。报道也没有给出接入规模、所用模型版本、Token 消耗或成本数据,只有单一中文来源。
来源:雷锋网
100 步 GRPO 把 350M 模型的结构化输出合规率提到 29.7%
Hugging Face 放出一份用 TRL 做 GRPO 微调的完整公开配方,LFM2.5-350M 在 IFStruct 基准上从 22.6% 提到 29.7%。
这篇 9 月 3 日发布的教程用 Group Relative Policy Optimization 微调 LiquidAI 的 LFM2.5-350M,全程约 500 条样本、100 个训练步,作者称规模小到能在免费档 Colab 或 Kaggle GPU 上跑完,代码在 GitHub 上公开。评测用 IFStruct 基准,成绩从 22.6% 提升到 29.7%。文章的动机是:结构化输出是 LLM 最常见的真实任务之一,但多数基准把它折叠进推理或抽取分数里,很少单独衡量模型能否稳定返回符合 schema、可解析的输出——而这一点往往决定它能不能接进下游系统。
局限也写在文里:29.7% 的绝对分数依然不高,这是一份「轻量微调能带来多少改善」的配方,不是把小模型推到可用水位的结论,且只在 IFStruct 单一基准上报告结果。

图片来源:huggingface;已转存至九凤 R2。
来源:Hugging Face Blog · GitHub 原文
全球 AI 资讯
Anthropic 再签 350 亿美元算力合同
路透社援引匿名消息称,Anthropic 与英伟达投资的云厂商 Lambda 签下 350 亿美元云计算合同。
据 The Decoder 9 月 3 日转述路透社报道,合同对应的数据中心建在得克萨斯州 Nueces County,容量约 350 兆瓦,由前加密货币矿企 Hut 8 开发;据《华尔街日报》,英伟达本身持有该数据中心的租约。Hut 8 早在 7 月就宣布过与一家未具名客户签订 15 年租约。就在上周,Anthropic 还宣布了与 Nscale 在西弗吉尼亚州数据中心的 450 亿美元合同。报道称,扩容是为了跟上 Claude 与 Claude Code 的需求增长,并发生在其筹划 IPO 之前。
消息来自匿名信源,涉及的几家公司都没有对路透社置评。合同金额、工期与付款结构均未经任何一方确认。
来源:The Decoder
funes 给编码智能体一份自己拥有的记忆
Hugging Face 博客介绍 funes:把智能体留下的会话轨迹做成可索引、可检索、带精确出处的持久记忆层。
作者 David Corvoysier 在 9 月 3 日的文章里写道,他在多台机器上工作、按任务切换编码智能体,每个智能体面对他的项目都像陌生人,上周二的推理过程随会话结束一起消失。文章接的是今年早些时候那篇 Software Forgets: Agent Traces Are the Memory 的判断:智能体在检索代码库、试方案、撞错误、读文档、改方向的过程中,已经留下了关于改了什么以及为什么改的密集记录。funes 给这些轨迹补上索引、检索、排序与出处,目前面向 Claude Code、Codex、pi 和 Hermes。
作者自己也点明了前提:轨迹只是潜在的记忆,会话日志本身仍然只是存档,你没法在上万轮对话里 grep 出「我们当初为什么放弃流式解析器」。文章是作者自述加工具介绍,没有给出检索质量的量化评测。
来源:Hugging Face Blog · GitHub 原文
Diagrid Catalyst 2.0 给智能体执行加上持久化与签名校验
模型调用与工具调用被表示成持久化的工作流活动,中断后可从断点恢复,执行历史还能被独立验证。
据 InfoQ 报道,Diagrid 于 2026 年 7 月 28 日发布 Catalyst 2.0,共提供十个框架集成,覆盖 LangGraph、LangGraph Deep Agents、Microsoft Agent Framework、Google ADK、Dapr Agents、AWS Strands、OpenAI Agents SDK、Claude Managed Agents、CrewAI 与 Pydantic AI,开发者只需在现有智能体应用里加一个 Diagrid 包。它针对的故障场景很常见:长时间多步任务在序列末尾才失败,若没有在调用粒度设检查点,重试要为此前已完成的所有模型调用重新买单。验证模型来自 Dapr 1.18——对工作流历史事件批量哈希,把每个摘要链到前一个签名,再用 Dapr 边车基于 SPIFFE 的身份签名,加载状态时检查链条,可检出被删除、重排或修改的历史。持久化智能体用 Python SDK 构建,工作流 SDK 支持 .NET、Go、Java、JavaScript 和 Python,开源的 Dapr 1.18 SDK 还包含 Rust。
Dapr 1.18 的签名默认处于禁用状态,由 WorkflowHistorySigning 特性开关控制,并依赖 mTLS:启用了签名而 mTLS 未开,daprd 将拒绝启动。签名决策是单向的,无法追溯签名已有历史,对运行中的工作流切换开关会触发验证错误。InfoQ 还提醒,签名只能证明历史没被改动,并不能证明智能体决策正确、工具返回的数据准确或所有外部副作用都被捕获;实践者还要评估非幂等工具的重试处理、存储与延迟开销、证书轮换,以及哪些能力属于开源 Dapr、哪些属于商业版 Catalyst。目前已知早期采用者数量有限,光学制造商蔡司集团被列为其中之一。
Flock 的 AI 布控名单可以按文字描述搜人
WIRED 重建了 Flock Safety 的警用界面:在城市地图上圈一块区域,就能为任何符合文字描述的人建一条 AI 布控名单。
RuntimeWire 9 月 3 日援引 WIRED 当天发布的界面重建报道称,Garrett Langley 的 Flock Safety 允许警方在地图上画出边界,为符合书面描述的人创建 AI 布控名单,区域内的摄像头随后对可能的匹配对象持续自动搜索。重建界面补上了 RuntimeWire 8 月 19 日报道 OS Investigate 时缺的那部分:警员如何配置人员布控名单、用 Smart Sort 优化排序后的图像结果,以及会拦截查询或发出警告的审核决策——服务端模型评估警方可以搜什么,界面对部分敏感查询直接拦截、对另一些发出警告。
这套界面是 WIRED 用 Flock 在登录前发送到用户浏览器的文件重建出来的,不是官方文档,服务端实际策略无法据此确认。Ars Technica 8 月的报道显示,随着网络铺开,政治阻力也在上升,城市正以创纪录的速度终止 Flock 合同;Flock 当时表示年度经常性收入已超过 3 亿美元、同比增长 70%。
来源:RuntimeWire · Ars Technica
区域与早期信号
影眸发布 WorldGen,把 3D 生成从单个资产推到整场景
单图生成可交互、可编辑的 3D 场景,场景内每件资产可单独拎出、替换,并自带物理属性。
据量子位 9 月 3 日报道,3D 生成公司影眸 Hyper3D 发布世界生成模型 WorldGen。传统做法把整个场景作为一个模型生成,内容容易被合并成不可拆解的整体;WorldGen 的变化是把场景拆解为可单独操作的资产,同时保留它们之间的空间与物理关系,背景环境用 3D Gaussian Splatting 补全,整体可压缩至 2 到 3 分钟。打开 SimReady 模式后,系统会为每件资产补充碰撞体,并估计质量、摩擦系数、恢复系数等仿真所需的物理属性;生成的独立资产可进入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等 DCC 与实时引擎做二次创作。影眸此前凭自研场景级生成技术 CAST 拿下 SIGGRAPH 2025 最佳论文,今年 7 月与 Unity 中国达成合作,也是英伟达 Inception 计划成员,物理与并行仿真由谋先飞的 MotrixSim 引擎承担。
「可进入生产管线」目前只有厂商与这一篇中文报道支撑,没有公开基准、第三方评测或可复现的对比数据,生成质量、失败率、定价与开放范围均未披露。
来源:量子位
智谱把 GLM Coding Plan 的 token 订阅搬上天猫
智谱开出天猫旗舰店销售 GLM Coding Plan 的 token 订阅,据报道是上市大模型公司首次把核心 AI 产品摆上主流电商货架。
据 Pandaily 9 月 3 日报道,智谱开设天猫旗舰店,出售 GLM Coding Plan 的 token 订阅,报道称这是上市大模型公司第一次把核心 AI 产品放到主流电商平台销售。
目前只有这一篇报道,没有可对照的官方公告。定价档位、售卖形式、生效方式与销量均未披露,「首次」的说法也无法从公开材料独立核验。
来源:Pandaily
获取九凤最新的 AI 模型洞察与教程。
了解更多


