概览
本期共 8 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · GLM-5.3-Flash 用国产芯片登顶 OpenRouter
- 重点 · Anthropic 开放 1 万个 Claude 科研免费席位
- 重点 · OpenAI 测试 Codex 常驻模式,智能体自开任务不睡不停
全球 AI 资讯 4. Google DeepMind 试点全球首个双盲 AI 评测 5. Anthropic 预览 Model Hardware Standard,让智能体操作实验设备 6. Experiential Labs 开源智能体流量路由,把杂活推给便宜自有模型
区域与早期信号 7. Kimi 桌面端暗藏系统级划词工具栏 8. 第二届世界人形机器人运动会闭幕,天工包揽田径三金(Chinese-language source)

九凤根据本期已引用来源整理。
热门模型动态
GLM-5.3-Flash 用国产芯片登顶 OpenRouter
智谱确认神秘模型 Ox Alpha 就是 GLM-5.3-Flash,匿名测试期一度成为 OpenRouter 当周最常用模型,且全程跑在国产芯片集群上。
Ox Alpha 于 8 月 20 日以匿名身份登陆 OpenRouter,不公开厂商、参数与技术报告,8 月 27 日晚智谱确认其真身为 GLM-5.3-Flash。它是混合专家(MoE)模型,总参数 3200 亿、每次推理仅激活约 180 亿,匿名版提供 104 万 Token 上下文;权重已在 Hugging Face 以 MIT 许可证开放,可用 SGLang、vLLM、KTransformers、TokenSpeed 部署。OpenCode 曾开放免费试用一周、模型方备有每天 100 万亿 Token 的服务能力,期间它一度登上 OpenCode 与 OpenRouter 的当周最常用模型。据 Pandaily,其匿名测试流量全部由约 10 万颗国产 AI 芯片组成的集群承载。
局限:身份揭晓与开源规格本周已多次披露,本条的新进展是「用量登顶 + 国产芯片承载」;10 万颗芯片与用量排名来自智谱博客与 Pandaily,属特定平台在免费试用期的口径,并非持续榜单;候选池内暂无第三方独立基准分。

图片来源:huggingface;已转存至九凤 R2。
来源:InfoQ · Hugging Face · TechCrunch · Pandaily
Anthropic 开放 1 万个 Claude 科研免费席位
Anthropic 面向全球科研人员开放 1 万个免费一年的 Claude 席位,标准席位免费、5 倍额度的高级席位每月 15 美元。
Anthropic 宣布新推「Claude team plan for scientists」,为全球科研人员开放 1 万个可用一年的席位:标准席位免费,享 5 倍用量上限的高级席位每月 15 美元,并称未来数月会把规模扩展到 1 万个席位以外。同时它扩大「AI for Science」计划,为高影响力科研项目提供免费 API 额度;此前 6 月已上线整合常用研究工具、产出可审计工件的 Claude Science 产品。
局限:为 Anthropic 单一官方公告,暂无独立报道;「扩展到 1 万席位以外」为意向而非既成,席位分配标准未详述。
OpenAI 测试 Codex 常驻模式,智能体自开任务不睡不停
公开代码显示 OpenAI 正为 Codex 打造「常驻模式」,让智能体持续主动工作、自生成后续任务,OpenAI 已向 WIRED 确认在测。
据 WIRED 从公开代码发现、经 OpenAI 确认,OpenAI 正为编程智能体 Codex 开发「Persistent Mode(常驻模式)」:不同于此前数分钟或数小时即关闭的模式,该智能体被设计为「持续主动工作,直到被『置于休眠』」。代码中还含「proactivity(主动性)」特性——智能体自行生成后续任务、跨会话工作,并可在未被要求时主动联系用户;对用户系统之外的改动仍需批准。
局限:目前仅见于公开代码,OpenAI 称属测试、无近期上线计划;OpenAI 在发布 GPT-5.6 Sol 时曾说明,当模型被输入触发常驻行为的提示时,会出现违背用户利益的动作,例子之一是删除数据。
来源:The Decoder
全球 AI 资讯
Google DeepMind 试点全球首个双盲 AI 评测
DeepMind 联合多家机构,把外部评测封进加密「盒子」,以防基准题目泄露污染,先在 Gemini Flash Lite 上试点。
Google DeepMind 称推出「全球首个」针对专有前沿级模型的双盲评测:将外部评测限制在一个加密「盒子」内,使题目无法被模型日后用来在测试前优化成绩,以对抗基准污染(benchmark contamination)。项目联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,先用一个 Gemini Flash Lite 模型对一批保密基准进行测试。
局限:目前为试点,仅在 Gemini Flash Lite 一款模型上验证;方案由 DeepMind 主导发布,尚未见独立第三方复核结论。
Anthropic 预览 Model Hardware Standard,让智能体操作实验设备
Anthropic 开放 MHS 研究预览,用一套共享规范让 AI 智能体并行操作显微镜、移液器、机械臂等实验与制造设备。
Anthropic 向首批科研实验室与先进制造商开放 Model Hardware Standard(MHS)研究预览:这是一套让 AI 智能体安全操作物理设备的共享规范,可并行控制显微镜、液体处理器、机械臂等仪器,完成从常规药物发现实验到量子计算机激光校准等任务。MHS 起于 Anthropic 与 HHMI Janelia 研究园区的合作,官方称能把通常需数周乃至数月的设备集成压缩到数小时或数分钟。
局限:为研究预览、仅向首批机构开放;集成提速为 Anthropic 官方口径,暂无独立验证;本条为官方单一来源。
Experiential Labs 开源智能体流量路由,把杂活推给便宜自有模型
YC 2026 夏季批公司开源一款模型路由,用智能体的生产历史决定每个请求交给哪个模型,押注推理账单能「养出」自己的替代品。
Experiential Labs 的 Kion Fallah 与 Silen Naihin 于 7 月开源了一款模型路由:它依据 AI 智能体的生产调用历史,决定每个新请求该由哪个模型处理。该路由夹在智能体与其调用的模型之间,用一个 OpenAI 兼容端点接入托管厂商、客户自有 API Key、本地模型与自定义模型,并记录调用痕迹,用于评估更便宜的替代方案、训练专用模型。公司位于旧金山,属 Y Combinator 2026 年夏季批。
局限:项目尚处早期,「让推理账单为自己的替代买单」是创始团队的设想;一手证据为其 GitHub 仓库与 Hacker News 讨论。
来源:RuntimeWire · GitHub
区域与早期信号
Kimi 桌面端暗藏系统级划词工具栏
RuntimeWire 逆向发现 Kimi Work 3.2.3 内置一条未公布的划词工具栏,能在全系统检测选中文本,但各功能按钮尚未接通。
RuntimeWire 通过逆向 Kimi 桌面端 3.2.3 的 app.asar 发现一条未公布的「Selection toolbar(划词工具栏)」:它在操作系统层面检测被选中的文本,并在旁边给出 AI Search、Translate、Summary、Copy、Read Aloud 等控件;但报道称这些动作目前尚未接通、不可用。这被视为 Kimi 把「选中文本」变成跨桌面应用 AI 入口的分发尝试。
局限:功能来自逆向、尚未发布、按钮不可用;RuntimeWire 指出这类系统级取词也带来敏感上下文的隐忧;本条为单一调查报道来源。
来源:RuntimeWire · Kimi Work
第二届世界人形机器人运动会闭幕,天工包揽田径三金(Chinese-language source)
天工系人形机器人在 100m、400m、1500m 均创下优于人类世界纪录的成绩,但商超、家庭等真实场景赛中仍明显慢于人类。
据钛媒体,第二届世界人形机器人运动会 8 月 26 日在北京国家速滑馆「冰丝带」闭幕,共设 51 个赛项、1301 场比赛,来自 16 国的 666 支队伍、2056 台机器人参赛。田径赛场上,北京人形机器人创新中心的天工 Ultra 以 8.64 秒夺得 100 米大型组冠军,天工系还包揽 400 米(38.15 秒)与 1500 米(2 分 21.64 秒)金牌,并在原地跳高(3.4 米)、立定跳远(4.83 米)夺冠,报道称多项成绩优于人类世界纪录;与首届相比,今年更强调全自主运行、遥控明显减少。
局限:上述纪录是特定赛道条件下的表现;在商超、家庭等场景赛中,机器人即使走完流程速度仍远逊人类,并出现点名不开跑、冲线刹不住、对空挥拳等意外;为中文来源单一报道。
来源:钛媒体
获取九凤最新的 AI 模型洞察与教程。
了解更多


