概览
本期共 10 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · 千问 LiveTranslate 把同传平均滞后压到 2.3 秒
- 重点 · 阶跃 Step 5 Preview 进入 AA 开源前三,单任务成本为 Opus 5 的八分之一
- 重点 · 开放权重模型拿下 Vercel AI Gateway 78.4% 的 token 量
- Opus 5.2 与疑似 Gemini 4 Pro 未经官宣就在灰度
全球 AI 资讯
- Runway 想把视频生成做成可实时干预的直播流
- 微软开源 TauGrid,把 GPU 集群调度收成一次 Helm 安装
- 微软与伊利诺伊大学用会犯错的模拟学生训练 AI 家教
- Google 发布 Kotlin 版智能体开发套件 1.0,功能追平 Python
区域与早期信号
- APUS 开源复现 Jev,本地 9B 模型做浏览器点选决策
- Moz1 轮式人形机器人进了宁德时代和京东的产线

九凤根据本期已引用来源整理。
热门模型动态
01/10
千问 LiveTranslate 把同传平均滞后压到 2.3 秒
阿里千问放出实时同声传译模型,讲话人还没说完就返回译文文本与语音,托管 API 已可调用。
Qwen3.8-LiveTranslate 接收实时语音,可选附带视频帧,一边听一边输出翻译。核心改动是新的 Interleave 架构,延迟指标 LAAL(长度自适应平均滞后)从上一代的 2.8 秒降到 2.3 秒;这一版还新增了实时说话人分离、双语同步显示和长上下文消歧。
- 延迟:LAAL 由 2.8 秒降至 2.3 秒,LAAL 衡量的是译文落后讲话人的长度自适应平均值
- 语种:60 种
- 输入:实时语音,可选视频帧
- 可用性:托管 API,已在阿里云 Model Studio 与 QwenCloud 上线,模型名 qwen3.8-livetranslate-flash-realtime,走 WebSocket
局限:目前只有托管 API 一种形态,报道写明的是可部署形式为托管 API,没有提到开放权重或自托管方案;忠实度、流畅度、简洁度的改善只有定性描述,来源没有给出对照分数;LAAL 是延迟指标,滞后变短不等于译得更准。
来源:MarkTechPost · QwenCloud 模型页 · LAAL 论文
02/10
阶跃 Step 5 Preview 进入 AA 开源前三,单任务成本为 Opus 5 的八分之一
600B 总参、27B 激活的稀疏 MoE,官方称 10 月 15 日正式开源。
阶跃星辰 9 月 20 日发布新一代旗舰基座模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作与金融场景。在 Artificial Analysis Intelligence Index 上取得 44 分,位列全球开源模型前三,并进入智能水平与单任务成本的帕累托前沿。
- 架构:稀疏 MoE,总参数 600B、激活参数 27B
- 上下文:100 万 Token,原生支持文本与视觉输入
- 成本:单任务成本为 Claude Opus 5 的 1/8
- 开源:官方称 10 月 15 日正式开源
局限:现在放出的是 Preview,权重要等到 10 月 15 日;雷锋网写的能力结论来自「公开和内部评估」,其中内部评估部分外界无法复核;爱范儿的实测是 Three.js 五子棋、快艇游戏、热气球场景、尼亚加拉瀑布和网页操作系统这类生成案例的主观观感,没有跑分。
03/10
开放权重模型拿下 Vercel AI Gateway 78.4% 的 token 量
Vercel 创始人放出的单日快照里,开放模型的 token 量是闭源模型的三倍多。
Vercel 创始人兼 CEO Guillermo Rauch 在 9 月 19 日的每日快照中给出网关的 token 构成,Aligned News 于 9 月 20 日转述该数据。
| 模型类型 | 网关 token 占比(%) |
|---|---|
| 开放权重 | 78.4 |
| 闭源 | 21.6 |
局限:这是 Vercel 一家网关的单日快照,由 Rauch 本人在 X 上发布,没有第三方核对;报道自己也点明 Vercel 是从「模型更容易替换」中获益的一方,正把网关定位成 AI 应用与模型之间的控制面。
来源:RuntimeWire · Aligned News 快照
04/10
Opus 5.2 与疑似 Gemini 4 Pro 未经官宣就在灰度
新一代前沿模型先被接进现有产品和盲测平台,用户在不知情的情况下提供测试样本。
9 月 17 日晚,Anthropic 切断灰度通道,一批原本被路由到新模型的账号归零,开发者社区集中讨论;一天后通道恢复,覆盖范围从 Claude Code 扩大到 Chat 和 Cowork。同期第三方盲测平台 Arena 上出现代号 gemini-3.8-flash 的模型,抽到它的用户发现它能画出带完整蹬踏动作的鹈鹕、用十分钟输出数千行代码生成一张 PS5 矢量图、搭出可在浏览器实时旋转的体素宝塔,社区据此判断是谷歌下一代旗舰 Gemini 4 Pro,内部代号 Argon,该名称随后被改为 gemini-3.7-flash。更早三天,有开发者抓取接口请求发现,Claude Code 界面标注的是 Opus 5,后端模型标识已指向 5.2;Opus 5 发布于 7 月 24 日,中间没有 5.1。
作为对照,公开发布一代模型的成本并不低:GPT-6 Astra 动用得州 Stargate 基地超过 10 万张 GPU 完成训练,API 定价为每百万输入 10 美元、每百万输出 50 美元,是上一代 Sol 的 2.5 倍。
局限:这些灰度模型没有模型卡、没有 API 标识、没有定价表,Anthropic 未作任何说明;gemini-3.8-flash 的身份是社区根据输出表现反推的,谷歌没有确认;相关证据来自开发者抓包与盲测观察,随时可能被厂商回退。
来源:钛媒体
全球 AI 资讯
05/10
Runway 想把视频生成做成可实时干预的直播流
不再是输入提示词等成片,而是边描述边把视频流出来。
Runway 公开了实时视频生成方向的研究进展。目前的视频模型分成几个割裂的步骤:输入提示词、等几秒到几分钟、拿到成片,结果不对就重来。Runway 说用户反复反映最耗时间的正是生成和返工,公司想把「到第一帧的时间」压到最短,然后随用户描述持续输出视频流。底座是 GWM-1,Runway 在 2025 年 12 月发布的首个通用世界模型,构建在 Gen-4.5 之上、逐帧生成,可以接受镜头运动、机器人指令或音频作为控制信号。
报道给出的唯一延迟数字是设计目标:3 月与英伟达合作、跑在 Vera Rubin 平台上的实时模型,目标是 100 毫秒内出第一帧。今年 3 月 Runway 以 Runway Characters 首次讨论过这条路线并在 X 上放出研究预览;几周前展示的 Solaris 则用 Gen-4.5 逐帧生成用户界面,能响应点击与语音输入。
局限:这仍是研究阶段的预览,没有公布上线时间、定价或可用区域;100 毫秒是设计目标,不是实测结果。
来源:The Decoder · Runway 研究预览
06/10
微软开源 TauGrid,把 GPU 集群调度收成一次 Helm 安装
研究人员不学 Kubernetes 也能提交训练作业,平台团队不用再自己拼装粘合层。
TauGrid 是一个云原生平台,用于在带 GPU 的 Kubernetes 集群上管理、调度与监控 AI 工作负载,覆盖数据准备、分布式训练、微调到推理。它集成 Kueue(排队与配额管理)、KubeRay(编排)、GPU 节点健康监控与可观测性,原本要平台团队自己维护的提交脚本、队列封装器、健康检查和结果拉取,改成一次 Helm 安装、权责边界清晰。工作负载用 tau.yaml 定义、用 tau run 提交,命令会校验配置并创建 Kubernetes Job 或 KubeRay RayJob,再由 Kueue 按剩余配额和优先级排队;作业失败可以从检查点恢复,运行期间的状态、日志与实验证据都会留存以便复现和诊断。代码库主要用 Go 编写。
局限:TauGrid 仍在开发中,路线图里列为「规划中」的功能包括多租户工作区、RBAC 与配额、PyTorch DDP/FSDP 与 DeepSpeed、LoRA/QLoRA 工作流支持、数据集生命周期管理和多集群/多云执行——这些现在都还没有;运行环境要求 Kubernetes 1.30+、kubectl 和 Helm 3.0 及以上;同类方案已有 Kubeflow 和 NVIDIA Run:AI。

图片来源:GitHub;已转存至九凤 R2。
来源:InfoQ 中文 · TauGrid 路线图
07/10
微软与伊利诺伊大学用会犯错的模拟学生训练 AI 家教
给每个学生建一个数字复刻,AI 家教不必等真人反馈就能迭代。
StudentSim 的做法是:即使某个学生留下的作业记录很少,也单独为他构建一个数字复刻,由这些复刻代替真人提供快速反馈。作者在论文里写,用一大批多样化的真实学生来训练 AI 家教「成本高昂且耗时」,这也是家教类系统的改进落后于模型进步的原因。研究在覆盖 60 名学生、跨国际象棋等科目的测试中验证了这套方法,代码已放在 GitHub 的 microsoft/StudentSim。
论文摘要给出的国际象棋一科对照分数:
| 方法 | 行为拟合度 F | 响应度 R |
|---|---|---|
| StudentSim | 0.51 | 0.91 |
| GPT-5.4 | 0.23 | 0.72 |
| Maia2 | 0.45 | 0.27 |
局限:上面这组分数只覆盖国际象棋一科;来源没有给出 AI 家教因此改进了多少的具体分数;这项工作目前是论文加代码,不是可直接部署的产品。
来源:The Decoder · 论文 · GitHub
08/10
Google 发布 Kotlin 版智能体开发套件 1.0,功能追平 Python
ADK for Kotlin 补齐与 Python 版的功能差距,并支持端侧模型。
Google 发布 Agent Development Kit(ADK)for Kotlin 1.0,定位是可用于生产的智能体开发框架,覆盖 Kotlin、Android 与 JVM/服务端应用。这一版把 Kotlin 带到与 Python 版功能对等的水平,并支持端侧 AI。
局限:报道只给了版本定位与能力范围,没有公布性能数据、支持的模型清单或许可证信息;「功能对等」是官方口径,报道未列出逐项对照。
来源:InfoQ
区域与早期信号
09/10
APUS 开源复现 Jev,本地 9B 模型做浏览器点选决策
按公开文档反推的第三方复现,打包成离线可跑的浏览器自动化技能,MIT 协议开放。
9 月 19 日,APUS(麒麟合盛网络技术股份有限公司)旗下 AI 实验室公布了针对 Jev 的独立开源复现,封装成开箱即用的 Agent Skill fast-browser-use,支持 macOS、Linux、Windows,既能在 GPU 服务器上跑,也能在没有 GPU 的 Mac 和 PC 上跑,全部代码按 MIT 协议开放。实现上复现了单 Token logits 快速决策、跳过自回归解码,以及 KV-Cache 广播与并发批量评估;在浏览器自动化场景里,把页面上真实可见、可交互的元素整理成带编号的候选动作集合,由本地运行的 Qwen3.5-9B 通过单次前向计算直接决定点哪里、选哪个,从机制上排掉了模型生成错误选择器或格式幻觉的可能。
APUS 公布的实测数据:在一台 Apple M2 Pro 消费级笔记本上全程离线完成真实维基百科检索任务,中位耗时约 18 秒,表单填报与站内导航约 3 秒,单任务模型打分 4 次,零云端调用、零 API 费用。
局限:这是按 Jev 公开文档反推的第三方复现,不是官方实现,TypeSafe 未公开 Jev 的架构;上面的耗时全部是 APUS 自测,没有第三方复核,APUS 自己也点明 Jev 此前的性能数据同样来自官方自测;目前只有中文媒体单一来源。
来源:量子位
10/10
Moz1 轮式人形机器人进了宁德时代和京东的产线
创始人把自然语言驱动的机器人「大脑」的节点预期放在 2027 年中。
Pandaily 报道,Spirit AI 的 Moz1 轮式人形机器人已经部署在宁德时代(CATL)与京东的产线上;创始人高阳预计,自然语言驱动的机器人「大脑」会在 2027 年年中迎来类似 GPT-3 的时刻。
局限:这是发布后的摘要式覆盖,没有给出部署台数、工位类型、节拍或验收指标;2027 年中是创始人的个人预测,不是产品路线图承诺;目前只有这一篇报道,没有可核的一手公告。
来源:Pandaily
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

