AI 热点资讯

千问 LiveTranslate 发布,同传延迟降到 2.3 秒

核心速览
  • •千问发布实时同传模型 Qwen3.8-LiveTranslate,平均滞后从 2.8 秒降到 2.3 秒、覆盖 60 种语言
  • •阶跃 Step 5 Preview 以 600B 总参、27B 激活进入 AA 开源前三
  • •开放权重模型拿下 Vercel 网关 78.4% 的 token 量
  • •Opus 5.2 与疑似 Gemini 4 Pro 未经官宣已在灰度。
jiufeng
2026年9月20日
18 分钟阅读
本文目录

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · 千问 LiveTranslate 把同传平均滞后压到 2.3 秒
  2. 重点 · 阶跃 Step 5 Preview 进入 AA 开源前三,单任务成本为 Opus 5 的八分之一
  3. 重点 · 开放权重模型拿下 Vercel AI Gateway 78.4% 的 token 量
  4. Opus 5.2 与疑似 Gemini 4 Pro 未经官宣就在灰度

全球 AI 资讯

  1. Runway 想把视频生成做成可实时干预的直播流
  2. 微软开源 TauGrid,把 GPU 集群调度收成一次 Helm 安装
  3. 微软与伊利诺伊大学用会犯错的模拟学生训练 AI 家教
  4. Google 发布 Kotlin 版智能体开发套件 1.0,功能追平 Python

区域与早期信号

  1. APUS 开源复现 Jev,本地 9B 模型做浏览器点选决策
  2. Moz1 轮式人形机器人进了宁德时代和京东的产线
2026-09-20 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

01/10

千问 LiveTranslate 把同传平均滞后压到 2.3 秒

阿里千问放出实时同声传译模型,讲话人还没说完就返回译文文本与语音,托管 API 已可调用。

Qwen3.8-LiveTranslate 接收实时语音,可选附带视频帧,一边听一边输出翻译。核心改动是新的 Interleave 架构,延迟指标 LAAL(长度自适应平均滞后)从上一代的 2.8 秒降到 2.3 秒;这一版还新增了实时说话人分离、双语同步显示和长上下文消歧。

  • 延迟:LAAL 由 2.8 秒降至 2.3 秒,LAAL 衡量的是译文落后讲话人的长度自适应平均值
  • 语种:60 种
  • 输入:实时语音,可选视频帧
  • 可用性:托管 API,已在阿里云 Model Studio 与 QwenCloud 上线,模型名 qwen3.8-livetranslate-flash-realtime,走 WebSocket

局限:目前只有托管 API 一种形态,报道写明的是可部署形式为托管 API,没有提到开放权重或自托管方案;忠实度、流畅度、简洁度的改善只有定性描述,来源没有给出对照分数;LAAL 是延迟指标,滞后变短不等于译得更准。

来源:MarkTechPost · QwenCloud 模型页 · LAAL 论文

02/10

阶跃 Step 5 Preview 进入 AA 开源前三,单任务成本为 Opus 5 的八分之一

600B 总参、27B 激活的稀疏 MoE,官方称 10 月 15 日正式开源。

阶跃星辰 9 月 20 日发布新一代旗舰基座模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作与金融场景。在 Artificial Analysis Intelligence Index 上取得 44 分,位列全球开源模型前三,并进入智能水平与单任务成本的帕累托前沿。

  • 架构:稀疏 MoE,总参数 600B、激活参数 27B
  • 上下文:100 万 Token,原生支持文本与视觉输入
  • 成本:单任务成本为 Claude Opus 5 的 1/8
  • 开源:官方称 10 月 15 日正式开源

局限:现在放出的是 Preview,权重要等到 10 月 15 日;雷锋网写的能力结论来自「公开和内部评估」,其中内部评估部分外界无法复核;爱范儿的实测是 Three.js 五子棋、快艇游戏、热气球场景、尼亚加拉瀑布和网页操作系统这类生成案例的主观观感,没有跑分。

来源:雷锋网 · 爱范儿

03/10

开放权重模型拿下 Vercel AI Gateway 78.4% 的 token 量

Vercel 创始人放出的单日快照里,开放模型的 token 量是闭源模型的三倍多。

Vercel 创始人兼 CEO Guillermo Rauch 在 9 月 19 日的每日快照中给出网关的 token 构成,Aligned News 于 9 月 20 日转述该数据。

模型类型网关 token 占比(%)
开放权重78.4
闭源21.6

局限:这是 Vercel 一家网关的单日快照,由 Rauch 本人在 X 上发布,没有第三方核对;报道自己也点明 Vercel 是从「模型更容易替换」中获益的一方,正把网关定位成 AI 应用与模型之间的控制面。

来源:RuntimeWire · Aligned News 快照

04/10

Opus 5.2 与疑似 Gemini 4 Pro 未经官宣就在灰度

新一代前沿模型先被接进现有产品和盲测平台,用户在不知情的情况下提供测试样本。

9 月 17 日晚,Anthropic 切断灰度通道,一批原本被路由到新模型的账号归零,开发者社区集中讨论;一天后通道恢复,覆盖范围从 Claude Code 扩大到 Chat 和 Cowork。同期第三方盲测平台 Arena 上出现代号 gemini-3.8-flash 的模型,抽到它的用户发现它能画出带完整蹬踏动作的鹈鹕、用十分钟输出数千行代码生成一张 PS5 矢量图、搭出可在浏览器实时旋转的体素宝塔,社区据此判断是谷歌下一代旗舰 Gemini 4 Pro,内部代号 Argon,该名称随后被改为 gemini-3.7-flash。更早三天,有开发者抓取接口请求发现,Claude Code 界面标注的是 Opus 5,后端模型标识已指向 5.2;Opus 5 发布于 7 月 24 日,中间没有 5.1。

作为对照,公开发布一代模型的成本并不低:GPT-6 Astra 动用得州 Stargate 基地超过 10 万张 GPU 完成训练,API 定价为每百万输入 10 美元、每百万输出 50 美元,是上一代 Sol 的 2.5 倍。

局限:这些灰度模型没有模型卡、没有 API 标识、没有定价表,Anthropic 未作任何说明;gemini-3.8-flash 的身份是社区根据输出表现反推的,谷歌没有确认;相关证据来自开发者抓包与盲测观察,随时可能被厂商回退。

来源:钛媒体

全球 AI 资讯

05/10

Runway 想把视频生成做成可实时干预的直播流

不再是输入提示词等成片,而是边描述边把视频流出来。

Runway 公开了实时视频生成方向的研究进展。目前的视频模型分成几个割裂的步骤:输入提示词、等几秒到几分钟、拿到成片,结果不对就重来。Runway 说用户反复反映最耗时间的正是生成和返工,公司想把「到第一帧的时间」压到最短,然后随用户描述持续输出视频流。底座是 GWM-1,Runway 在 2025 年 12 月发布的首个通用世界模型,构建在 Gen-4.5 之上、逐帧生成,可以接受镜头运动、机器人指令或音频作为控制信号。

报道给出的唯一延迟数字是设计目标:3 月与英伟达合作、跑在 Vera Rubin 平台上的实时模型,目标是 100 毫秒内出第一帧。今年 3 月 Runway 以 Runway Characters 首次讨论过这条路线并在 X 上放出研究预览;几周前展示的 Solaris 则用 Gen-4.5 逐帧生成用户界面,能响应点击与语音输入。

局限:这仍是研究阶段的预览,没有公布上线时间、定价或可用区域;100 毫秒是设计目标,不是实测结果。

来源:The Decoder · Runway 研究预览

06/10

微软开源 TauGrid,把 GPU 集群调度收成一次 Helm 安装

研究人员不学 Kubernetes 也能提交训练作业,平台团队不用再自己拼装粘合层。

TauGrid 是一个云原生平台,用于在带 GPU 的 Kubernetes 集群上管理、调度与监控 AI 工作负载,覆盖数据准备、分布式训练、微调到推理。它集成 Kueue(排队与配额管理)、KubeRay(编排)、GPU 节点健康监控与可观测性,原本要平台团队自己维护的提交脚本、队列封装器、健康检查和结果拉取,改成一次 Helm 安装、权责边界清晰。工作负载用 tau.yaml 定义、用 tau run 提交,命令会校验配置并创建 Kubernetes Job 或 KubeRay RayJob,再由 Kueue 按剩余配额和优先级排队;作业失败可以从检查点恢复,运行期间的状态、日志与实验证据都会留存以便复现和诊断。代码库主要用 Go 编写。

局限:TauGrid 仍在开发中,路线图里列为「规划中」的功能包括多租户工作区、RBAC 与配额、PyTorch DDP/FSDP 与 DeepSpeed、LoRA/QLoRA 工作流支持、数据集生命周期管理和多集群/多云执行——这些现在都还没有;运行环境要求 Kubernetes 1.30+、kubectl 和 Helm 3.0 及以上;同类方案已有 Kubeflow 和 NVIDIA Run:AI。

taugrid/ROADMAP.md at main · Azure/taugrid

图片来源:GitHub;已转存至九凤 R2。

来源:InfoQ 中文 · TauGrid 路线图

07/10

微软与伊利诺伊大学用会犯错的模拟学生训练 AI 家教

给每个学生建一个数字复刻,AI 家教不必等真人反馈就能迭代。

StudentSim 的做法是:即使某个学生留下的作业记录很少,也单独为他构建一个数字复刻,由这些复刻代替真人提供快速反馈。作者在论文里写,用一大批多样化的真实学生来训练 AI 家教「成本高昂且耗时」,这也是家教类系统的改进落后于模型进步的原因。研究在覆盖 60 名学生、跨国际象棋等科目的测试中验证了这套方法,代码已放在 GitHub 的 microsoft/StudentSim。

论文摘要给出的国际象棋一科对照分数:

方法行为拟合度 F响应度 R
StudentSim0.510.91
GPT-5.40.230.72
Maia20.450.27

局限:上面这组分数只覆盖国际象棋一科;来源没有给出 AI 家教因此改进了多少的具体分数;这项工作目前是论文加代码,不是可直接部署的产品。

来源:The Decoder · 论文 · GitHub

08/10

Google 发布 Kotlin 版智能体开发套件 1.0,功能追平 Python

ADK for Kotlin 补齐与 Python 版的功能差距,并支持端侧模型。

Google 发布 Agent Development Kit(ADK)for Kotlin 1.0,定位是可用于生产的智能体开发框架,覆盖 Kotlin、Android 与 JVM/服务端应用。这一版把 Kotlin 带到与 Python 版功能对等的水平,并支持端侧 AI。

局限:报道只给了版本定位与能力范围,没有公布性能数据、支持的模型清单或许可证信息;「功能对等」是官方口径,报道未列出逐项对照。

来源:InfoQ

区域与早期信号

09/10

APUS 开源复现 Jev,本地 9B 模型做浏览器点选决策

按公开文档反推的第三方复现,打包成离线可跑的浏览器自动化技能,MIT 协议开放。

9 月 19 日,APUS(麒麟合盛网络技术股份有限公司)旗下 AI 实验室公布了针对 Jev 的独立开源复现,封装成开箱即用的 Agent Skill fast-browser-use,支持 macOS、Linux、Windows,既能在 GPU 服务器上跑,也能在没有 GPU 的 Mac 和 PC 上跑,全部代码按 MIT 协议开放。实现上复现了单 Token logits 快速决策、跳过自回归解码,以及 KV-Cache 广播与并发批量评估;在浏览器自动化场景里,把页面上真实可见、可交互的元素整理成带编号的候选动作集合,由本地运行的 Qwen3.5-9B 通过单次前向计算直接决定点哪里、选哪个,从机制上排掉了模型生成错误选择器或格式幻觉的可能。

APUS 公布的实测数据:在一台 Apple M2 Pro 消费级笔记本上全程离线完成真实维基百科检索任务,中位耗时约 18 秒,表单填报与站内导航约 3 秒,单任务模型打分 4 次,零云端调用、零 API 费用。

局限:这是按 Jev 公开文档反推的第三方复现,不是官方实现,TypeSafe 未公开 Jev 的架构;上面的耗时全部是 APUS 自测,没有第三方复核,APUS 自己也点明 Jev 此前的性能数据同样来自官方自测;目前只有中文媒体单一来源。

来源:量子位

10/10

Moz1 轮式人形机器人进了宁德时代和京东的产线

创始人把自然语言驱动的机器人「大脑」的节点预期放在 2027 年中。

Pandaily 报道,Spirit AI 的 Moz1 轮式人形机器人已经部署在宁德时代(CATL)与京东的产线上;创始人高阳预计,自然语言驱动的机器人「大脑」会在 2027 年年中迎来类似 GPT-3 的时刻。

局限:这是发布后的摘要式覆盖,没有给出部署台数、工位类型、节拍或验收指标;2027 年中是创始人的个人预测,不是产品路线图承诺;目前只有这一篇报道,没有可核的一手公告。

来源:Pandaily

用 JIUFENG 自己生成一张

在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。

免费生成图片