AI 热点资讯

Qwen-Audio-3.1 实时语音模型发布,价格降约 85%

核心速览
  • •千问发布 Qwen-Audio-3.1 语音模型栈,实时模型支持 262K 上下文并降价约 85%
  • •Google Research 开源 RRSI 智能体自改进框架
  • •AMD 以 82 亿美元收购 World Labs
  • •另有 vLLM-Omni 图生视频部署、Mistral 慕尼黑中心与豆包出行入口等动态。
jiufeng
2026年9月29日
15 分钟阅读
本文目录

概览

本期共 8 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Qwen-Audio-3.1 实时语音模型发布,价格降约 85%

全球 AI 资讯

  1. 重点 · Google Research 开源 RRSI:智能体改自己的 harness,不改权重
  2. 重点 · 同一个 vLLM-Omni 容器,先出图再转视频
  3. AWS 用 Nova Act 智能体做合成监控,替代脆弱的 UI 脚本
  4. Mistral 慕尼黑中心开张,与 BMW、Siemens Energy 合作

区域与早期信号

  1. AMD 以 82 亿美元收购 World Labs,李飞飞将任首席科学家
  2. 谷歌开始在安卓手机上停用 Google Assistant
  3. 豆包首页上线「出行用豆包」,接入打车、酒店与本地生活
2026-09-29 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

01/08

Qwen-Audio-3.1 实时语音模型发布,价格降约 85%

千问推出由 5 个模型组成的 Qwen-Audio-3.1 语音栈,主力是全双工实时模型。Realtime 降价约 85%,ASR 最高降 95%。

千问团队发布的 Qwen-Audio-3.1 覆盖 ASR、TTS 和实时交互三类任务。主力模型 Qwen-Audio-3.1-Realtime 是全双工语音模型,面向需要调用工具的语音智能体,训练目标包括推理、调用工具,以及判断「什么时候该开口」。在 τ-Voice 改编版评测上,任务成功率从 78.4% 提到 82.0%。

  • 接入方式:qwen-audio-3.1-realtime-plus 已在 QwenCloud 上线,通过 WebSocket 接入
  • 上下文:262K token,最大输入 245K、最大输出 16K
  • 默认限额:每分钟 60 次请求、10 万 token
  • 功能:函数调用、联网搜索、结构化输出、上下文缓存、微调
  • 训练:用 GRPO 做强化学习。评分依次检查终态、是否只做了允许的写操作、行为断言,回复再流畅也救不回终态检查失败
计费项美元 / 每百万 token
音频输入6.4
文本输入0.8
文本与音频输出24(输出文本不计费)

同批降价幅度:Realtime 约 85%,TTS 约 70%,ASR 最高 95%。配套的 Qwen-Audio-3.1-ASR-Flash-Filetrans 面向离线文件转写。

局限:目前只以托管 API 形式提供,本次没有宣布开放权重。τ-Voice 成绩来自改编版评测,数据出自千问自己的发布材料,暂无第三方复测。

来源:QwenCloud 模型页 · MarkTechPost · The Decoder

全球 AI 资讯

02/08

Google Research 开源 RRSI:智能体改自己的 harness,不改权重

RRSI 让智能体在权重冻结的前提下重写自己的提示词、工具和记忆,并给改进循环加上约束,避免只在优化集上涨分。

RRSI(Regularized Recursive Self-Improvement)由 Google Cloud AI Research 与 UNC-Chapel Hill、Stanford、圣路易斯华盛顿大学联合发布。智能体可以改写自己的 harness,包括提示词、工具、记忆、控制流和子智能体,模型权重始终不动。论文把 harness 进化循环的失败归为三类:拟合特定基准、追逐噪声、复杂度不断堆积。RRSI 为此加了泄漏评审(leakage critic)和噪声下限等约束。

  • 许可:代码 Apache 2.0
  • 环境:Python 3.10+,接受任意 LiteLLM 模型字符串
  • 默认策略模型:Vertex AI 上的 Claude Opus 4.8
评测变化
SWE-bench Verified(不参与选择)82.0% → 83.8%
JobBench(分布外)+4.7 分
GDPval(分布外)+3.5 分
APEX-Agents(分布外)+3.7 分
Harvey LAB 留出集+2.3 分

作者称 6 个留出集全部提升。

局限:官方定位是研究框架。以上成绩来自作者自己的论文,默认配置依赖 Vertex AI 上的 Claude Opus 4.8,换用其他策略模型时的收益需要自行验证。

GitHub - google-research/rrsi

图片来源:GitHub;已转存至九凤 R2。

来源:GitHub: google-research/rrsi · arXiv 论文 · MarkTechPost

03/08

同一个 vLLM-Omni 容器,先出图再转视频

AWS 教程演示用一个 vLLM-Omni 深度学习容器部署两个端点:FLUX.2-klein-4B 实时出图,Wan2.1-VACE-1.3B 异步把图转成视频。

这是 AWS vLLM-Omni 系列的第二篇。文本提示先发给实时端点,由 FLUX.2-klein-4B 生成静态图。再把图片和运动提示交给异步端点,由 Wan2.1-VACE-1.3B 生成视频,成片 MP4 从 Amazon S3 取回,另附可选的 Streamlit 界面。vLLM-Omni 把 vLLM 从文本扩展到音频、图像和视频,对外提供 OpenAI 兼容 API;AWS 的容器在此基础上为 SageMaker AI 加了路由中间件。

局限:这是部署教程,不是新服务发布。示例固定使用 ml.g6.xlarge 和 ml.g6e.xlarge 实例类型;视频端点走异步推理,成片需要从 S3 取回。

来源:AWS Machine Learning Blog

04/08

AWS 用 Nova Act 智能体做合成监控,替代脆弱的 UI 脚本

AWS 发布一套基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的合成监控方案,让智能体按计划走一遍关键用户流程,并附完整示例代码。

合成监控是用自动化事务模拟真实用户旅程,按计划持续验证登录、购买、表单提交等关键流程,在用户碰到问题之前发现性能下降或界面交互故障。AWS 这篇文章介绍了由智能体驱动的做法,目标是摆脱容易失效的 UI 脚本,改为托管的、更稳健的旅程验证,并给出架构和设计模式。示例仓库用 EventBridge Scheduler 每 10 分钟执行一次监控;AWS 称 Nova Act 在早期企业案例中的浏览器流程准确率超过 90%。

文中列举的场景包括:电商的商品搜索、价格与库存展示、购物车和结账确认;金融服务的账户登录与交易流程;旅游酒店的预订流程;SaaS 的注册与订阅升级;医疗机构的预约挂号门户。

局限:这是 AWS 官方的架构与示例文章,不是新服务发布;90% 以上的准确率是 AWS 对早期企业案例的自述,暂无独立评测,效果需要按自己的站点实测。

来源:AWS Machine Learning Blog · GitHub 示例仓库

05/08

Mistral 慕尼黑中心开张,与 BMW、Siemens Energy 合作

Mistral 9 月 28 日开设慕尼黑中心,研究团队专注物理 AI 和工业 AI,并配备直接服务企业客户的应用工程师。

Mistral 称,德国是欧盟最大的工业经济体,慕尼黑中心面向汽车、能源、航空航天和先进制造等行业,数据主权是这次布局的重点。公告点名了几项合作:

  • BMW:在慕尼黑合作碰撞仿真与工程 AI
  • Siemens Energy:合作工业 AI 应用
  • 慕尼黑工业大学(TUM):研究合作,使用其风洞做汽车空气动力学数字孪生
  • 团队:收购 Emmi AI 后加入的 30 多名研究人员

局限:本条只引用 Mistral 自己的公告,合作内容与进展均为官方表述,暂无独立报道核实。

来源:Mistral AI

区域与早期信号

06/08

AMD 以 82 亿美元收购 World Labs,李飞飞将任首席科学家

据量子位报道,世界模型公司 World Labs 将被 AMD 全面收购,交割后李飞飞出任 AMD 执行副总裁兼首席科学家。

量子位报道称,这笔收购作价 82 亿美元(约合人民币 550 亿元),李飞飞将直接向苏姿丰汇报。交割完成后,联合创始人 Justin Johnson 与 Ben Mildenhall 将带队并入 AMD,组建前沿 AI 研究组织。World Labs 于 2026 年 2 月 18 日完成 10 亿美元 C 轮融资,投后估值 54 亿美元,AMD Ventures 参与了此前多轮投资。World Labs 在 9 月初发布了从头预训练的多模态世界模型 Atlas,可从一张到数十张图像重建场景并生成新视角。

局限:交易尚未交割。作价与人事安排出自中文媒体转述,本条暂未附上 AMD 原始公告链接;Atlas 的能力描述来自 World Labs 自己,暂无独立评测。

来源:量子位

07/08

谷歌开始在安卓手机上停用 Google Assistant

此前宣布的切换正在落地:大批安卓用户反馈手机上已无法使用 Google Assistant,Gemini 应用菜单里的「切换到 Google Assistant」选项也消失了。

据 IT之家援引 Android Authority 报道,谷歌上个月开始向用户发邮件,告知手机端 Google Assistant 即将停用。这次变化影响手机,以及智能手表、Android Auto、耳机等手机配件。谷歌此前表示,智能音箱和智能显示器仍支持 Google Assistant。

局限:停用进度来自用户反馈和媒体转述。报道提到,部分用户认为 Gemini 仍有幻觉问题,而且缺少一部分离线语音指令。

来源:IT之家

08/08

豆包首页上线「出行用豆包」,接入打车、酒店与本地生活

日活超 1.68 亿的豆包 App 在首页输入框上方新增「出行用豆包」入口,与「对话」「帮我写作」并列。

入口内分为地图导航、交通出行、酒店住宿、吃喝玩乐四个模块。据钛媒体梳理,地图用的是百度地图,打车接入曹操出行(双方本月中旬在北京、杭州、苏州首批上线 AI 打车),酒店民宿跳转抖音酒旅,餐饮娱乐直连抖音本地生活。豆包方面回应称「商家无法花钱影响推荐和排序」。

渠道酒店订单综合费率
豆包入口约 12%(11.4% 服务费 + 0.6% 支付费)
抖音主站8%
携程、美团约 15%

局限:这是钛媒体的分析稿,费率与合作方信息都出自该文。文章本身也指出,豆包面对的是美团、滴滴、携程多年积累的履约与供应链壁垒。

来源:钛媒体

用 JIUFENG 自己生成一张

在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。

免费生成图片