AI 热点资讯

Qwen-Drive 1.0 发布:一个模型兼做驾驶系统与座舱助手

核心速览
  • •阿里 Qwen 团队发布 Qwen-Drive 1.0,一个模型兼做驾驶系统与座舱助手,仿真偏离路面率从 24% 降到 12%
  • •本期还有 NVIDIA 为 MiniMax H3 做的 1.653 秒推理栈、GPT-6 Astra 从频谱图认声音、OpenAI 代码库现托管智能体服务,以及三星人形机器人与联想 RTX Spark 笔记本等区域信号。
jiufeng
2026年9月8日
24 分钟阅读
本文目录

概览

本期共 11 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Qwen-Drive 1.0 发布:一个模型兼做驾驶系统与座舱助手
  2. 重点 · MiniMax H3 在八张 B300 上 1.653 秒生成五秒视频
  3. 重点 · GPT-6 Astra 零样本从频谱图认出狗吠与光剑声

全球 AI 资讯

  1. OpenAI 代码库现托管智能体服务,Agent Builder 走向退役
  2. AXIS 开放 207 项机器人操作任务、50129 条轨迹
  3. Anthropic 据报 11 个月签下 5170 亿美元算力合同
  4. HashiCorp 把 HCP Terraform 定位为 AI 智能体基础设施的控制平面
  5. Cloudflare AI Search 加入无站点地图发现模式与统一公共端点

区域与早期信号

  1. 三星据报筹备自研人形机器人,拟 CES 2027 首秀
  2. 联想 Yoga Pro 9n:128GB 统一内存,本地可跑 1200 亿参数模型
  3. vivo X500 系列 AI 摄影助手可识别 5000 种场景标签
2026-09-08 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

01/11

Qwen-Drive 1.0 发布:一个模型兼做驾驶系统与座舱助手

阿里 Qwen 团队把空间感知、交通问答与路径规划放进同一个模型,仿真中偏离路面率从 24% 降到 12%,但模型给出的解释并不总与驾驶动作一致。

据 The Decoder 9 月 7 日报道,Qwen-Drive 1.0 在一个模型内处理三类任务:对周围环境的空间感知、回答交通相关问题、规划行驶路线。研究者的出发点是:图文模型能描述图片,不等于自动理解三维空间;现有驾驶模型多是拿通用图文模型在交通问答数据上微调,论文指出这种做法有两个弱点。Qwen-Drive 1.0 在基础语言模型之外加了两个模块,分别负责 3D 建图与路径规划,让同一个模型既能当驾驶系统、又能当座舱助手,且不丢失原有知识。重新训练后,仿真里车辆偏离路面的比例从 24% 降到 12%。Qwen 团队把模型免费开放给研究社区,权重托管在 Hugging Face(仓库名 Qwen-Drive-1.0-4B)、ModelScope 与 GitHub,论文已上 arXiv。

局限:The Decoder 指出,模型对刹车等动作给出的文字解释并不总与它实际做出的驾驶决策相符。偏离路面率是仿真数据,报道未提供真实道路测试结果;本条依据的报道只给出这一项量化指标,许可证条款以官方仓库为准。

Qwen/Qwen-Drive-1.0-4B · Hugging Face

图片来源:huggingface;已转存至九凤 R2。

来源:The Decoder · Hugging Face · GitHub · arXiv

02/11

MiniMax H3 在八张 B300 上 1.653 秒生成五秒视频

NVIDIA Research 为开源权重的 MiniMax H3 做了 Sol-H3 推理栈,五秒带音频片段 1.653 秒出片;代码 Apache 2.0,权重仍走社区许可,且在美欧英韩暂受限。

据 RuntimeWire 报道,MiniMax 9 月 7 日在官方账号推介了 NVIDIA 为 H3 构建的推理栈:在八张 NVIDIA B300 GPU 上,一段五秒、音画同步的视频片段用 1.653 秒生成完毕;NVIDIA 在三天前(9 月 4 日)发布了这套加速包。优化工作来自 NVIDIA Research 的 Efficient AI 团队与新加坡实验室,核心贡献者包括 Yitong Li、Haopeng Li 和 Enze Xie。Sol-H3 把稀疏注意力、融合 GPU 内核、更快的 GPU 间通信、并行视频解码与缓存条件计算放进同一个运行时,代码以 Apache 2.0 发布。RuntimeWire 把这件事归因于 MiniMax 创始人闫俊杰开放 H3 权重的策略:外部工程师能审视模型、改造服务栈并回馈改进。

局限:RuntimeWire 指出,这个 1.653 秒的成绩使用了四步适配器、预热硬件,且不含 MP4 编码;它不能证明 H3 在工作站、单张 RTX 显卡或未缓存提示词上能快于播放。到 9 月 7 日,B300 已不是 NVIDIA 最新公布的数据中心平台(Vera Rubin 已发布并开始部署)。Sol-H3 代码是 Apache 2.0,H3 权重则另有社区许可:许可 FAQ 写明,开源权重使用在美国、欧盟、英国和韩国暂时受限,这些地区的机构需向 MiniMax 申请。

来源:RuntimeWire · MiniMax(X) · Sol-H3 代码 · H3 许可 FAQ

03/11

GPT-6 Astra 零样本从频谱图认出狗吠与光剑声

只接受图像输入的 Astra 被测出能从梅尔频谱图推断声音内容,但测试只有两张图,第二题首答还错了。

据 RuntimeWire 报道,加州州立理工大学波莫纳分校航空工程学生 Max Rubin 于 9 月 7 日在 X 发帖:他把梅尔频谱图(把音频能量按频率与时间展开的图像)喂给 GPT-6 Astra,模型在没有收到任何音频的情况下认出了第一张图是狗吠;第二张图它首次作答未中,随后认出是光剑音效。Rubin 称测试为零样本,使用 Astra 的轻量推理档位。OpenAI 的模型文档把图像列为 Astra 的输入模态,而把音频和视频输入标为不支持,换言之模型是在「看」声音的图像,而非听录音或走语音识别。OpenAI 于 9 月 3 日发布 GPT-6 Astra,定位在电脑操作、浏览、编程、科学与专业工作。

局限:RuntimeWire 强调这只是两张图的极小样本,且有一次答错后修正,演示结果仍需受控评测验证;这是用户实验,不是 OpenAI 的官方能力声明。

来源:RuntimeWire · Max Rubin(X) · OpenAI 模型文档 · OpenAI 发布稿

全球 AI 资讯

04/11

OpenAI 代码库现托管智能体服务,Agent Builder 走向退役

TestingCatalog 在 OpenAI 代码中发现带可配置环境、技能、插件与部署控制的托管智能体服务,时间指向 9 月 29 日 DevDay;界面尚不可访问。

据 RuntimeWire 报道,TestingCatalog 的 Alexey Shabanov 在周日发布的报告中称,OpenAI 代码库里出现了一项托管智能体服务的引用,包含可配置环境、技能、插件与部署控制。发现的选项包括创建并管理多个智能体和环境、用开发者插件配置智能体,以及把智能体部署到自托管环境。OpenAI DevDay 定于 9 月 29 日在旧金山 Fort Mason 举行,Sam Altman 主讲上午 10 点的主题演讲。OpenAI 在 2025 年 10 月的上一届 DevDay 推出 Agent Builder,作为 AgentKit 的一部分,定位是拖拽式画布,用于编排多智能体工作流、连接工具与添加护栏;OpenAI 目前正在让它退役。RuntimeWire 认为,这将补上与 Anthropic 的产品差距:Claude Managed Agents 在 Anthropic 平台上以托管服务运行自定义智能体,提供长时会话、限定范围的工具权限、托管凭证与审计日志。

局限:报告基于底层代码与未发布的产品界面,功能入口目前无法访问,OpenAI 可能在发布前更改或放弃这些功能;关于把智能体与广告、商业流程打通的判断是 RuntimeWire 的分析,不是 OpenAI 的表态。

来源:RuntimeWire · OpenAI DevDay · OpenAI AgentKit 发布稿 · Anthropic:Claude Managed Agents

05/11

AXIS 开放 207 项机器人操作任务、50129 条轨迹

遥操作采集搬进浏览器、计算交给后端 GPU;π0.5 加上全量 AXIS 数据在 LIBERO-Plus 从 83.9 升到 88.8,但 2.36 TB 数据仅限非商业学术用途,且不放策略权重。

据 MarkTechPost 报道,来自 Axis Robotics、UC Berkeley、Georgia Tech、NTU 等机构的团队提出 AXIS:把机器人示范采集放进网页浏览器,其余计算全部交给后端 GPU,并把数据集当作持续增长的资产而非一次性交付的固定基准。首批数据覆盖 207 项操作任务、50,129 条轨迹。MarkTechPost 给出的 LIBERO-Plus 结果:π0.5 加上全量 AXIS 数据得 88.8,原版 π0.5 为 83.9,RoboCasa365 对照为 57.5;报道还列出了用 25%、50%、100% 数据量训练的分数。训练代码以 OpenPI 的补丁层形式公开在 GitHub,遥操作平台可在任意浏览器中使用;数据集托管在 Hugging Face(axisrobotics/Franka-Dataset),体积 2.36 TB,需申请访问。

局限:MarkTechPost 把可部署性评为「部分」:数据集限非商业学术用途,官方未发布任何策略模型检查点。

来源:MarkTechPost · Hugging Face 数据集 · 训练代码 · 论文

06/11

Anthropic 据报 11 个月签下 5170 亿美元算力合同

The Information 称 Anthropic 自 2025 年 10 月起锁定至少 14.8 GW 算力并筹建自有数据中心;年化营收超 650 亿美元,仍不足以覆盖承诺。

据 The Decoder 转述 The Information 的报道,Anthropic 在 11 个月内签下的算力合同总额最高达 5170 亿美元;自 2025 年 10 月以来,公司在原有 1 到 2 GW 之外锁定了至少 14.8 GW 算力,并在规划自建数据中心。The Information 称,Anthropic 的总规划容量可能仍低于 OpenAI 到 2030 年的 30 GW 目标,但 Anthropic 不少合同期限远超 2030 年,直接比较并不容易。Bloomberg 数据显示 Anthropic 年化营收已超 650 亿美元,OpenAI 截至 7 月超过 400 亿美元。2026 年初,Anthropic CEO Dario Amodei 曾警告不要投资过快,称竞争对手「并不真正理解自己在承担的风险」;OpenAI CEO Sam Altman 近期则在提醒新型云服务商的「不可持续的愚蠢」。

局限:合同总额、算力规模与营收均来自 The Information 与 Bloomberg 的报道,Anthropic 与 OpenAI 均未公开确认;The Decoder 指出,两家公司目前都无法仅靠营收覆盖这些承诺。

来源:The Decoder

07/11

HashiCorp 把 HCP Terraform 定位为 AI 智能体基础设施的控制平面

原则是「智能体提议、Terraform 治理」:策略即代码、项目域身份、单次运行的 OIDC 短期凭证与完整运行历史,把智能体自主性关进受控平面。

据 InfoQ 报道,HashiCorp 在最新指南中把 HCP Terraform 定位为 AI 驱动基础设施的治理与控制平面:AI 智能体可以自主编写 Terraform 配置、发起变更并触发执行,HCP Terraform 则提供策略、身份、隔离、溯源与审计控制。指南列出的多层机制包括:已批准模块与组织标准为智能体提供权威上下文;策略即代码与运行任务对待执行变更做校验;项目域身份限制智能体可访问范围;隔离的项目与工作空间限制故障爆炸半径;运行历史保留计划、策略决策、审批与执行记录。凭证方面,HCP Terraform 采用基于 OIDC 的项目域身份,凭证按单次运行发放、任务结束即撤销,而不是给智能体永久云凭证。HashiCorp 的核心原则是:智能体可以生成、验证并解释变更,但不应审批自己的变更、弱化策略、获取高权限凭证或绕过部署管控。

局限:这是厂商指南与定位表述,InfoQ 报道中没有采用规模或效果数据;InfoQ 指出 HashiCorp 不是唯一走这条路的公司,Pulumi Neo 与 Amazon Q Developer 等在向相近方向演进。

来源:InfoQ 中文 · InfoQ 英文原文

08/11

Cloudflare AI Search 加入无站点地图发现模式与统一公共端点

一条 wrangler 命令完成爬取、摄取、嵌入与检索;嵌入与重排免费,答案生成与查询改写按模型用量计费,测试期全部免费。

据 InfoQ 报道,Cloudflare AI Search 是面向 AI 智能体与应用的内置搜索与检索服务,把 Workers AI、AI Gateway、Vectorize、R2、Browser Run 等组件串成端到端搜索管道。新变化包括:此前每个被索引网站都必须发布站点地图,现在支持「发现」模式自动找页面;提供一个无需身份验证的统一公共端点,可同时跨多个实例或网站检索;使用开源 CMS EmDash 的站点可通过专用插件接入。创建实例只需一条 npx wrangler ai-search create 命令即可完成爬取、摄取、嵌入与检索。Cloudflare 自己的 API 与开发者文档,以及 Astro、Vite、Hono、Replicate 的文档已用它索引为一个整体语料库;集成方式可以是 Worker 接入现有应用或 MCP 服务器(Cloudflare 推荐),或直接暴露公共的 /mcp 与 /search 端点。定价上,使用默认模型或 Workers AI 目录中的指定模型时,嵌入与重排免费,答案生成与查询改写按模型用量计费。

局限:定价模型在服务正式发布后才生效,测试期间免费;InfoQ 的英文原文 8 月刊出,中文版 9 月 7 日发布,报道未给出检索延迟或效果数据。

来源:InfoQ 中文 · InfoQ 英文原文

区域与早期信号

09/11

三星据报筹备自研人形机器人,拟 CES 2027 首秀

韩媒称三星 DX 部门 CTO 同时统管机器人 RX 部门的硬件与 AI 软件团队,并已锁定髋关节、灵巧手与 AI 运动控制专利。

据 IT之家 9 月 7 日转引韩媒 sedaily 的消息,三星电子正在加快人形机器人原型机研发,计划在 2027 年 1 月拉斯维加斯 CES 2027 上首次公开自研人形机器人。报道称样机由三星 DX 部门负责人卢泰文直属的机器人 RX 部门主导,DX 部门 CTO 兼总裁尹长贤同时挂帅该部门的硬件与 AI 软件两支研发团队,业内认为由一人统管软硬件在行业里极为罕见,意在压缩研发周期。IT之家称三星已锁定多项核心专利,涵盖髋关节设计、下一代高灵巧度机械手与基于 AI 的运动控制。

局限:消息来自韩媒引述的业内人士,三星尚未官方确认;报道没有样机参数、量产计划或所用模型信息。

来源:IT之家

10/11

联想 Yoga Pro 9n:128GB 统一内存,本地可跑 1200 亿参数模型

IFA 2026 发布的 RTX Spark 笔记本重 1.65 千克,20 核 Grace CPU 与 6144 CUDA 核心的 Blackwell GPU 经 NVLink-C2C 合一,FP4 算力 1 PFLOPS。

据爱范儿报道,联想在柏林 IFA 2026 期间的 Lenovo Innovation World 2026 上发布了联合英伟达推出的 Lenovo Yoga Pro 9n(国内型号 YOGA Pro 15 Spark)。机器重 1.65 千克、最薄处 16.7 毫米,最高配备 128GB 统一内存,搭载 NVIDIA RTX Spark 超级芯片:20 核 Grace CPU 与 6144 个 CUDA 核心的 Blackwell RTX GPU 通过 NVLink-C2C 互联,提供 1 PFLOPS(FP4)AI 性能。爱范儿引用英伟达对 RTX Spark 的规格说明称,这套配置可在本地运行 1200 亿参数、最高 100 万 token 上下文的大语言模型;统一内存让 CPU 与 GPU 共享同一物理内存池,绕开消费级独显十几到二十 GB 显存的限制。

局限:「本地跑 1200 亿参数模型」出自英伟达的规格说明,不是联想给出的实测吞吐;爱范儿同时指出,此前本地大模型多停留在演示台上,复杂 AI 工作流仍回到云端处理。

来源:爱范儿

11/11

vivo X500 系列 AI 摄影助手可识别 5000 种场景标签

影像发布会公布 RAW 域生成式重建:端侧模型保出片速度、云端大模型提画质,并首发一句话修图;硬件端全球首发蓝图光御 900 传感器、17EV 动态范围。

据 IT之家 9 月 7 日报道,vivo 在创作者盛典上公布了 X500 系列的影像配置。AI 相关部分包括:RAW 域生成式重建技术由端侧模型保证出片速度、云端大模型突破画质上限;全新升级的 AI 摄影助手可识别 5000 种场景标签,自动推荐摆姿、构图与色调;与联发科共同打造的「相册灵感修图」支持一句话完成修图;X500 Pro Max 与联发科合作首发长焦跟随功能,含辅助构图与姿势识别。硬件方面,X500 系列全球首发蓝图光御 900 传感器,配合蓝图超高动态技术实现最高 17EV 动态范围,主摄与潜望长焦达到 CIPA 7.0 防抖等级,Pro Max 支持 400mm 增距镜与三星 HP0 长焦。

局限:端侧模型与云端大模型都没有给出名称、参数或延迟数据,5000 种场景标签的识别准确率未公布;本次只公布影像配置,整机售价与发布日期未在报道中出现。

来源:IT之家

用 JIUFENG 自己生成一张

在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。

免费生成图片