概览
本期共 8 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Qwen3.8-Max 发布,前端编程榜排第 4
- 重点 · MiniMax 开源 H3,首个登顶视频榜的开放模型
- 重点 · OpenAI 重构语音栈,GPT-Live 可边听边说
- Anthropic 详解 Claude 隔离架构,约束 Agent 行为
全球 AI 资讯 5. 白宫拟请 AI 公司自愿提交前沿模型受测 6. F1 用 AWS 智能体把数据接入从数周压到几分钟
区域与早期信号 7. 商汤开源 SenseNova U1.5-Lite 预览版 8. 阿里「千问办公」开启公测

九凤根据本期已引用来源整理。
热门模型动态
Qwen3.8-Max 发布,前端编程榜排第 4
阿里新旗舰在 Arena 文本榜与前端编程逼近闭源前沿,官方称是「迄今最大、最强」的模型。
阿里于 8 月 3 日发布新一代旗舰模型 Qwen3.8-Max。Arena 官方榜单显示,它在文本模型榜上仅次于 Fable 5 及 Anthropic Opus 家族的三款模型;前端编程一项(Frontend Code Arena)以 1668 分列第 4,落后于 Claude Opus 5(Max)与 Kimi K3(Max),与 Claude Opus 5(High)几乎打平。The Verge 报道称,阿里主张该模型性能可与 Anthropic 的 Claude Fable 5、OpenAI 顶级系统竞争。据爱范儿(中文)实测,Qwen3.8-Max 总参数量 2.4 万亿,每次推理激活 950 亿参数,支持 100 万 Tokens 上下文与视觉理解,重点升级编程与专业办公。
局限:Arena 名次为社区投票的相对排名,会随参评模型与打分口径变化,非绝对能力度量。The Decoder 指出,阿里此次以「模型替你干活、你去做爱好」的营销视频,与 OpenAI、Anthropic 的「AI 抢工作」叙事刻意区隔,属营销定位而非技术指标。
来源:The Verge · The Decoder · Arena 榜单 · Qwen 官方
MiniMax 开源 H3,首个登顶视频榜的开放模型
MiniMax 放出 33B 视频模型 H3 权重,在第三方视频榜的「视频编辑」项排名第一。
MiniMax 于 8 月 3 日发布视频模型 H3 的权重。据 The Decoder 报道,这是首个在视频榜单登顶的开放模型;第三方评测机构 Artificial Analysis 将 H3 列为「视频编辑」第一、「文本生视频」第二、「图像生视频」第三。据 HuggingFace 模型卡,H3 参数量为 330 亿,可同时处理文本、图像、视频与音频,生成 4 至 15 秒、带立体声的片段。
局限:Artificial Analysis 榜单为该机构自建评测,排名随参评模型与打分口径变化。本文未核到 H3 的开源许可证条款、训练数据与商用范围,权重虽公开但可用性细节待官方文档确认。

图片来源:huggingface;已转存至九凤 R2。
来源:The Decoder · HuggingFace 模型卡
OpenAI 重构语音栈,GPT-Live 可边听边说
独立音频通道让对话不中断,GPT-5.5 在后台处理推理、搜索与工具调用。
OpenAI 工程师 Justin Uberti 与 Zahan Malkani 于 8 月 3 日撰文,披露对 ChatGPT 语音基础设施历时六个月的重构:GPT-Live 通过专用音频通道,可在其他模型于后台处理搜索、推理与工具调用的同时,实现边听边说(全双工)。据 RuntimeWire,该架构在 OpenAI 于 7 月 8 日将 GPT-Live 全球推送近四周后才公开。
局限:RuntimeWire 将此定位为面向语音智能体开发者的基础设施基线,而非模型推理能力本身的跃升。工程细节以 OpenAI 官方工程博客与 X 帖为准,文章未给出延迟、并发等量化指标。
来源:RuntimeWire · OpenAI 工程博客 · OpenAI 官方 X
Anthropic 详解 Claude 隔离架构,约束 Agent 行为
Anthropic 主张 Agent 安全靠运行环境的确定性边界,而非仅靠模型自身或逐项权限确认。
Anthropic 在工程博客中详解了 Claude 在 Web、开发者与桌面产品中的安全隔离架构。据 InfoQ,Claude.ai 的代码执行环境运行在隔离基础设施上的临时 gVisor 容器中,完全无法访问用户本地文件系统;Claude Code 则运行在开发者本机,macOS 用 Seatbelt、Linux 用 bubblewrap 施加操作系统级沙箱。Anthropic 称,早期逐项授权机制下用户最终批准了约 93% 的权限请求,使持续依赖人工确认的安全价值大打折扣。
局限:Anthropic 强调分类器、系统提示词与模型训练无法提供绝对保证,真正决定 Agent 能访问什么、能外发什么数据的是运行环境本身。该文为厂商自述的设计理念,未提供第三方审计结果。
来源:Anthropic 工程博客 · InfoQ 中文 · InfoQ 英文 · bubblewrap
全球 AI 资讯
白宫拟请 AI 公司自愿提交前沿模型受测
据 SiliconANGLE,白宫网络安全负责人已敲定一份自愿框架的大纲,允许厂商在发布前把前沿模型交政府测试。
据 SiliconANGLE 于 8 月 3 日报道,白宫网络安全官员已敲定一份即将出台框架的大纲:AI 公司可在把最新前沿模型交付客户或公众之前,自愿提交给政府进行测试。报道称,此举出现在包括 Anthropic 在内的公司近期披露安全事件之后。
局限:框架仍处于「据报道敲定大纲」阶段,细节与生效时间未公布,且为自愿而非强制。本条仅 SiliconANGLE 单一来源,尚无官方文本可核。
来源:SiliconANGLE
F1 用 AWS 智能体把数据接入从数周压到几分钟
一级方程式在 Amazon Bedrock AgentCore 上搭建 Data Accelerator,将数据源接入从最长 8 周缩短到分钟级。
据 AWS 机器学习博客,一级方程式(F1)与 AWS 合作,基于 Amazon Bedrock AgentCore 的智能体构建 Data Accelerator,用于改造其 MarTech 数据平台 Customer 360。官方称,新流程把数据源接入(onboarding)从最长 8 周缩短到几分钟。F1 面向全球逾 8 亿粉丝、每两周一场比赛,营销决策需与赛场同速。
局限:该文为 AWS 官方案例,数据由厂商提供,未含独立第三方复核。「从数周到几分钟」为特定数据接入环节的对比,非平台整体性能。
来源:AWS 机器学习博客
区域与早期信号
商汤开源 SenseNova U1.5-Lite 预览版
8B-MoT 原生统一多模态模型面向社区开源,主打 4K 直出与图像编辑。(Chinese-language source)
据量子位(中文),商汤面向社区开源了轻量级原生统一多模态模型 SenseNova U1.5-Lite-Preview(早期预览版)。该模型延续商汤自研 NEO-Unify 架构,把语言、视觉语义与像素生成放进同一套模型,覆盖视觉理解、推理、生成与编辑,参数规模为 8B-MoT,可 4K 直出。量子位援引官方数据,其图像基准较上一代 U1 有提升:Qwen-Image-Bench 47.14→55.20、ImgEdit-Bench 3.90→4.37、GEdit-Bench 英文 7.47→8.17 / 中文 7.42→8.05,自建 WeEdit 总均分 6.44。
局限:本条仅有中文来源(量子位)报道,且为「预览版」;报道未公布开源许可证条款与吞吐、时延等工程指标,商业可用性有待官方正式发布确认。
来源:量子位(中文)
阿里「千问办公」开启公测
企业级 Agent 产品 QwenWork 整合本地操作、云端长任务与协作,底层为 Qwen3.8-Max。(Chinese-language source)
据爱范儿(中文),阿里于 8 月 3 日推出企业级 Agent 产品「千问办公」(QwenWork)并开启公测,由 QoderWork、MuleRun 与「悟空」三款产品整合而来,把本地电脑操作、云端长任务与企业协作收进同一入口,官网 qwenwork.cn 可下载。其 IM 频道除接入阿里自家钉钉外,还支持飞书、微信等;实测底层模型为新旗舰 Qwen3.8-Max。
局限:本条仅有中文来源(爱范儿)实测报道;作者指出产品「会偶尔闹乌龙」,长任务稳定性与企业级可靠性仍需验证。
来源:爱范儿(中文)
获取九凤最新的 AI 模型洞察与教程。
了解更多


