概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Qwen3.8-Max 商务智能体基准领跑开源权重
- 重点 · MiniMax H3 借 vLLM-Omni 实现快于播放的实时生成
- 重点 · Bedrock 报错疑似 Anthropic 预备 Claude Fable 5.1
全球 AI 资讯 4. Gradium 新默认 TTS:难例通过率 81%、首音 216 毫秒 5. DataAgent 融资 1000 万美元,让 AI 在 K8s 集群内自修生产故障 6. 腾讯 Marvis 开放自定义模型,可接入 Kimi、智谱 GLM、DeepSeek
区域与早期信号 7. 清华 AIR 提出具身自进化模型 Zeva,成功率从 26% 升到 73% 8. 雷锋网拆解 1.1 万个 DeepSeek Harness 插件:几无治理机制 9. Lovart 更新围绕设计工作流:灵感采集插件 + 100 多个技能

九凤根据本期已引用来源整理。
热门模型动态
Qwen3.8-Max 商务智能体基准领跑开源权重
阿里 Accio 团队自建有状态商务基准,称 Qwen3.8-Max 是开源权重里综合最强,但成绩来自厂商自评。
阿里国际 Accio 团队的 Yukun Lian、Sicong Xie 等十余人构建了 Commerce Agent Bench,在商务软件的有状态副本中检验智能体能否真正完成交易类工作,评分看最终业务状态而非对话记录。Qwen3.8-Max(Qwen3.8 系列)在 107 项任务中,经 Accio 完成 56 项、经 OpenClaw 完成 47 项、经 Pi 完成 53 项,阿里官方 Qwen 账号称这是开源权重模型里的综合最佳。仓库公布的三张结果表显示,Qwen3.8-Max 以两个总分优势领先 DeepSeek V4 Pro,而闭源的 Claude Opus 5 领先 Qwen 达 35 个通过数。
局限:数据出自阿里自建、自测的基准,属于「厂商公布结果」而非独立审计;RuntimeWire 指出该榜存在 harness 波动、且缺少可复现的任务级公开材料,可审计性存疑。

图片来源:GitHub;已转存至九凤 R2。
来源:RuntimeWire · Qwen 官方 X · Commerce Agent Bench
MiniMax H3 借 vLLM-Omni 实现快于播放的实时生成
vLLM 官方博客称,经系统级优化并接入 FastVideo 的四步 FastH3 后,MiniMax H3 生成速度快过播放。
vLLM-Omni 对 MiniMax H3 的完整栈做了系统级优化与扩展,再集成 FastVideo 的四步 FastH3,使 MiniMax H3 栈的生成速度快于播放(faster than playback),面向实时服务。该文由 vLLM 官方博客发布,属一手工程说明。
局限:博客聚焦服务栈与工程优化路径,公开摘要未给出具体吞吐(tok/s)、时延或硬件配置等量化数字;「快于播放」为其定性结论,需以完整博文为准。
来源:vLLM Blog
Bedrock 报错疑似 Anthropic 预备 Claude Fable 5.1
一个未公开的 Fable 5.1 slug 在 Bedrock 返回 404 而非无效 ID 报错,被视作上线前的早期迹象——但不能证明即将 GA。
据 8 月 31 日曝光的一则 API 响应,研究者 Leo(@synthwavedd)用 Fable 5.1 的模型 slug 请求 Amazon Bedrock,得到「Model not found」的 404;而 Opus 5.1 的 slug 与一个故意乱写的 Anthropic 标识都返回「provided model identifier is invalid」的 400。AWS 称错误的 Bedrock 模型标识通常给出后者那种校验错误,404 则可能表示服务已识别该资源形态、只是尚不能对该账号/端点/区域提供。Bedrock 公开目录当前仍指向 Fable 5。
局限:这是单一 API 错误码差异,Leo 本人称这类情况「通常出现在发布前几天」;RuntimeWire 则明确指出,这一迹象并不构成 Fable 5.1 即将正式可用的证据;Anthropic 未官方确认。
来源:RuntimeWire · @synthwavedd on X · Bedrock 模型卡
全球 AI 资讯
Gradium 新默认 TTS:难例通过率 81%、首音 216 毫秒
Gradium 把新 TTS 设为 API 与 Studio 默认,报告 81.0% 难例人评通过率与 216 毫秒首音时延,并开源了评测集。
Gradium AI 8 月 31 日把新语音合成模型设为其 API 与 Studio 的默认,现有音色(含自定义克隆)无需迁移即可继续使用。官方在一套 500 句、覆盖英德法西葡五语的难例集上报告 81.0% 的人评通过率,高于 Cartesia Sonic 3.6 的 75.1% 与 ElevenLabs v3 Conversational 的 65.4%;Coval 上首音时延 P50 为 216 毫秒,较被替换的旧模型快 170 毫秒。该评测集已以 CC BY 4.0 开源到 Hugging Face,含五语、10 类共 100 项条目,覆盖拼写、缩写、字母数字、日期、数字与邮箱等原子标准。
局限:通过率与时延均为 Gradium 自报,对手成绩由其在同一评测集下测得;难例集虽开源,但榜单仍是厂商自评口径。
来源:MarkTechPost · Hugging Face 评测集
DataAgent 融资 1000 万美元,让 AI 在 K8s 集群内自修生产故障
以色列公司 DataAgent 带 1000 万美元种子前融资亮相,主打在客户自有 Kubernetes 集群内直接修复生产故障。
DataAgent 今日正式亮相,获 1000 万美元 pre-seed 融资,平台在客户自己的 Kubernetes 集群内修复生产故障,资金将用于加速北美客户采用。创始人 Ishay Yaari(CEO)与 Nati Shalom(CTO)于今年 1 月创立公司,两人此前均供职于开源云编排公司 Cloudify——该公司 2023 年被戴尔以传闻约 1 亿美元收购。与「先检测故障、再交给工程师、并把日志指标复制到厂商云」的传统可观测性不同,DataAgent 让智能体直接读取实时系统状态与拓扑并就地处置。
局限:产品定位与省钱主张来自公司自述;文中援引 Grafana Labs 2025 可观测性调查称这类支出平均占总算力基建开销 17%(最常见为 10%)作为行业背景,并非 DataAgent 自身效果数据。
来源:SiliconANGLE
腾讯 Marvis 开放自定义模型,可接入 Kimi、智谱 GLM、DeepSeek
腾讯操作系统级助手 Marvis 于 9 月 1 日上线自定义模型,用户可接第三方模型或跑本地模型。
腾讯的操作系统级 AI 助手 Marvis 于 9 月 1 日推出自定义模型功能,用户可接入 Kimi、智谱 GLM、DeepSeek、MiniMax 等第三方模型,或运行本地模型,使其从固定后端转向由用户自选模型后端。
局限:目前仅见 Pandaily 报道,摘要未给出接入方式、计费、可用地区或对本地模型的硬件要求等细节,属早期产品信号。
来源:Pandaily
区域与早期信号
清华 AIR 提出具身自进化模型 Zeva,成功率从 26% 升到 73%
参数冻结下,Zeva 靠「上下文内因果学习」从自身交互中持续学习,多个具身基准累计成功率由 26% 升至 73%。
清华 AIR 与域变换发布 Zeva,称其是首个实现「上下文内因果学习」(In-Context Causal Learning, ICCL)的具身 WAM:在不更新权重的情况下,从自身动作后果中学习物理因果。论文称在多个典型具身基准任务上,把冻结模型的累计成功率从 26% 提升到 73%;在真实化学实验室里,机械臂多次尝试中越用越稳。模型通过 Causal Interaction Extraction、双时标 Causal Memory 与 In-Context Policy Injection 在部署中自进化。
局限:成绩来自团队论文与量子位报道,尚无第三方复现;除累计成功率外,摘要未给出跨任务、跨本体的更多量化对比。(中文来源)
来源:量子位
雷锋网拆解 1.1 万个 DeepSeek Harness 插件:几无治理机制
DeepSeek Harness 开源后,dsh-plugin 标签下 GitHub 仓库超 1.1 万个,雷锋网实测称官方几乎未建插件治理机制。
DeepSeek Harness 开源后,「一切皆插件」的口号迅速扩散。雷锋网称,GitHub 上 dsh-plugin 标签下已有一万多个仓库;他们把这些仓库逐一清点,写了一个探针插件装进去试探,又装了二十几个下载量最高的插件跑了一夜,结论是官方几乎没有建立插件治理机制。
局限:为雷锋网单一来源的实测调查,摘要未公开具体的漏洞样本、受影响插件名单或量化风险数据,仅点出治理缺位这一现象。(中文来源)
来源:雷锋网
Lovart 更新围绕设计工作流:灵感采集插件 + 100 多个技能
Lovart 悄悄大更新,重点从生成效果转向设计工作流,新增浏览器灵感采集插件与 100 多个技能。
爱范儿实测称,Lovart 本次更新把重心放到设计前后的工作流:新增「灵感采集」浏览器插件,支持在 Pinterest、小红书、淘宝、亚马逊、Instagram 等站点一键收藏素材到账户并顺手分类;生成过程中 Agent 会自动联网补充参考素材,并把 Pinterest 与 Google 图片搜索纳入搜索源。它还引入技能市场,含官方与社区贡献的 100 多个技能,覆盖营销素材、品牌视觉、社媒内容、产品设计与创意风格五类。
局限:以上为爱范儿单篇上手实测,未给出模型版本、生成质量的量化评测或定价信息。(中文来源)
来源:爱范儿
获取九凤最新的 AI 模型洞察与教程。
了解更多


