本文目录
AI 热点资讯

DeepSeek 换套 Harness,五项基准反超 Opus

核心速览
  • 热门模型动态:Floatboat 评测显示 DeepSeek-V4-Flash 换 Harness 后五项基准反超贵 57 倍的 Opus 4.8
  • Shopify CEO 因 AGENTS.md 威胁禁用 Claude Code
  • Gemini 3.5 Pro 再度跳票、Google 重组痛失 Jeff Dean
  • StartLux 27B 本地模型在 CAICT MCP 测评夺亚。
jiufeng
2026年8月31日
17 分钟阅读
DeepSeek 换套 Harness,五项基准反超 Opus

概览

本期共 9 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · DeepSeek-V4-Flash 换套 Harness,五项基准反超 Opus 4.8
  2. 重点 · Shopify CEO 威胁禁用 Claude Code,只因它不读 AGENTS.md
  3. 重点 · Gemini 3.5 Pro 再度跳票,Google 重组并痛失 Jeff Dean
  4. StartLux 27B 本地模型 CAICT MCP 测评夺亚,超 DeepSeek-V4-Flash

全球 AI 资讯 5. OpenClaw 2.0 补上协作短板,坚持让运营方自选模型与硬件 6. Google 开源 EnvHarness:让静态智能体环境随训练自适应 7. Glassdoor 分析:员工对 AI 的正面评价从 81% 跌到 43%

区域与早期信号 8. AI 视频生成快过播放,「无限泔水」直播上线(Chinese-language source) 9. 商汤系 Imvision 押注 AI 影像协处理器,欲走出安霸阴影

2026-08-31 AI 热点信号地图
2026-08-31 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

DeepSeek-V4-Flash 换套 Harness,五项基准反超 Opus 4.8

同一个 DeepSeek-V4-Flash,接入 Floatboat 自研 Harness 后五项基准全胜,反超单价贵 57.1 倍的 Claude Opus 4.8。

据 InfoQ 报道,通用 Agent 公司 Floatboat 于 2026 年 8 月公布评测:以混合价 $0.175/M 的 DeepSeek-V4-Flash 跑完五项基准,成绩均超越单价贵 57.1 倍的 Claude Opus 4.8。关键变量不是模型而是 Harness——同一模型在 DeepSeek 官方 Harness 上五项未赢,接入 Floatboat Harness 后五项全胜。团队自研了完整的 Runtime、Agent Loop、Tools 与 Infra,外加名为 FloatSail 的自适应系统,并把文件管理器、编辑器、浏览器做成 Agent 的桌面运行环境。增益随任务程长递增:短程任务仅差 1.9%,长程 DeepSWE 达 23.6%;Floatboat 定义的 HLR(Harness Leverage Ratio)从 0.78 倍升至 3.57 倍。

局限:Floatboat 评测系自测、自选基准,尚无第三方复现,绝对分数与提示细节未完全公开;文末 METR 与 Anthropic 两个链接为 InfoQ 报道所附参考阅读,并非评测方对方法学的官方说明。

来源:InfoQ · METR arXiv:2503.14499 · Anthropic

Shopify CEO 威胁禁用 Claude Code,只因它不读 AGENTS.md

拒绝支持已被超 6 万个开源项目采用的 AGENTS.md 格式,Claude Code 招致 Shopify CEO 公开威胁在公司内部全面禁用。

据 InfoQ,Claude Code 坚持自家 CLAUDE.md、拒读渐成行业标准的 AGENTS.md。Shopify CEO Tobi Lütke 在 X 上称,公司数千名开发者共同维护一个 monorepo,工具读不到同一份指令会让部分智能体「被切掉一块脑子」,为此付出「本不该付的复杂度税」,并表示正考虑在 Shopify 全面禁用 Claude Code,直到其愿意读取 AGENTS.md、.agents/skills 等文件。开发者对该格式的诉求由来已久:2025 年 8 月提交的功能请求获近 5000 个 GitHub 用户点赞,成为社区反响最强的兼容性诉求之一,但相关 issue 屡被以「不予修复」关闭。一项针对 2853 个 GitHub 代码仓库的 2026 年研究发现,上下文文件已成为开发者给编程智能体下指令的通行做法。Anthropic 方面,Claude Code 团队成员 Thariq 回应称正在提升可定制性,并解释坚持 CLAUDE.md 的原因——不同模型需要不同的上下文;他还透露 Anthropic 为 Claude 5 删掉了约 80% 的 Claude Code 系统提示词。但该回应未平息争议,开发者反而更为不满。

局限:这是围绕配置格式的工程分歧;到目前为止,Shopify 并未真正禁用 Claude Code,而 Anthropic 仅解释了坚持 CLAUDE.md 的理由,并未承诺采纳 AGENTS.md。

来源:InfoQ · GitHub issue · arXiv:2602.14690

Gemini 3.5 Pro 再度跳票,Google 重组并痛失 Jeff Dean

旗舰模型从「本月发布」拖到「即将」,Google 的应对是给 Gemini 配运营主管、加快廉价 Flash,并眼看首席科学家出走自立门户。

据 RuntimeWire,Google 的 Gemini 3.5 Pro 一再延期:Alphabet 6 月的投资者演示材料称旗舰将于当月发布,7 月的帖子改口称合作伙伴正在测试,到 8 月仍是「即将」。与此同时,Google 在组织与商业上调整:给 Gemini 项目配上运营主管、更快推出更便宜的 Flash 系列。人事层面,入职谷歌 27 年、第 30 号员工、参与 MapReduce/Bigtable/TensorFlow/TPU 与 Google Brain、现任 Google DeepMind 首席科学家的 Jeff Dean 已于 8 月 5 日离职,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创办公益公司 Discovery Loop,Alphabet 为创始投资方兼云合作伙伴;Dean 的 google.com 账号 8 月 14 日左右被关闭。

局限:Gemini 3.5 Pro 至今未正式发布,「即将」无确切时间表;报道以 Jeff Dean 本人 X 帖与 Sundar Pichai 备忘录为一手依据,属对公开信息的整理,Google 未就延期给出官方技术说明。

来源:RuntimeWire · Jeff Dean on X · Pichai memo

StartLux 27B 本地模型 CAICT MCP 测评夺亚,超 DeepSeek-V4-Flash

一款 270 亿参数的本地模型在 CAICT 的 MCP 测评中位列第二,跑赢 DeepSeek-V4-Flash。

据 Pandaily,StartLux 的 270 亿参数本地模型在 CAICT 的 MCP 测评中取得第二名,成绩超过 DeepSeek-V4-Flash,被报道形容为进入「万亿参数级能力」区间。以 27B 的体量在该测评中位列前二,指向中小模型在特定 Agent/工具调用测评上的性价比空间。

局限:本条目前仅见 Pandaily 单一报道,属素材偏薄的区域信号;「万亿参数级能力」为报道措辞而非官方基准分数,来源仅以缩写「CAICT」称该测评机构、未给出全称,其完整榜单、评测方法与其他选手成绩亦未在该报道中披露,缺少第三方复现。

来源:Pandaily

全球 AI 资讯

OpenClaw 2.0 补上协作短板,坚持让运营方自选模型与硬件

开源自托管智能体 OpenClaw 发布 2.0,补齐持久会话、云端 Worker 与任务交接,但仍不捆绑模型与基础设施。

据 RuntimeWire,Peter Steinberger 的开源项目 OpenClaw 于 8 月 30 日发布 2.0,带来 Grok Bot、ChatGPT Work 同类的能力:持久智能体、共享会话、计算机访问、周期任务与任务交接。差别在于它「不打包」什么——Grok Bot(8 月 11 日 beta)与 ChatGPT Work 把智能体执行、模型与基础设施封装进托管产品,OpenClaw 则让运营方在笔记本、服务器、配对设备或自选云 Worker 上运行,模型可托管可本地,从而保留对执行与凭据的控制。

局限:这份「控制权」的代价是安装、维护与安全都留给用户自理;报道将 2.0 定位为「补齐便利与协作短板」而非独立产品发布,未给出性能基准或用户规模数据。

来源:RuntimeWire · Grok Bot · ChatGPT Work

Google 开源 EnvHarness:让静态智能体环境随训练自适应

Apache-2.0 的可编程层,把固定不变的智能体基准变成会随策略进步而调整的训练环境。

据 MarkTechPost,Google Cloud AI Research 联合圣路易斯华盛顿大学与北卡罗来纳大学教堂山分校发布 EnvHarness,采用 Apache-2.0 许可。现有智能体环境多为手工搭建、固定不变——无论哪个智能体、进步多少都表现一致。EnvHarness 反其道而行:用仅通过标准 reset() / step() 接口工作的插件式组件包裹既有环境,改变一个 episode 从哪开始、智能体可做什么、能看到什么,而底层模拟器、任务与人工构建的校验器保持不变。

局限:它改变的是环境的呈现与起点,不替代底层任务与验证逻辑;效果与适用范围以配套论文与代码仓库为准,报道未给出跨任务的量化训练收益。

来源:MarkTechPost · GitHub · arXiv

Glassdoor 分析:员工对 AI 的正面评价从 81% 跌到 43%

对雇员评论的分析显示,职场对 AI 的正面提及从 81% 回落至 43%,负面升至 53%。

据 The Decoder,对 Glassdoor 雇员评论的分析显示,美国员工对 AI 的正面评价从 2019 年的 81% 降至 2026 年中的 43%,负面评价升至 53%。群体差异明显:Gen Z 女性的 AI 相关评论仅 21% 为正面,是最不看好的群体;高管最乐观;软件架构师提及 AI 最频繁且多为正面,而工作更偏写码与审阅的软件工程师更为谨慎(约 57% 偏负面);保险理赔员、写作者与客服几乎一边倒地负面。

局限:这是对公开雇员评论的观察性分析,反映的是主观情绪而非生产力或岗位数据,样本与抽样方法以原文为准,不能据此推断 AI 对具体岗位的净效应。

来源:The Decoder

2026-08-31 AI 热点重点信号
2026-08-31 AI 热点重点信号

九凤根据本期已引用来源整理。

区域与早期信号

AI 视频生成快过播放,「无限泔水」直播上线(Chinese-language source)

fal 工程师把基于开源 MiniMax H3 重构的 H3 Max 接上直播,15 秒视频约 9 秒生成,催生可无限续播的互动 AI 直播。

据爱范儿,fal 工程师 Rehan Sheikh 于 8 月 29 日把自研的 H3 Max(基于开源模型 MiniMax H3 重新设计)接入直播,做成永不停止的「无限跨次元有线电视」,两天演示帖获超 500 万次观看。因生成速度首次快过播放——15 秒视频约用 9 秒生成——「数字游民」开发者 Pieter Levels 顺势做出可交互的 Infinite Slop 网站:任何人在聊天框输入一句话,AI 即生成带画面、对白、音效的短片排入队列,上线首日 3.7 万观众、峰值逾 1000 人同时在线。

局限:Sheikh 的 Twitch 直播账号因涉 DMCA 等规定被封,转 Kick 再被封、最终搬到 Rumble;内容被开发者自嘲为「slop(垃圾流)」,属演示性质,H3 Max 未公布参数、许可证或稳定可用性。本条为中文媒体报道。

来源:爱范儿

商汤系 Imvision 押注 AI 影像协处理器,欲走出安霸阴影

从商汤分拆的 Imvision 以 AI 影像协处理器切入头部摄像头供应链,试探能否从「第二颗芯片」长成完整 SoC。

据 Pandaily,从商汤(SenseTime)分拆的 Imvision Innovation 正以 AI 影像协处理器进入头部摄像头供应链,定位为主控之外的「第二颗芯片」,并试图借此成长为完整 SoC,从对标安霸(Ambarella)的处境中突围。

局限:本条为 Pandaily 单一报道、素材偏薄,属早期产业信号;进入供应链的规模、客户、出货量与量产时间未披露,「成长为 SoC」目前是公司意图而非已验证的产品事实。

来源:Pandaily