全新上线GPT-IMAGE-2 现已加入 Jiufeng Hub 画廊!立即体验
本文目录
AI 热点资讯

Anthropic 内部更强模型 Model 2,仅供自用不发布

核心速览
  • Anthropic 风险报告披露仅供内部使用、强于公开版 Claude 的 Model 2
  • 阿里发布 GUI 智能体基座 Qwen-UI-Agent
  • 开源 Kimi K3 借 Harness 在 nanoGPT 速通逼近 Opus 5
  • Slack、币安把编程与交易智能体接进工作流
  • 信通院联合淘宝闪购发布即时零售智能体可信规范。
jiufeng
2026年8月20日
16 分钟阅读
Anthropic 内部更强模型 Model 2,仅供自用不发布

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Anthropic 内部跑着更强的 Model 2,只自用不发布
  2. 重点 · 阿里发布 GUI 智能体基座 Qwen-UI-Agent
  3. 重点 · 开源 Kimi K3 靠 Harness 逼近 Opus 5
  4. GPT-5.6 Luna 降价八成,Replit 打包进付费版

全球 AI 资讯 5. Slack 上线 Code,编程智能体进同一个频道 6. 币安开放 Agent OS,让 AI 智能体自动交易 7. TrueFoundry 开源 TrueForge,抢智能体运行时底座 8. 陶哲轩:AI 可能引发数学界百年来最大危机

区域与早期信号 9. 信通院联合淘宝闪购发布即时零售智能体可信规范 10. 中国 AI 办公桌面端混战,WorkBuddy 与百度搭子领跑

2026-08-20 AI 热点信号地图
2026-08-20 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

Anthropic 内部跑着更强的 Model 2,只自用不发布

Anthropic 8 月风险报告承认,内部有一个比任何公开版 Claude 都强的模型,代号 Model 2,目前仅供公司自用。

据 Anthropic《2026 年 8 月风险报告》,该模型属于 Mythos 级别,整体略强于 Claude Mythos 5,在内部能力指数 AECI 上高出约 1.5 分。公司内部大量用它做编程、数据生成与研究工程,部分通过持续运行的智能体调用;报告称 Claude 如今已承担 Anthropic 生产系统里的大部分代码编写。Model 2 在部署前经过一轮内部评审。

报告同时写明,Model 2 只是「整体略强」,在部分能力上反而弱于 Mythos 5;1.5 分的提升幅度也小于此前 Mythos Preview 到 Mythos 5 的跨度,并非 Opus 4.6 升到 Mythos 时那种大跳。它是内部自用模型,未对外发布,外部无法调用或验证。

来源:The Decoder · Anthropic 风险报告

阿里发布 GUI 智能体基座 Qwen-UI-Agent

阿里推出面向真实设备的 GUI 智能体基座模型 Qwen-UI-Agent,覆盖手机、电脑、网页与深度搜索,移动端榜单反超多款旗舰。

据其 arXiv 技术报告(2607.28227),Qwen-UI-Agent 以「真实世界为中心」,能在真实设备上跨平台执行工作流,并把 GUI 交互与 CLI 执行结合以完成长程任务。官方给出的评测中,移动端 MobileWorld 得分 82.1%,领先 GPT-5.6 Sol、Claude 等旗舰模型。

这些成绩来自技术报告中的自评基准,尚无第三方独立复现;报告侧重能力愿景(可靠操作、跨平台、长程任务、自我改进),权重与可用性等发布细节以官方后续公布为准。

来源:arXiv

开源 Kimi K3 靠 Harness 逼近 Opus 5

Prime Intellect 把 18 个前沿模型丢进 nanoGPT 训练速通,开源权重的 Kimi K3 配上 Prime Agent Harness 跑出 2930 步,逼近闭源旗舰。

据量子位报道,实验让各模型自主改优化器、跑训练、比 loss,目标是用尽量少的 training steps 把 1.24 亿参数 GPT 的验证集 loss 降到 3.28 以下,baseline 定在 3290 步。Kimi K3 搭配 Prime Agent Harness 在原始结果页跑出 2930 步,超过 GPT-5.6 Sol 的 3042 步,距 Claude Opus 5 的 2920 步仅差 10 步。参测的还有 Fable 5、Grok 4.5/4.6、GLM 5.2、Muse Spark 1.1/1.2、DeepSeek V4 Pro、Qwen 3.8 等共 18 个模型。

为防止直接上网抄答案,整个过程被锁进沙盒。这是单次速通任务的成绩、由量子位转述 Prime Intellect 实验,「原始结果页」未经独立复核,不能等同于模型在更广泛任务上的综合排名。

来源:量子位

GPT-5.6 Luna 降价八成,Replit 打包进付费版

OpenAI 把最便宜的 GPT-5.6 Luna 降价 80% 后,Replit 用它推出「Free Mode」,让付费用户跑日常智能体任务不再扣额度。

据 RuntimeWire,Replit 的 Free Mode 由 OpenAI GPT-5.6 Luna 驱动,面向付费的 Core(月付 25 美元 / 年付合 20 美元)与 Pro(月付 100 美元 / 年付合 95 美元)用户,让常规提示与改写不消耗每月积分;Core 档有 5 小时使用窗口、每月最多 30 小时聊天。OpenAI 已于 7 月 30 日把 GPT-5.6 Luna 降价 80%,官方文档现价为输入每百万 token 0.20 美元、输出 1.20 美元。

名字叫「Free Mode」,实际只对已付费的 Core/Pro 开放,且有 5 小时窗口限制。RuntimeWire 同时披露自身「构建在 Replit 之上」,与被报道方存在利益关系。

来源:RuntimeWire · OpenAI

全球 AI 资讯

Slack 上线 Code,编程智能体进同一个频道

Salesforce 的 Marc Benioff 发布 Slack Code,把 Anthropic、GitHub、Cognition、Vercel 的编程智能体拉进 Slack 频道协作。

据 RuntimeWire,Benioff 于 8 月 20 日发布 Slack Code,软件团队可在不离开 Slack 频道的情况下,把任务派给上述四家的编程智能体;他称之为「multiplayer coding」,并在 Dreamforce 2026 上演示,四家集成当天上线。Salesforce 在其中扮演协调者,而非模型供应方。

目前仅为发布日的演示与集成上线,实际协作效果、可用范围与稳定性尚待验证;Salesforce 强调自己是协调层,模型能力仍取决于各家智能体。

来源:RuntimeWire · Marc Benioff on X

币安开放 Agent OS,让 AI 智能体自动交易

币安推出 Agent OS,允许接入 ChatGPT、Claude Code、Cursor 等工具的 AI 智能体分析行情并代用户下单,但把「看住智能体」的责任交给用户。

据 TechCrunch,拥有超 3 亿注册用户的币安于周四上线 Agent OS,开发者可把 AI 应用与智能体接入币安金融基建,包括 Binance API、Wallet Agentic Hub、x402 交易验证与支付 API、Skill Hub,并新增对 MCP 的支持;平台兼容 OpenAI 的 ChatGPT 和 Codex、Anthropic 的 Claude Code 以及 Cursor,用户可授权智能体读取行情、查看账户并执行交易。

TechCrunch 指出,随着 AI 从问答型聊天机器人转向能采取行动的智能体,币安把「授权智能体能访问什么」的把关责任主要交给用户自己决定,风险控制取决于用户配置。

来源:TechCrunch

TrueFoundry 开源 TrueForge,抢智能体运行时底座

TrueFoundry 开源 MIT 许可的智能体运行时 TrueForge,声称任务完成成本比 Claude Managed Agents 低 30–75%,但最大一笔省钱来自换模型。

据 RuntimeWire(转述 VentureBeat),TrueFoundry 三位创始人 Nikunj Bajaj、Abhishek Choudhary、Anuraag Gutgutia 发布 TrueForge,允许开发者自选模型、工具与基础设施来搭建和运行智能体。公司策略是免费送出运行时、把自家付费网关铺到智能体之下,Gutgutia 直言「所有流量仍应流经我们的网关」。

RuntimeWire 提示,其宣称的 30–75% 成本优势中,最大一笔节省其实来自切换到更便宜的模型、而非运行时本身;开源运行时也是为付费网关导流的商业铺垫。

GitHub - truefoundry/trueforge: The open-source agent harness - the runtime layer that turns an LLM into a working agent.
GitHub - truefoundry/trueforge: The open-source agent harness - the runtime layer that turns an LLM into a working agent.

图片来源:GitHub;已转存至九凤 R2。

来源:RuntimeWire · TrueForge (GitHub)

陶哲轩:AI 可能引发数学界百年来最大危机

菲尔兹奖得主陶哲轩撰文警告,AI 或把数学推入堪比 1900 年前后的基础危机,被考验的不是数学真理而是数学的价值与实践。

据 The Decoder,陶哲轩在为 2026 年国际数学家大会撰写的文章中提出,数学界应停止争论 AI 能做什么,转而直面一个长期回避的问题:数学研究的目标究竟是什么。他把当下类比于 1900–1930 年间的基础危机——罗素悖论与哥德尔不完备定理曾迫使数学家把默认假设显式化,催生了沿用一个世纪的严格框架。他认为如今受压的不再是「数学真理」,而是「大体上隐性的数学价值与实践框架」,即什么才算一项贡献。

这是陶哲轩的个人论述与预判,并非实证结论;文章提出的是问题与类比,AI 会把数学推向「黄金时代还是深层危机」在文中本身也是开放的。

来源:The Decoder · arXiv

区域与早期信号

信通院联合淘宝闪购发布即时零售智能体可信规范

中国信通院与淘宝闪购发布《即时零售智能体可信基本要求》,为即时零售 AI Agent 定出准确率与接口成功率门槛(中文来源)。

据雷锋网,该规范 8 月 18 日在中国人工智能产业发展联盟第十八次全体会议上发布,由联盟安全治理委员会发起,信通院与淘宝闪购牵头起草,蚂蚁、百度、阶跃星辰、MiniMax、同盾等参编。框架围绕功能完备性、执行准确性、执行效率性三大能力维度,与数据安全、访问安全、运行安全、漏洞管理、服务管理、科技伦理六大领域展开;明确简单任务执行准确率应超 95%、复杂任务超 90%、接口成功率超 99%,评测须分别构建不少于 100 道测试题。淘宝闪购已于 8 月 5 日开放 MCP 能力。

这是行业自律性技术规范而非强制标准,落地效果取决于各厂商是否采用与如何评测;本条仅有中文来源,暂无全球英文报道佐证。

来源:雷锋网

中国 AI 办公桌面端混战,WorkBuddy 与百度搭子领跑

第三方 MAU 榜显示,腾讯 WorkBuddy 以 1115 万月活居桌面端 AI 办公第一,百度搭子 674 万列第二、环比增速超十倍(中文来源)。

据钛媒体援引 AI 产品榜最新一期数据,桌面端 AI 办公智能体中 WorkBuddy 月活 1115 万排名第一,百度搭子 674 万排名第二、环比增速达 1063.79% 居同类首位;不到半年,中国市场已有超 20 款桌面端 Agent 产品问世。文章称 WorkBuddy 最初是腾讯几名产品经理在 Claude Cowork 发布后,用 CodeBuddy 基建与 Agent SDK 于周末做出的初版,经内部测试后于春节后对外开放。

MAU 数据来自第三方榜单 AI 产品榜、口径未独立核验;随着阿里、字节及更多办公软件厂商下场,这一排名仍属早期。本条仅有中文来源。

来源:钛媒体