概览
本期共 10 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Claude Code 上线 /design,终端里直接出界面草图
- 重点 · DeepSeek V4 Pro 级联跑 DeepSWE,成本省六成
- 重点 · SpaceXAI 收紧 Grok 使用政策,禁止用于打造竞品
- Gemini Omni Flash 支持个人数字分身视频
全球 AI 资讯 5. 斯坦福建 AI Observatory,独立核验大模型真实用法 6. Nous 给开源 Hermes Agent 加 Bot Mode,多机器人协作 7. 研究:AI 压缩上下文,平均丢掉 83% 的用户指令 8. Amp 推教育折扣,学生教师 Megawatt 半价
区域与早期信号 9. 阿里发布 AI 音乐模型 HappyShrimp,端到端整曲生成 10. 豆包「工作任务」上线虚拟桌面,可操作 Windows 电脑

九凤根据本期已引用来源整理。
热门模型动态
Claude Code 上线 /design,终端里直接出界面草图
写码前先在终端里生成可编辑的 UI 草图,选中一版再开工。
Anthropic 发布了 Claude Code 中 /design 命令的早期预览。开发者输入类似 /design a few options for {feature} 的指令,Claude 会生成多份草稿作为 artboard,用户挑选喜欢的一版后可继续编辑再构建。据开发者 Nate Parrott,Claude 会读取现有代码库、匹配当前 UI 风格,并把可分享的 mockup 生成为 Artifacts。其编辑与提示能力来自 Claude Design,现已内置进 Claude Code,运行 claude update 即可获得。
局限:目前设计稿进入构建步骤后仍需手动保存;该命令为早期预览版,功能仍在完善。
来源:The Decoder · Nate Parrott(X)
DeepSeek V4 Pro 级联跑 DeepSWE,成本省六成
Together AI 实测:先用便宜的 V4 Pro、失败再升级到 GPT-5.6 Sol,通过率更高还更省钱。
Together AI 在 DeepSWE 基准上跑了 904 次 rollout,对比 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol。Sol 在早期尝试领先——pass@1 为 72.7% 对 62.8%,pass@2 为 81.0% 对 78.5%;但 Pro 赢在最后一次,pass@4 为 88.5% 对 85.8%。价格差达 35 倍:每次 rollout,Pro 约 $0.24、Sol 约 $8.37,每花 $100,Pro 解出 261 题、Sol 仅 9 题。若采用「先跑 Pro、测试失败再升级到 Sol」的级联策略,可解出 83.0% 的任务、每题 $3.35;而 Sol 单独跑为 72.7%、每题 $8.37——高十个百分点、便宜六成。
局限:Sol 更快更稳(每次 rollout 约 17 分钟、53 步,Pro 为 35 分钟、146 步),但它的失败更「脏」——20% 的失败会破坏原本已通过的测试(回归),Pro 只有 11%,Together 建议对 Sol 的输出加回归门。该对比为托管方 Together AI 自测,V4 Pro 0813 已在其 US 基础设施上线,1.05M 上下文、支持函数调用与 JSON 模式。
SpaceXAI 收紧 Grok 使用政策,禁止用于打造竞品
新版可接受使用政策禁止客户用 Grok 的服务或输出去帮助打造「直接或间接」的竞品。
SpaceXAI 更新了可接受使用政策,禁止客户使用其服务或输出去帮助打造与 SpaceXAI「直接或间接」竞争的产品。更新后的政策标注生效日期为 2026 年 8 月 14 日,适用于消费者、开发者和企业,违规可导致账号暂停或终止。对创业者影响最大的是这条更宽泛的竞品限制,它给了 SpaceXAI 很大的自由裁量权来决定客户能用 Grok 构建什么。
局限:政策页面的日期尚未完全落定——xAI 官方页面的一个已索引版本仍标注生效日期为 2026 年 6 月 26 日,且该页把 6 月 26 日版本列为前一版本。
来源:RuntimeWire · SpaceXAI 政策页
Gemini Omni Flash 支持个人数字分身视频
Google 把「录一次自己、再用提示词生成分身出镜」的能力放进了 Gemini。
Google 在 Gemini Omni Flash 中加入了个人数字分身(personal avatar)视频能力:用户录制一次自己,再写提示词,就能生成一个「自己」出镜的合成视频。在 Gemini Apps 中创建 avatar 需年满 18 岁并登录带 Google AI 套餐的个人账号;符合条件的 Google Workspace 用户还可在 Google Vids 中使用个人 avatar;Google 计划把该能力扩展到 YouTube Shorts 与 YouTube Create。AI 顾问 Ashutosh Shrivastava 曾于 5 月 25 日发布过用 Gemini Omni Flash 生成个人分身视频的演示。
局限:据报道,单个提示词就耗尽了五小时的使用额度;失败的生成与算力限制可能让该功能距离可靠的生产级工作流仍有距离。
来源:RuntimeWire · Google 官方博客 · Gemini Omni Flash 模型卡
全球 AI 资讯
斯坦福建 AI Observatory,独立核验大模型真实用法
研究者称大厂只公开自己想让外界看到的用法数据,斯坦福团队建平台补这块空白。
斯坦福 Trustworthy AI Research(STAIR)实验室联合发起了 AI Observatory 项目:一个公共平台,聚合并分析经用户同意、来自七个现有数据集的真实 AI 对话(涉及 Claude、Gemini 等模型),为研究者和政策制定者提供独立的使用情况信息源。共同负责人 Anka Reuel 称,当前没有独立来源可以佐证厂商发布的数据。研究发现:AI 使用在不同模型之间差异显著、且随时间变化。
局限:研究者指出,Anthropic、OpenAI 虽各自发过关于用户如何使用产品(如 Claude 用于情感陪伴)的报告,但这些报告更偏重工作场景、少报敏感行为,且缺乏独立佐证;Observatory 观察到的敏感行为远多于大厂报告所呈现的。
来源:MIT Technology Review · OpenAI 使用报告 · Anthropic 陪伴用途报告
Nous 给开源 Hermes Agent 加 Bot Mode,多机器人协作
Bot Mode 用一组命名机器人替代单会话列表,机器人之间通过持久收件箱互相 @ 交接任务。
Nous Research 为其 MIT 许可的开源智能体 Hermes Agent 发布了 Bot Mode。它用一组命名机器人(named bots)替代原来的单智能体会话列表,每个 bot 是真实的 Hermes profile,拥有独立的对话、记忆、技能和固定模型;bot 之间通过持久的 Agent Inbox 互发消息、用 @mention 交接工作。该功能最初由联创 Teknium 以「一天限时公测插件」形式发布,现已内置并在 Hermes Desktop 中默认开启,随 Hermes Agent v0.20.3 发货;Hermes Agent 与插件均为 MIT 许可。
局限:报道指出它适合个人开发者、初创和中小工程团队立即采用,但企业应视其为工作站工具而非托管基础设施——没有管理控制台、SSO、集中审计日志或策略层。
来源:MarkTechPost · Hermes Agent(GitHub)
研究:AI 压缩上下文,平均丢掉 83% 的用户指令
宾州州立研究发现,compaction 后平均只有 17% 的用户约束存活,一个小型附加模型能补回大部分。
宾夕法尼亚州立大学研究者系统研究了 AI 系统在压缩上下文(compaction,即总结历史对话以腾出空间)时会丢失哪些细节。他们发现损失最大的是所谓「会话约束」(session constraints)——例如「未经我批准不要发邮件」这类规则;平均只有 17% 的指令能在压缩后存活,即平均丢掉约 83%。研究者提出一个小型附加 LLM 模块,能修复大部分问题,并推出名为 COMPINT 的评测套件来衡量损失。
局限:该研究揭示的是现有长对话产品的系统性缺陷,普通用户往往把所有内容堆进同一个对话窗口而受影响最深;提出的附加模块也只能「修复大部分」而非全部。
来源:The Decoder · 论文(arXiv) · COMPINT(GitHub)
Amp 推教育折扣,学生教师 Megawatt 半价
编程智能体 Amp 面向学生和教师推出 5 折订阅,$10/月,含 750 小时 orbs。
编程智能体 Amp 面向学生和教师推出教育折扣:Amp Megawatt 从 $20/月 降至 $10/月(5 折)。套餐包含 750 小时的 orbs(远程机器)、无限公开/私有仓库、$10 的内置智能体用量;支持复用用户自己的 ChatGPT 或 𝕏 Premium+/SuperGrok 订阅;提供 low 与 medium 模式,链接 ChatGPT 订阅后还可用 high 模式。
局限:折扣仅面向学生与教师,需登录并填写表单验证身份后才能享受。

九凤根据本期已引用来源整理。
区域与早期信号
阿里发布 AI 音乐模型 HappyShrimp,端到端整曲生成
阿里 8 月 17 日发布 AI 音乐模型 HappyShrimp(快乐虾米),从作词、作曲、编曲到演唱一体生成。
8 月 17 日,阿里巴巴发布 AI 音乐模型 HappyShrimp(中文名快乐虾米)。它采用端到端整曲生成路线,把音乐当作有语法、语义和上下文的特殊语言,对语言描述、歌词、曲风、情绪、年代及人声等要求整体规划、同步创作,而非分头处理后拼接。官方称其既能理解「Lo-fi R&B」等专业表达,也能把「适合在咖啡馆播放的曲子」这类生活语言转化为音乐决策。上线首日宣布与太合音乐集团达成战略合作;即日起在国内(happyshrimp.cn)与海外(happyshrimp.ai)同步上线 PC 网页端,新用户享免费积分。
局限:以上为厂商发布说明,暂无独立评测或第三方样本验证生成质量(仅中文来源)。
来源:量子位
豆包「工作任务」上线虚拟桌面,可操作 Windows 电脑
豆包新增「豆包虚拟桌面」,在不接管用户鼠标键盘的前提下看懂界面、操作 Windows 应用。
豆包发布产品更新,「工作任务」模式下可通过全新的「豆包虚拟桌面」操作 Windows 电脑。据介绍,该能力基于更通用的 GUI 图形界面能力,模型在没有 MCP、API、插件和 CLI 的情况下也能看懂界面并完成操作,可在不干扰用户的环境中操作应用、浏览网页、完成跨软件任务,不抢占用户的鼠标、键盘;用户可实时查看操作过程,需要时随时暂停或接管。使用需在豆包官网下载最新的 Windows「豆包电脑版」,在工作任务模式中完成授权和初始化。
局限:目前仅支持 Windows「豆包电脑版」;以上为厂商产品说明,暂无独立实测(仅中文来源)。
来源:雷锋网
获取九凤最新的 AI 模型洞察与教程。
了解更多


