概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Meta 开源 Muse Glimmer,30B 单卡可跑
- 重点 · Anthropic 发布 Claude Sonnet 5
- 重点 · Anthropic 将为未来 Claude 文本全球加水印
- Cactus 发布 Needle 2:14MB 端侧智能体模型
全球 AI 资讯 5. 英伟达拉六家华尔街机构,组超 5000 亿美元 AI 算力融资平台 6. 微软正式发布 Agent Framework Harness 与 Hosted Agents 7. VectorWare 把 Rust 可移植 SIMD 映射到英伟达 GPU
区域与早期信号 8. 200 美元从零训练 10 亿参数模型 9. 千问办公 Qwen3.8:精致的单点工具,数据不随设备走

九凤根据本期已引用来源整理。
热门模型动态
Meta 开源 Muse Glimmer,30B 单卡可跑
Meta 发布 Apache-2.0 开源智能体模型,单张消费级 GPU 即可运行。
Meta 发布开源权重智能体模型 Muse Glimmer,参数 30B,许可证 Apache 2.0,可装入 24 GB 显存的单张消费级 GPU。官方称配合自研的 DFlash 投机解码,解码速度提升 3.1 倍。Hugging Face 合集提供 BF16 权重、GGUF k-quant 量化、ExecuTorch 构建与 DFlash 草稿模型,支持自托管部署。
局限:3.1 倍加速是官方基于自家 DFlash 方法给出的数字,需搭配草稿(drafter)模型才能达到;这是一款 30B 开源权重智能体模型,具体能力尚无第三方基准评测,效果有待独立验证。

图片来源:huggingface;已转存至九凤 R2。
来源:MarkTechPost · Hugging Face 合集
Anthropic 发布 Claude Sonnet 5
官方称是「迄今最具智能体能力的 Sonnet」,定价每百万输入/输出 tokens 为 $2/$10。
Anthropic 在官网发布 Claude Sonnet 5,定位为「迄今最具智能体能力的 Sonnet」,主打编程与日常专业办公的「顶级智能」。官方定价为每百万输入 tokens $2、每百万输出 tokens $10,低于同门 Opus 4.8 的 $5/$25。公告引用 System Card,并给出 BrowseComp、OSWorld-Verified 等评测图表。
局限:基准成绩与定价均出自 Anthropic 官方公告(含 System Card 自测数据),本轮候选中仅此一个一手来源,第三方独立评测尚未出现,能力对比有待验证。
Anthropic 将为未来 Claude 文本全球加水印
新政覆盖 API 与云合作伙伴,生成文件在支持处附带 C2PA 溯源元数据。
Anthropic 宣布将对未来 Claude 模型生成的文本在全球范围加水印,政策覆盖 Claude 的 API 与云合作伙伴;在支持 C2PA 的环境下,生成文件会携带 C2PA 溯源元数据。该计划在周一(8 月 10 日)经用户 M1(@M1Astra)转发后引发更广关注。
局限:在指定日期之前发布的模型设有过渡期,Anthropic 称仍在为它们补齐加标记支持,即旧模型暂未覆盖;C2PA 元数据也仅在支持处附带。文本水印的具体实现与抗篡改强度,来源未展开。
来源:RuntimeWire · M1(@M1Astra)
Cactus 发布 Needle 2:14MB 端侧智能体模型
面向手机、可穿戴、智能家居与小型机器人的工具调用与结构化抽取模型。
Cactus 团队(发帖人 Henry)发布 Needle 2,一款体积仅 14MB 的智能体 LLM,面向手机、可穿戴设备、智能家居和小型机器人,主打工具调用、设备操作与结构化信息抽取。此前团队已发布同为 14MB 的初代 Cactus Needle,本次为迭代版本,并配有 arXiv 论文(2607.18363)。
局限:模型通过 Show HN(Hacker News)发布,定位是端侧工具调用与结构化抽取,并非通用对话;14MB 的体量决定其能力边界。技术细节以配套 arXiv 论文为准。
来源:arXiv · Hacker News
全球 AI 资讯
英伟达拉六家华尔街机构,组超 5000 亿美元 AI 算力融资平台
英伟达联手阿波罗、贝莱德等六家投资机构,为其客户建 AI 基建融资池。
英伟达周一(8 月 10 日)宣布,与阿波罗(Apollo)、贝莱德(BlackRock)、黑石(Blackstone)、Brookfield、高盛(Goldman Sachs)、KKR 六家投资机构签署初步协议,设立 AI 算力基础设施融资平台,计划撬动超过 5000 亿美元的第三方资本,为建设 AI 基建的英伟达客户提供融资池。
局限:目前为初步协议(preliminary agreements)。RuntimeWire 分析称,此举意在把「获取资本的能力」变成又一个拉动英伟达硬件销售的引擎,即融资安排与自家硬件销路直接绑定。
来源:英伟达官网 · RuntimeWire
微软正式发布 Agent Framework Harness 与 Hosted Agents
Harness 与托管智能体从「构建库」升级为可运行、可管理的平台能力。
微软正式发布 Agent Framework 的 Harness 与(Foundry)Hosted Agents,让平台团队不只是拿到一个构建智能体的库,而是有了运行和管理智能体的途径。Harness 以单个二进制文件形态,可跨本地开发、容器与托管部署环境运行。InfoQ 引用 MBZUAI 旗下 VILA 实验室 2026 年 4 月论文《深入解析 Claude Code》(分析 Claude Code v2.1.88)指出,Harness 占据了智能体系统的大部分,因此一个受支持的 Harness 比表面上更重要。此前该框架曾被视作对开源项目 Semantic Kernel 与 AutoGen 的整合。
局限:Harness「占大头」的论据来自第三方学术论文对 Claude Code 的分析,而非微软自家基准;正式发布内容以官方与 InfoQ 报道为准。
来源:InfoQ 中文 · InfoQ(英文) · arXiv
VectorWare 把 Rust 可移植 SIMD 映射到英伟达 GPU
编译器团队让普通 Rust 抽象跨越 GPU 线程、通道与异步执行。
VectorWare(创始人 Christian Legnitto)于 8 月 10 日演示了 Rust 的可移植 SIMD API 在英伟达 GPU 上运行。其编译器团队把 GPU 的 warp 当作又一种向量目标——英伟达把 GPU 线程按每 32 条通道(lane)组织成一个 warp——从而让开发者只写一次可移植 SIMD,而不必为每套指令集各维护一份实现。
局限:目前为演示(demonstration)阶段,尚非可用产品;可移植性是针对英伟达 GPU 的 warp 模型展示的,跨更多目标的成熟度未说明。
来源:RuntimeWire · NVIDIA CUDA 文档
区域与早期信号
200 美元从零训练 10 亿参数模型
一名开发者用约 200 美元、200 亿 token 从零训出 1B 模型,代码与权重开源可复现。
一名开发者作为个人学习/简历项目,用约 200 美元、在 200 亿(20B)token 上从零训练出一个 10 亿(1B)参数 LLM。模型刻意只用 2024 年前数据、设人为知识截止,以便做「意外性」实验(用 logprobs 衡量模型对截止后事件的可预测程度)。架构相对 Gemma 3 的主要改动是去掉滑动窗口注意力;词表 32,768(Gemma 为 262,144),仅英文,采用字节回退(无 UNK)并拆分数字。代码与权重托管在 GitHub,可复现。
局限:这是个人学习/简历性质的小项目,仅英文、数据截止 2024 年前,并非生产级模型;设计参考了 Llama 论文的部分做法。
来源:GitHub · arXiv(Llama 论文)
千问办公 Qwen3.8:精致的单点工具,数据不随设备走
钛媒体实测:好用但是「单点工具箱」,换台电脑本地数据就丢。
钛媒体对基于 Qwen3.8 的「千问办公」做了实测,结论是一个「精致的单点工具箱」:单点体验打磨到位,但产品能力偏孤立。实测暴露的一个具体局限是——数据本地存储、不随账号跨设备同步,换一台电脑此前的数据就会丢失。
局限:以上为钛媒体单一中文媒体的实测判断,非厂商指标;「数据丢失」是评测者在具体使用中的发现,覆盖版本与场景以原文为准(Chinese-language source)。
来源:钛媒体
获取九凤最新的 AI 模型洞察与教程。
了解更多


