概览
本期共 10 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Qwen3.8-27B 智能体评测第 15,社区仍热捧本地部署
- 重点 · AI 涌入美国国会,Claude 回复被误粘进《国防授权法案》
全球 AI 资讯 3. 重点 · Rootly 废止「小 PR」规则:AI 按「特性」而非「增量」写码 4. SuperApp(原 Instabase)上线团队 AI 协作空间 5. DoiT 收购 Attribute,把 AI 成本追踪下沉到内核层 6. 美国大选:AI 与数据中心跃升头号议题
区域与早期信号 7. vLLM 分布式逐层卸载:64GB 显存跑 124GB 模型 8. 北大 × 阶跃星辰提出 TensorCast,首 token 时延最高降 93.2% 9. YC 开源企业级 Agent Harness「QM」,3 天 3.9k 星登顶 HN 10. updream 上线「预演台」,AI 视频转向可视化预演

九凤根据本期已引用来源整理。
热门模型动态
Qwen3.8-27B 智能体评测第 15,社区仍热捧本地部署
第三方 WildClawBench 把这款 27B 开源模型列为 33 款中的第 15,成绩落后于更大的托管系统,但本地社区仍在围绕它做工程改造。
RuntimeWire 报道,阿里 Qwen3.8-27B 在 WildClawBench 的 60 项智能体任务中得 48.0%,在 33 款模型里排第 15;测试经 OpenClaw harness 运行,完成耗时 516 分钟,成本一栏标注"不可用"。其成绩落后于 OpenAI、Anthropic、xAI、Moonshot 以及阿里自家 Qwen3.8-Max 等更大或托管的系统,但高于上一代 Qwen3.6-27B。模型以 Apache 2.0 权重开放,原生支持视频输入,上下文可扩展到 100 万 token。
与冷静的第三方评测相比,本地大模型社区更为热情。InfoQ 报道,开发者 Sudo Su 公开了针对该模型的加速工程仓库 qwen38-mtp,长期测评本地模型、拥有 7 万余订阅的 YouTuber Bijan Bowen 用 Q8 量化在 RTX Pro 6000 上连测浏览器 OS、3D CAD、FPS 游戏、C++ 与多模态建模,称其"多数任务表现明显超出参数规模"。需要注意,WildClawBench 未给出自托管部署的成本数据,官方托管版尚未上线,能否在目标硬件上稳定完成任务仍需自测。

图片来源:huggingface;已转存至九凤 R2。
来源:RuntimeWire · InfoQ · Hugging Face
AI 涌入美国国会,Claude 回复被误粘进《国防授权法案》
ChatGPT、Claude、Grok 成为国会山常用工具,一名议员助理把 Claude 生成内容直接复制进法案公开记录。
据《华盛顿邮报》(IT之家编译),OpenAI 的 ChatGPT、Anthropic 的 Claude、xAI 的 Grok 正快速成为美国国会议员与助理的常用工具。佛罗里达州共和党众议员安娜·保利娜·卢纳的办公室出过一桩事故:工作人员把 Claude 生成的一段内容直接粘进《国防授权法案》的公开记录,留下"increasing example specific factors. Identical to H.R. 100 (118th Congress).11:25 AM????Claude responded:"这样的残留文字。卢纳本人不认为起草法案时用 AI 有何异常,称助理们常用 ChatGPT、Claude 和 Grok,她个人更偏好 Grok。
报道指出,国会山目前几乎没有针对 AI 使用的有效监管,现有规定零散宽松,也没有工作人员因违规使用 AI 而受到正式纪律处分。部分助理开始自设规则,如民主党众议员克利奥·菲尔兹的助理表示绝不用 AI 从零起草文件。这属于个案披露,尚无关于国会 AI 使用规模的系统统计。
来源:IT之家(中文来源,编译自《华盛顿邮报》)
全球 AI 资讯
Rootly 废止「小 PR」规则:AI 按「特性」而非「增量」写码
事故管理公司 Rootly 放弃沿用两年的小型拉取请求文化,改以"爆炸半径"而非代码行数衡量变更风险。
InfoQ 报道,Rootly 联合创始人兼 CTO Quentin Rousseau 称,公司曾要求用堆叠式 PR、把原子变更限制在几百行内——这在人类手写代码时合理,因为小 diff 更易审查与回滚。但 AI 智能体以"特性"而非"增量"为单位思考,会一次性输出含数据库迁移、模型、服务、控制器、测试和前端组件的完整实现,旧规则反成开销。团队指出,AI 引发的多是"上下文漏洞":代码本身能跑,却用错了场景,例如迁移删掉了后台任务仍在调用的字段。
Rootly 的做法是自建 AI 代码审查器,对每个 PR 只回答一个问题:若变更有缺陷,会破坏哪些面向用户的功能,并输出风险评估、标准化评分与按严重程度分类的问题。特性开关把安全边界从"合并"移到"发布":PR 合并后特性默认关闭,真正的审查发生在灰度放量(团队内→少量客户→10%→全量)。该文基于 Rootly 单方博客与一场 QCon 演讲,代表其内部实践,未给出横向对照数据。
SuperApp(原 Instabase)上线团队 AI 协作空间
更名后的 SuperApp 推出类 Slack 协作平台,底层路由在 OpenAI、Anthropic、Google 模型间自动选型。
SiliconANGLE 报道,Instabase 公司正式更名 SuperApp 并发布同名旗舰产品:一个面向团队的类 Slack 协作界面,覆盖 Web、iOS、Android 与 Windows,配有类 Google Docs 的文档库,并深度接入 OpenAI、Anthropic、Google 的模型。用户无需自己挑模型,底层路由会按效率、推理、知识与成本自动选型,也可手动指定或在同一上下文里对比多款模型。
公司称产品围绕"模型、数据、云"的自由选择设计,目标是让用户在不重建应用、不迁移数据的前提下更换模型,避免架构或厂商锁定;创始人兼 CEO 称"最好的 AI 会一直变,你的工作不该跟着变"。发布稿未披露定价、企业客户数量或路由的具体命中策略。
来源:SiliconANGLE
DoiT 收购 Attribute,把 AI 成本追踪下沉到内核层
云成本管理公司 DoiT 收购成立于 2023 年的 Attribute,CTech 估价约 6500 万美元。
RuntimeWire 报道,DoiT 收购了 AI 成本归因公司 Attribute,将其技术并入一款能显示"每一笔 AI 账单由哪个客户、功能或智能体产生"的产品。Attribute 由 Izhak Zimmermann 与 Liad Tropp 于 2023 年创立(两人出自以色列军事情报技术单位 Unit 81),主张传统按标签切分云账单的方式跟不上共享 GPU、LLM 网关与智能体负载,转而在内核层观测。DoiT 已于 7 月 7 日上线整合后的 Attribute 产品。
CTech 于 8 月 17 日公开报道此次收购并估价约 6500 万美元,但确切成交日期未确定;DoiT 与 Attribute 均未确认价格,CRN 称财务条款未披露。因此金额目前仍为第三方估算,而非双方公布数字。
来源:RuntimeWire · AWS
美国大选:AI 与数据中心跃升头号议题
《华盛顿邮报》分析逾 1200 个候选人网站,AI 出现在近四成竞选中,排名超过以色列、制造业与种族议题。
The Decoder 转述《华盛顿邮报》分析:在众议院、参议院和州长竞选里,AI 议题出现在近 40% 的选战中,其中数据中心及其对本地电价、用水与土地的影响是讨论焦点。AI 的关注度已超过以色列、制造业、种族等长期议题。民主党候选人提及 AI 的频率约为共和党的两倍,侧重风险、监管与儿童安全;共和党更多谈国家安全与对华竞争。
报道同时引述另一些民调,显示多数美国人对 AI 持怀疑态度、担心失业。该结论基于候选人网站文本分析,反映的是竞选议程设置,而非投票结果或政策落地。
来源:The Decoder
区域与早期信号
vLLM 分布式逐层卸载:64GB 显存跑 124GB 模型
vLLM-Omni 通过跨设备切分并流式加载 DiT 权重,实测在 64GB HBM 上服务 124GB 的 Cosmos3 模型。
vLLM 官方博客介绍了 Distributed Layerwise Offload:将 DiT 模型的权重按层切分、跨设备流式加载,从而在显存小于模型体积的硬件上运行。团队报告在 64GB HBM 上服务了实测 124GB 的 Cosmos3 模型,并据此估算了迈向 200B+ 参数 DiT 模型的路径。
这是面向大体量扩散/视频模型的服务侧优化,属工程方法而非新模型。博客给出的是单一配置下的实测与外推,跨模型、跨硬件的吞吐与时延表现仍需更多公开数据验证。
来源:vLLM Blog
北大 × 阶跃星辰提出 TensorCast,首 token 时延最高降 93.2%
北京大学、阶跃星辰与北京邮电大学提出统一可编程的张量生命周期管理层,报道称可把 LLM 首 token 时延降低最高 93.2%。
Pandaily 报道,北大、阶跃星辰(StepFun)与北邮联合提出 TensorCast——面向大模型基础设施的统一、可编程张量生命周期管理抽象。报道称该方案可将 LLM 的首 token 时延(Time-to-First-Token)最高降低 93.2%。
这是一项聚焦推理服务侧的系统工作。目前仅见单一英文媒体报道,未见论文全文与完整基准条件(如模型规模、硬件、对照基线),"最高 93.2%"为报道给出的上界,具体适用范围仍需一手材料核实。
来源:Pandaily
YC 开源企业级 Agent Harness「QM」,3 天 3.9k 星登顶 HN
Y Combinator 开源面向多人协作的 Agent 管控框架 QM,上线 3 天获 3.9k GitHub 星、当日登顶 Hacker News。
雷锋网报道,孵化器 Y Combinator 开源了企业级 Agent Harness 项目 QM,3 天斩获 3.9k GitHub Star、官宣当日登顶 Hacker News。区别于 Claude Code、OpenClaw、Hermes 等主打个人生产力的 harness,QM 不直接执行业务任务,而是为团队提供执行环境、上下文与记忆管理、工具权限调度与行为边界约束,主打数据隔离、权限治理、环境统一与审计合规。
文章将 Agent 产业分为三层:底层大模型负责思考决策、中间层 Agent 执行任务、外层 harness 做管控。报道为中文单一来源,未给出 GitHub 仓库地址与许可证等一手细节,具体能力边界需以项目实际文档为准。
来源:雷锋网(中文来源)
updream 上线「预演台」,AI 视频转向可视化预演
updream 推出预演台功能:上传场景参考图即可生成 3D 白模,供创作者摆位、设机位、调关键帧后再交模型生成。
爱范儿实测,AI 视频工具 updream 上线"预演台":无需建模,上传场景参考图(建议广角/鸟瞰、人物少、一次最多 3 张,生成约 4–7 分钟)即可自动生成可用的 3D 白模场景。创作者可在其中放置人物、设定机位与运动轨迹、调整关键帧,并用内置的相对位置跟随或轨迹跟拍逻辑控制镜头,最后选择模型渲染生成,把原本依赖 Prompt 的空间与镜头调度转为可视化预演。
文章以电影《牛来》走红为引子,指出画面变强后"镜头调度"仍难用一句提示精确控制。此为单一中文来源的产品实测,效果与适用范围以官方功能为准,未涉及定价与开放范围。
来源:爱范儿(中文来源)
获取九凤最新的 AI 模型洞察与教程。
了解更多


