本文目录
AI 热点资讯

腾讯混元 Hy4 preview 开源,激活参数 49B

核心速览
  • 腾讯开源混元 Hy4 preview(770B 总参、49B 激活、上下文破 1M)领衔本期
  • 智谱 GLM-5.3-Flash 与阿里 Qwen3.8-Flash-Next 架构罕见趋同,Anthropic 论文称自动化研究员可缓解对齐失败,DeepMind Co-Scientist 走进实验室,Grok Bot 接入 Stripe 在线购物。
jiufeng
2026年8月29日
18 分钟阅读
腾讯混元 Hy4 preview 开源,激活参数 49B

概览

本期共 9 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · 腾讯混元 Hy4 preview 开源,770B 总参、激活 49B
  2. 重点 · GLM-5.3-Flash 与 Qwen3.8-Flash-Next 架构罕见趋同
  3. 重点 · Anthropic 论文:自动化研究员能可靠缓解对齐失败
  4. DeepMind AI Co-Scientist 走进实验室,能编程、控设备、写论文
  5. Grok Bot 接入 Stripe Link,可在线购物、每笔人工放行

全球 AI 资讯 6. OpenAI 被曝在 ChatGPT 桌面端内建 Office 文件任务系统 7. Cloudflare 发布 Kitesurf,给 AI 智能体的轻量浏览器引擎 8. Vercel 开源 vgpu:给 AI 智能体着色器的 TypeScript WebGPU 库 9. Decathlon 用亚马逊 Chronos-2 跑大规模需求预测

2026-08-29 AI 热点信号地图
2026-08-29 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

腾讯混元 Hy4 preview 开源,770B 总参、激活 49B

腾讯放出面向 Agent 与 Coding 的新一代开源大模型,并称其首次参与「训练自己」。

腾讯 8 月 28 日发布并开源混元 Hy4 preview,总参数 770B、激活参数 49B,上下文长度突破 1M,面向 Agent、Coding 与生产力场景优化。据介绍,相比上一代,它在多步骤 Agent、代码开发与生产力任务上有所提升,重点改善任务拆解、上下文承接、指令遵循与长链路执行。腾讯称 Hy4 preview 首次参与训练方法、数据策略、评估体系与底层算子的自动优化:模型提出方案、运行实验并据结果迭代,形成初步的递归自我改进闭环;它还自主分析推理系统瓶颈,围绕算子融合、通信优化把端到端吞吐相较基线提升 31.8%。

定价走普惠路线:输入 6 元/百万 tokens、输出 18 元/百万 tokens、缓存命中 0.3 元/百万 tokens;已在 WorkBuddy/CodeBuddy 国内外版、元宝、ima 首发,也可经腾讯云 Tokenhub 和 OpenRouter 调用 API,WorkBuddy/CodeBuddy 同步开启为期两周的限时免费。需要留意的是,「递归自我改进」与 31.8% 吞吐提升均为腾讯自述数据;InfoQ 用 WorkBuddy 实测的结论是它「有了小型团队交付实力,但还得有人盯」,即复杂任务仍需人工监督。

tencent/Hy4-preview · Hugging Face
tencent/Hy4-preview · Hugging Face

图片来源:huggingface;已转存至九凤 R2。

来源:Hugging Face · GitHub · InfoQ 中文

GLM-5.3-Flash 与 Qwen3.8-Flash-Next 架构罕见趋同

智谱与阿里前后一天开源两款模型,独立设计却把配置写得几乎照抄彼此。

MarkTechPost 拆解本周相隔一天发布的两款开源权重模型:智谱 Z.ai 的 GLM-5.3-Flash 是 GLM-5 系列首个原生多模态 MoE,320B 总参、18B 激活,MIT 许可证在 Hugging Face 开放,曾以「Ox Alpha」匿名登上 OpenRouter 人气榜;阿里 Qwen 的 Qwen3.8-Flash-Next 为 125B 模型、6B 激活,预览 Qwen4 架构。两支团队独立设计,配置却近乎雷同:同用 3:1 的线性与全注意力混合、把上下文用压缩索引器压到 2048 token 上限再打分、把残差流拓成 4 条门控分支、都用 Muon 优化器(融合参数矩阵在正交化前拆分)。

Qwen3.8-Flash-Next 以 48 层堆叠,每个重复块含 3 层 Gated DeltaNet 加 1 层 Qwen Sparse Attention(QSA);据 MarkTechPost,Qwen 将最高 7.6 倍预填充、4.9 倍解码加速(相对全注意力、1M token)归功于 QSA。这是第三方对两款已发布模型的架构对比分析,趋同是观察结论,并非两家的联合声明。

来源:MarkTechPost · GLM-5.3-Flash(Hugging Face) · Qwen3.8-Flash-Next(vLLM recipe) · NVIDIA 开发者博客

Anthropic 论文:自动化研究员能可靠缓解对齐失败

Anthropic fellows 项目研究员公布早期结果,自动化系统在 10 项对齐基准上全部改善且不拖累整体表现。

Anthropic 于 8 月 28 日发布论文《Automated Researchers Can Reliably Mitigate Alignment Failures》,展示用 AI 系统去改进模型在一组对齐基准上的表现。给定 10 项针对特定「失准行为」的基准后,自动化系统在每一项上都取得改善,且没有拖累模型的整体表现。TechCrunch 称,这是「用 AI 训练 AI」这一近期热门目标的一次早期实景。

需注意,这是研究预览而非产品:结果限于这 10 项对齐基准,报道定位为对自我改进 AI 的「一瞥」,尚未涉及更广部署或长期稳定性验证。

来源:TechCrunch · Anthropic 论文

DeepMind AI Co-Scientist 走进实验室,能编程、控设备、写论文

Google DeepMind 把 Co-Scientist 从假设生成器扩成闭环研究系统,跨三个学科给出经实验验证的结果。

据 The Decoder,Google DeepMind 把多智能体系统 Co-Scientist 从「提假设」升级为嵌入实验室的研究伙伴,底座为现有 Gemini 模型。新系统能从研究问题推导假设、编写代码、生成机器可读的实验方案、分析结果并撰写论文,形成闭环;其验证模块会把文本中的数值主张与所生成代码的执行日志交叉核对,以减少捏造结果。Google 称该系统已在三个学科给出经实验验证的成果,论文发在 arXiv。Co-Scientist 最早于 2025 年 2 月基于 Gemini 2.0 推出,当时在事实核查和文献综述上存在不足。

局限也被点出:论文一作 Samuel Schmidgall 提到前驱材料仍需人工准备,快速模式产出的晶体比精心优化的配方更小、更不均匀;这些配方能否迁移到其他实验室仍是未知。

来源:The Decoder · arXiv 论文 · 一作 X 帖

Grok Bot 接入 Stripe Link,可在线购物、每笔人工放行

SpaceXAI 给上线两周的浏览器智能体加上单次授权支付,从查商品走到能下单。

据 RuntimeWire,SpaceXAI 的浏览器智能体 Grok Bot(@bot)现可用 Stripe Link 的单次性支付卡完成在线购买,从「帮你查商品」扩展到真正下单。用户先连接 Link 钱包,告诉 Bot 要买什么,随后会收到对拟议扣费的批准请求;批准后 Link 为该笔支付生成一张一次性安全卡,Bot 负责浏览、选品与结账。该功能初期面向美国用户,移动端稍后开放。Grok Bot 于 8 月 11 日上线,是一组运行在云端计算机、可访问浏览器、终端、文件和已登录网页服务的持久智能体。

设计上保留了人工闸门:每笔支出都要用户逐笔授权,Bot 不能自行决定花钱。SpaceXAI 的安全文档也指出,一旦涉及金钱,智能体做错决定的代价随之升高。

来源:RuntimeWire · SpaceXAI 公告 · 安全文档

全球 AI 资讯

OpenAI 被曝在 ChatGPT 桌面端内建 Office 文件任务系统

逆向发现的未发布功能,把 Excel、PPT 里的批注变成可批量派给 ChatGPT 的线程任务。

RuntimeWire 通过逆向 OpenAI Windows 桌面包 OpenAI.Codex_26.825.4187.0 的生产版 app.asar,发现 ChatGPT/Codex 桌面客户端内建了一套尚未公布、受限开放的审阅系统,代号「Artifact comments」。它含两套并行批注:一套是原生 Excel、PowerPoint 批注,直接存进 Office 文件;另一套是分配给 ChatGPT 的私有批注线程,持久但不导出。用户可选中 Excel 区域、图表或 PPT 幻灯片、形状,附上批注或任务、批量提交,待智能体处理底层文件后收到线程回复,把文档审阅变成可委派的智能体工作。

证据边界要写清:这是基于逆向工程的单源独家,功能未经官方发布、仍处受限状态;报道另引 OpenAI 关于 ChatGPT Work 的文档与 Codex 页面作为背景,但未见官方就该功能作出确认。

来源:RuntimeWire · ChatGPT Work 文档 · OpenAI Codex 页面

Cloudflare 发布 Kitesurf,给 AI 智能体的轻量浏览器引擎

在 Workers 上跑 Rust/WebAssembly 渲染,主打截图和 HTML 提取,但还替代不了 Chromium。

Cloudflare 推出面向自动化负载的轻量浏览器 Kitesurf,在 Cloudflare Workers 的隔离 WebAssembly/Rust 环境中运行浏览器组件,支持 Chrome DevTools 协议,可让 Playwright、Puppeteer 以低于完整 Chromium 的开销驱动它。它专为截图、HTML 提取设计,用基于 Rust 的 Blitz 渲染引擎和 Firefox 的 Stylo CSS 解析器,把每个页面或跨进程 iframe 放进长生命周期的 Dynamic Worker,各自拥有独立 JS 环境与 DOM。Cloudflare 认为智能体应优先考量词元消耗、可扩展性、成本与结构化内容,而非像素级视觉还原。

局限明确:Kitesurf 目前还不能替代 Chromium,尚不支持视频、WebGL、真实环境下基于 TLS 的机器人验证与长时效已认证会话,CDP/WPT 兼容仍待完成;Cloudflare 称计划很快开源但现阶段未公开代码。Hacker News 上有网友对这家同时运营全球最大 CDN 与安全产品的公司提出潜在利益冲突质疑。

来源:InfoQ · Blitz(GitHub)

Vercel 开源 vgpu:给 AI 智能体着色器的 TypeScript WebGPU 库

Vercel 把自家网站用的 WebGPU 库开源,同一段 shader 可跑在浏览器、Node 与 CI。

Vercel 开源了它为 vercel.com 上线着色器而自建的 WebGPU 库 vgpu。这个 TypeScript 库把 .wgsl 文件当作可导入模块,暴露单一 Gpu 上下文,同一段 shader 能在浏览器 canvas、无头 Node.js 与 CI 快照测试中运行;init() 获取适配器与设备后返回一个 Gpu 句柄,其余能力都挂在其上。它以 MIT 许可证发布到 npm,pnpm add vgpu 即可获取。

可用性边界:vgpu 是库而非托管服务,没有账号、配额或推理账单;它要解决的是 WebGPU 原生开发中适配器、绑定组布局与管线描述符的繁琐,而非提供在线推理。

来源:MarkTechPost · vgpu(GitHub)

Decathlon 用亚马逊 Chronos-2 跑大规模需求预测

迪卡侬评测多款时序基础模型后选定 Chronos-2,作为其预测栈核心在 AWS 上运行。

据 AWS 机器学习博客,全球最大体育用品零售商之一迪卡侬(10 万名员工、4 亿用户、覆盖 80 多个运动品类、跨多大洲销售数万种商品)在评测多款时序基础模型后,选定亚马逊 Chronos-2 作为其预测栈的核心组件,用于大规模周需求预测。博客称 Chronos-2 把预测精度提升了 11–15 个百分点,进一步微调可再把误差降低数个百分点。Chronos-2 是一款约 120M 参数、遵循 T5 编码器设计的 encoder-only Transformer,权重在 Hugging Face 开放。

证据边界:这是 AWS 与迪卡侬联合撰写的部署案例,属于「被谁采用」的落地信号;上述量化收益出自这篇厂商联合博文,未见独立第三方复核。

来源:AWS 机器学习博客 · amazon/chronos-2(Hugging Face)