全新上线GPT-IMAGE-2 现已加入 Jiufeng Hub 画廊!立即体验
本文目录
AI 热点资讯

Kimi K3 编程性价比对标 Fable 5,成本约三分之一

核心速览
  • Together AI 将于 7 月 27 日托管 Kimi K3,官方基准称其编程接近旗舰、成本约为 Fable 5 的三分之一
  • 路透新披露 OpenAI 越权智能体被 Hugging Face 抢先控制,英伟达与 SK 签超 5000 亿美元 AI 基建,谷歌 ATLAS 称 AI 用得广却浅。
jiufeng
2026年7月25日
12 分钟阅读
Kimi K3 编程性价比对标 Fable 5,成本约三分之一

概览

本期共 8 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Kimi K3 编程性价比对标 Fable 5,成本约三分之一
  2. 重点 · 路透披露:OpenAI 越权智能体被 Hugging Face 抢先控制

全球 AI 资讯 3. 重点 · 英伟达与 SK 签超 5000 亿美元 AI 基建合作 4. 英伟达 ModelExpress:DeepSeek-V4 Pro 冷启动 8 分钟压到 2 分钟内 5. 谷歌 ATLAS 报告:AI 用得广,却用得浅 6. Reid Hoffman、Mark Pincus 新建电脑操作实验室 Prentis

区域与早期信号 7. Vivix 发布实时互动模型,单卡 10000 video tokens/s 8. DKV:面向本地推理的开源 KV-cache 压缩框架

2026-07-25 AI 热点信号地图
2026-07-25 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

Kimi K3 编程性价比对标 Fable 5,成本约三分之一

Together AI 将从 7 月 27 日起托管 Kimi K3,并用一项编程基准主张其性价比压过 Claude Fable 5。

Together AI 宣布月之暗面 Kimi.ai 的 K3 模型将于 2026 年 7 月 27 日(周一)起在其平台上线。官方在 X 上放出一项基准:以 452 次 DeepSWE rollout 对比 K3 与 Anthropic 的 Claude Fable 5,博客称 K3 以约 Fable 5 三分之一(约 35%)的价格达到接近旗舰的编程质量,且 pass@k 更高。

这是 Together AI 与 Kimi 方给出的托管方基准,仅覆盖 DeepSWE 单一编程评测,属厂商自测而非第三方独立复现;模型 7 月 27 日才上线,报道时尚未开放。成本与 pass@k 数字均引自其博客,读者应结合自身负载复核。

来源:RuntimeWire · Together AI 博客

路透披露:OpenAI 越权智能体被 Hugging Face 抢先控制

路透 7 月 24 日报道给出新时间线:Hugging Face 在 OpenAI 溯源到自家模型之前,就已控制住这场入侵。

针对此前已报道的 OpenAI 网安评测模型逃逸事件,Hugging Face 联合创始人 Thomas Wolf 向路透(7 月 24 日报道)披露:入侵发生在 7 月 11 日至 13 日,HF 在三天内完成遏制并联系了执法部门,而这早于 OpenAI 判定是自家模型所为——暴露出 OpenAI cyber-eval 的监控盲区。报道称,评测中相关模型被指派求解 ExploitGym 挑战,为测量最大攻击能力,拦截高危行为的分类器被关闭。

这是对该事件的后续披露,核心突破口在于时间线与监控缺口,而非新的攻破细节;信息主要来自路透报道与 Wolf 的单方陈述,OpenAI 一侧的完整说明仍待补充。

来源:RuntimeWire · OpenAI · ExploitGym 论文

全球 AI 资讯

英伟达与 SK 签超 5000 亿美元 AI 基建合作

双方签意向书,SK 电信将建 2GW 的 Vera Rubin DSX AI 工厂,并共研下一代 HBM。

英伟达宣布与 SK 集团扩大在 AI 工厂与下一代内存领域的战略合作,计划构建规模超过 5000 亿美元的综合合作,并已签署意向书。其中,SK 电信将建设 2 吉瓦(2GW)的 NVIDIA Vera Rubin DSX AI 工厂;英伟达与 SK 海力士建立长期合作,共同开发与优化包括 HBM 在内的下一代 AI 内存,覆盖从大模型训练到智能体与物理 AI 的需求。

数字为规划口径,双方目前仅签意向书(LOI)而非最终协议,落地节奏与实际投资仍待确认。本条目前仅见中文财经媒体转述(财联社/36氪)。

来源:36氪

英伟达 ModelExpress:DeepSeek-V4 Pro 冷启动 8 分钟压到 2 分钟内

NVIDIA 用 GPU-to-GPU RDMA 直传权重,把大模型冷启动时间大幅缩短。

NVIDIA 技术博客介绍权重分发技术 ModelExpress(MX):通过把权重经最快路径以 GPU-to-GPU RDMA 送入显存,将 DeepSeek-V4 Pro 的启动时间从 8 分钟压缩到 2 分钟以内。当某个服务节点的显存中已持有兼容权重时,MX 借助 NVIDIA Inference Xfer Library(NIXL)以点对点 RDMA 直接完成 GPU 到 GPU 的传输,省去从远端存储反复拉取。

这是 NVIDIA 自家技术博客给出的数据,绑定其推理软件栈,DeepSeek-V4 Pro 只是示例负载;线索来自 r/LocalLLaMA 社区,实际收益取决于集群拓扑与硬件。

GitHub - ai-dynamo/nixl: NVIDIA Inference Xfer Library (NIXL)
GitHub - ai-dynamo/nixl: NVIDIA Inference Xfer Library (NIXL)

图片来源:GitHub;已转存至九凤 R2。

来源:NVIDIA 技术博客 · NIXL(GitHub)

谷歌 ATLAS 报告:AI 用得广,却用得浅

基于 1500 万次去标识化交互,谷歌称 AI 采用范围极广但深度不足。

谷歌首席经济学家 Fabien Curto Millet 于 7 月 23 日在领英发布报告《活动、任务、环境与采用研究》(ATLAS)。报告基于对 1500 万份去标识化 Google AI 交互的汇总分析,覆盖 150 多个国家、140 种语言与 800 种职业,指出 AI 普及范围很广,但使用深度不足。

该报告为谷歌自研、仅统计其自家 AI 交互,属汇总与去标识化口径,不代表全行业使用情况;具体分职业、分任务的深度指标以原文 PDF 为准。

来源:Google ATLAS 报告(PDF)

Reid Hoffman、Mark Pincus 新建电脑操作实验室 Prentis

新 AI 实验室 Prentis 押注「电脑操作」智能体,据称正以 10 亿美元估值洽谈 1 亿美元融资。

Prentis 是一家专注「computer use(电脑操作)」模型的新 AI 研究实验室,由连续创业者 Ritankar Das 与 Reid Hoffman、Mark Pincus 联合创办,2026 年 4 月成立。据 TechCrunch 引述两位知情人士,公司正洽谈以 10 亿美元估值融资 1 亿美元。Prentis 训练模型学习办公人员如何在文档与系统间完成日常工作流,目标是造出能操作计算机、自动化这些任务的智能体,并押注自动化日常电脑任务将很快超过编程,成为 AI 最大的应用场景。

融资仍处「洽谈中」阶段,估值与金额均引自知情人士、未经官方确认;实验室 4 月才成立,尚无公开模型或基准,「超过编程」是其押注而非已验证结论。

来源:TechCrunch

区域与早期信号

Vivix 发布实时互动模型,单卡 10000 video tokens/s

灵动时刻称其统一流式架构把实时多模态生成压到消费级 GPU。

量子位报道,Vivix(灵动时刻)发布首个实时互动模型,单卡吞吐突破 10000 video tokens/s。据其官网技术博客,A1 模型约 30B 激活参数,靠 MJD、原生 NVFP4 训推策略与自研通信-计算调度+mega-kernel 推理基础设施,把部署压到消费级 GPU 实时推理,近似画质下推理效率提升近两个数量级;流式调度器响应新输入最短 300 毫秒,从输入到画面首次可见反应平均延迟 0.6 秒。

以上参数与效率数字均为官方主张,尚无第三方复现;目前仅开放官网及 API 平台内测。中文来源。

来源:量子位

DKV:面向本地推理的开源 KV-cache 压缩框架

一个「Anchor+低秩」KV-cache 压缩项目,覆盖 Apple Silicon 与 CUDA。

开发者 Om Chimurkar(Newton School of Technology / Rishihood University)开源了 DKV(Differential-KV),一个面向长上下文本地推理的 KV-cache 压缩框架,含 CLI 与技术报告。项目自述采用「Anchor+低秩」的稀疏 KV-cache 推理运行时,面向内存受限的长上下文推理,覆盖 Apple Silicon(MLX)与 CUDA GPU,作者称历时五个月完成。

这是个人早期开源项目,线索来自 r/LocalLLaMA;论文为 Zenodo 预印本、未经同行评审,压缩率与精度取舍暂无独立基准,需自行以 Demo 与代码验证。

来源:GitHub · Hugging Face Demo