全新上线GPT-IMAGE-2 现已加入 Jiufeng Hub 画廊!立即体验
本文目录
AI 热点资讯

PerceptionBench:前沿模型视觉感知均不及格

核心速览
  • Moonshot 基准 PerceptionBench 实测:前沿模型视觉感知无一破 60%
  • RuntimeWire 曝 Kimi Work 反馈暗附最近五个会话原始记录
  • DeepSeek Harness 插件破 700、V4-Pro 明日涨价
  • 新研究给「自主 AI 研究已触手可及」泼冷水。
jiufeng
2026年8月15日
14 分钟阅读
PerceptionBench:前沿模型视觉感知均不及格

概览

本期共 8 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · PerceptionBench:前沿模型视觉感知均不及格
  2. 重点 · Kimi Work 反馈会悄悄打包最近五个会话的原始记录
  3. 重点 · DeepSeek Harness 开源后插件井喷,V4-Pro 明日涨价
  4. 研究打脸「自主 AI 研究已触手可及」

全球 AI 资讯 5. ChatGPT 桌面端藏了个「完成设置送额度」的引导实验 6. Cloudflare 给智能体加链路追踪

区域与早期信号 7. 索塔无界称 4D 物理世界模型落地欧洲商超(中文来源) 8. 鹿明发布 MOS2 轮臂机器人,双臂负载 50kg(中文来源)

2026-08-15 AI 热点信号地图
2026-08-15 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

PerceptionBench:前沿模型视觉感知均不及格

Moonshot 新基准把「看」从推理里剥离,结果没有一个前沿模型准确率破 60%。

Moonshot AI(Kimi 团队)发布 PerceptionBench,一个把视觉感知能力从逻辑推理与外部知识中剥离出来单独测试的基准。题目全部只需「看图」即可作答,不需要推理或额外知识;类别取自真实世界的识别错误,并把每道题拆成只考单一视觉能力的子问题,用来定位模型到底哪一环看错了。数据集与评测代码已在 GitHub 开源(MoonshotAI/PerceptionBench)。

在评测里,包括 GPT-5.6 Sol、Kimi K3、Claude Fable 5 在内的所有主力模型都暴露出明显短板,无一准确率达到 60%,GPT-5.6 Sol 仅以微弱优势领先。作者据此认为,许多被当作「推理错误」的失败,其实早在读图阶段就已发生——这与此前多项研究「顶尖模型仍会在基础视觉任务上翻车」的结论一致。

GitHub - MoonshotAI/PerceptionBench: PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
GitHub - MoonshotAI/PerceptionBench: PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

图片来源:GitHub;已转存至九凤 R2。

来源:The Decoder · PerceptionBench 博客 · GitHub

Kimi Work 反馈会悄悄打包最近五个会话的原始记录

RuntimeWire 逆向发现:在 Kimi Work 里提交反馈,会自动上传最近五个智能体会话的原始记录,表单却不列出。

RuntimeWire 逆向了 Kimi 桌面端 3.1.5 及其内置的 Daimon 0.5.49 服务,发现用户在 Kimi Work 提交反馈时,除诊断日志外,还会按 updatedAt 排序、自动打包「最近更新的五个」智能体会话的原始记录归档,并以 ZIP 上传至 /file/upload_simple。反馈表单既不列出这些附件,也不让用户选择包含哪些会话。在一次用 Windows 防火墙拦截的测试里,Kimi 确实选出了五个不同的会话 ID,各自走到 HTTP 上传阶段后以 ERR_NETWORK_ACCESS 失败——证明流程真实触发。

RuntimeWire 指出,Kimi Work 会处理私有文件、源码与 shell 输出,而官方帮助页只说反馈会附带「设备与账户上下文」,并未提及会附带近期会话的原始记录;打包但不逐条列出,使用户无法审阅究竟上传了哪些数据。这是 RuntimeWire 基于逆向与测试的单方发现,尚无官方回应。

来源:RuntimeWire · Kimi 帮助页

DeepSeek Harness 开源后插件井喷,V4-Pro 明日涨价

Harness v0.1 发布几天,GitHub 上带 dsh-plugin 标签的公开仓库已破 700 个;同批上线的 V4-Pro 将于 8 月 16 日调价。

DeepSeek 于 8 月 13 日以 MIT 许可证放出开源智能体运行时 Harness v0.1(开发者预览),让开发者可自由替换模型、工具与运行时,切入此前由 Anthropic Claude Code、OpenAI Codex 把持的编程智能体运行层。据量子位统计,发布没几天,GitHub 上打 dsh-plugin 标签的公开仓库已冲到 700+:有人接浏览器、长期记忆、数据库与视觉模型,也有人做电子宠物、像素鲸鱼和 18 款小游戏;DSH Better Sidebar 把文件管理、代码编辑、真实终端与 Git 面板塞进同一侧栏,dsh-plugin-claude-bridge、dsh-claude-move 则把 Claude Code 的记忆、Skill、CLAUDE.md 与旧会话整体迁入。

同批上线的还有 DeepSeek-V4-Pro 正式版(官方更新日志确认 8 月 13 日已覆盖 App、网页与 API),其 API 价格将于 8 月 16 日上调。RuntimeWire 提示,这次涨价恰好抬高了 Harness 所擅长的那类长链路、重缓存工作流的运行成本。Harness 目前仍是 v0.1 开发者预览,插件数量为社区在 GitHub 上的自发统计。

来源:RuntimeWire · 量子位 · GitHub

研究打脸「自主 AI 研究已触手可及」

普林斯顿与英国 AISI 给智能体六天、3000 美元额度和 GPU 自己写论文,结果卡在研究里最要紧的环节。

普林斯顿大学与英国 AI 安全研究所(AISI)发布新论文,用一种名为「Shadow Evaluation」的方法检验「模型已能自主做 AI 研究」的说法:让基于 Claude Opus 4.8 与 GPT-5.6 Sol 的智能体拿到一篇未发表论文的核心研究问题,配六天时间、3000 美元 API 额度与 GPU,独立完成研究并撰写论文,再由为同一问题投入数月的原作者评审。结论是——当前前沿模型能胜任研究工程(research engineering),却在真正决定研究成败的环节上失败,且常因规划不当做出「规模过小」的实验。

作者认为,此前关于自主 AI 研究的证据大多缺失:现有评测要么只测窄而可验证的任务,要么把 AI 生成的论文丢进同行评审——而后者被他们批为「负荷过重、随机性强、评审质量差」。该结论与 Anthropic 6 月发布的《When AI Builds Itself》等厂商说法相左。这是单篇研究、方法特定,结论有其边界。

来源:The Decoder · Anthropic《When AI Builds Itself》

全球 AI 资讯

ChatGPT 桌面端藏了个「完成设置送额度」的引导实验

RuntimeWire 在 ChatGPT 桌面端里挖出一套实验性引导流程,用可远程配置的额度奖励,诱导用户完成把聊天机器人变成桌面智能体的授权步骤。

RuntimeWire 逆向 ChatGPT 桌面端 26.803.81509 版本,发现其中内置了一套完整、由实验开关控制的「对话式引导」系统:先问用户角色,再给出对应角色的上手任务,处理权限与应用连接,执行所选任务并记录结果。另有一份远程配置提供 credit_amount,当该值对已登录 ChatGPT 的账户大于零时,界面会承诺「完成设置即得 X 积分」,把奖励标注为「Onboarding bonus」并称将「计入你的余额」;若跳过,则提示该优惠将作废。

RuntimeWire 判断,OpenAI 意在用额度作为拉新激励,为「把 ChatGPT 从聊天机器人变成桌面智能体」这一权限繁重的步骤付费。需要说明的是,这是逆向发现的实验性、开关门控功能,credit_amount 由远程下发(可能为零),并非已正式宣布的产品。

来源:RuntimeWire · OpenAI 发布说明

Cloudflare 给智能体加链路追踪

Cloudflare 在 Workers 追踪里新增智能体维度的 span,可逐轮回放会话,但默认有截断与负载上限。

Cloudflare 上线智能体链路追踪(agent tracing),在既有的 Workers traces 之上,为智能体调用、模型调用、工具运行与审批等环节各加一段 span,会话可按对话逐轮回放,便于排查多步智能体的执行过程。

据 InfoQ 报道,官方文档同时提醒:这些追踪有截断上限,且不同环节的载荷(payload)默认记录并不一致,追踪未必完整。该消息目前为单一媒体报道。

来源:InfoQ

区域与早期信号

索塔无界称 4D 物理世界模型落地欧洲商超(中文来源)

成立四个月的索塔无界宣布与欧洲最大商超集团合作,计划三年内在真实货架间部署超千台具身机器人。

据雷锋网报道,具身智能公司索塔无界宣布与欧洲最大商超集团达成战略合作,规划未来三年在真实商超场景部署超过 1000 台具身智能机器人。公司称自己不造硬件,而是为机器人打造「原生物理大脑」——一套统一 4D 空间表征、物理约束、时空推理与动作输出的世界-动作(World-Action)模型,主张让原生物理基模先在一类高复杂度场景(商超货架)跑通垂类泛化,再反哺全场景。首席科学家刘哲的模型团队来自港大、清华、港科大等。

以上为厂商与单一中文媒体披露,尚无第三方验证的部署规模、成功率或量化性能数据,「全球首家」等表述亦为公司自述,宜按厂商主张看待。

来源:雷锋网

鹿明发布 MOS2 轮臂机器人,双臂负载 50kg(中文来源)

鹿明机器人 8 月 14 日推出重载轮臂式机器人 Lumos MOS2,主打工业现场的重载与移动作业。

据雷锋网报道,鹿明机器人 8 月 14 日发布轮臂式具身机器人 Lumos MOS2,定位面向工业场景的「重载 AI Worker」:双臂负载 50kg,整机高约 1.65 米、占地约 0.5 平方米、理论通道宽度需求约 0.8 米,具备 22 个自由度(新增双自由度头部与全向底盘);感知上标配底盘双多线激光雷达、腕部双相机、双六维力传感器与头部双目相机。官方称其面向产线换型频繁、需灵活移动与复杂装配的柔性任务。

以上为厂商发布信息与单一中文媒体报道,负载、自由度等参数均出自官方,尚无第三方实测或真实产线上的量化作业数据。

来源:雷锋网