全新上线GPT-IMAGE-2 现已加入 Jiufeng Hub 画廊!立即体验
本文目录
AI 热点资讯

4B 开源模型检索追平 GPT-5.6 Sol,成本约为百分之一

核心速览
  • 本期以模型与智能体落地为主:Neon/Castform 案例称 4B 开源模型检索追平 GPT-5.6 Sol、成本约百分之一
  • Claude Code 之父主张每半年清空 CLAUDE.md
  • Amp 上线 Portals
  • AWS 晒 Bedrock AgentCore 生产案例
  • 另有千问办公上鸿蒙等区域信号。
jiufeng
2026年8月6日
14 分钟阅读
4B 开源模型检索追平 GPT-5.6 Sol,成本约为百分之一

概览

本期共 8 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · 4B 开源模型检索追平 GPT-5.6 Sol,成本约为百分之一
  2. 重点 · Claude Code 之父:每半年清空一次 CLAUDE.md,Opus 5 可连跑数周

全球 AI 资讯 3. 重点 · Amp 上线 Portals:给云端「orb」里的服务开一条 HTTPS 直通 4. Mobileye 用 Bedrock AgentCore 把内部工单响应时间砍 90% 5. Prime Intellect 开源 Prime Agent:子智能体即持久 IPython 内核里的函数调用

区域与早期信号 6. 「千问办公」上架鸿蒙,打通 Windows/macOS/HarmonyOS 三端 7. 觅光联创郦轲另起炉灶,组前千问训练团队做「AI+女性健康」硬件 8. AI for Science 热潮之下,实验室基建成为关键变量

2026-08-06 AI 热点信号地图
2026-08-06 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

4B 开源模型检索追平 GPT-5.6 Sol,成本约为百分之一

Neon 与 Castform 案例称,一个 40 亿参数开源模型经定向后训练,在检索准确率上追平 GPT-5.6 Sol,单次推理成本约为其百分之一。

事实:据 2026 年 8 月 5 日 Neon 发布、Castform 联合创始人 Ying Hang Seah 与 Databricks 产品高管 Pranav Aurora、Angel Pan 合著的案例研究,一个 40 亿参数(4B)开源权重模型经 Castform 的定向后训练后,在检索搜索结果的准确率上与 OpenAI 的 GPT-5.6 Sol 持平,而单次推理工作负载的成本约为后者的百分之一。Castform 的主张是:团队可把自有数据库、文档与生产日志转成专用小模型,无需自建机器学习平台;训练与线上推理共用同一套检索接口,以缩小训练环境与部署系统的差距(GitHub 上附有检索训练示例)。

局限:该基准是「厂商自撰、面向特定任务」的评测,方法学披露有限,「100 倍成本差」建立在这套自评之上,并非独立复现的通用结论。RuntimeWire 明确将其定性为「窄任务上的胜出加上有用的经济性」,不等于通用能力对标。

benchmax/examples/neon_rag at main · castform-ai/benchmax
benchmax/examples/neon_rag at main · castform-ai/benchmax

图片来源:GitHub;已转存至九凤 R2。

来源:RuntimeWire · GPT-5.6 Sol 文档 · GitHub 示例

Claude Code 之父:每半年清空一次 CLAUDE.md,Opus 5 可连跑数周

Boris Cherny 称每代新模型都应删掉 CLAUDE.md、Skills 与 Hooks 重来;Opus 5 配合 Auto Mode 可不停连跑数天到数月。

事实:InfoQ 刊出的一期播客访谈中,Claude Code 创始人 Boris Cherny 提出把模型当成「一种活着的生物」,每一代性格不同,因此每隔约六个月就应删掉自己的 CLAUDE.md、Skills 和 Hooks,重新评估最新模型还需要多少指令。他说 Opus 5 发布后团队一次删掉了超过 80% 的系统提示词,每代新模型上线都先清空、再逐行加回,用消融实验判断哪些还有价值。谈到能力,他称 Opus 5 在 ARC-AGI-3 上做到 30%(此前最好成绩仅个位数到十几个百分点),并称配合 Auto Mode 可连续运行数天、数周乃至数月而不停下,无需额外脚手架或 goal 命令。

局限:这是一期访谈中的经验之谈,多为团队自述、非第三方复测,且为中文媒体单一来源。他举例的一项实验——让 Claude 把基于 Electron 的桌面应用重写成 Swift、用 Mac 虚拟机截图逐像素校验——已连续跑两个多星期、可能调用了数千到数万个智能体,至今仍未结束。

来源:InfoQ

全球 AI 资讯

Amp 上线 Portals:给云端「orb」里的服务开一条 HTTPS 直通

Amp 推出 portals,让开发者一句「show me in a portal」就能访问 orb 中任意监听端口、讲 HTTP 的服务,带实时刷新与多人协作。

事实:Amp(ampcode.com)宣布上线 portals:只要远程开发环境 orb 里有服务监听端口并使用 HTTP,说一句「show me in a portal」即可通过 HTTPS 访问,用于直接试用智能体做出的改动、在页面上批注评论,或让智能体临时搭个 web 应用来调试。实现上,智能体会创建或查找 .amp/services.yaml 并运行 amp orb services ensure|start 起服务并对外暴露;应用需遵循注入的 PORT 与 PUBLIC_URL 环境变量。portals 对有该线程访问权的人开放,随 orb 休眠/唤醒;把线程设为多人协作后,团队成员也能实时看到改动。

局限:portals 仅适用于「监听端口且讲 HTTP」的服务,应用必须正确读取 PORT 与 PUBLIC_URL;这是 Amp 的官方发布说明,未含第三方评测。

来源:Amp Chronicle

Mobileye 用 Bedrock AgentCore 把内部工单响应时间砍 90%

Mobileye 在 Amazon Bedrock AgentCore 上部署 AI 支持智能体,官方称把内部工单响应时间缩短 90%、准确率超过 95% 目标,且「零基础设施运维」。

事实:据 AWS 机器学习博客,Mobileye 在 Amazon Bedrock AgentCore 上部署了一套 AI 支持智能体方案——从最初的支持瓶颈,到验证可行性的概念验证(POC),再到投入生产。官方称该方案把内部工单的响应时间缩短 90%、准确率超过 95% 目标,并实现「零基础设施运维」。背景数据方面,Mobileye 全球有超过 2.3 亿颗 EyeQ 芯片、覆盖约 1200 款车型,每天需处理数千条行车记录会话;上线后,团队进一步把 AgentCore 变成了面向各内部团队的自助平台。

局限:上述数据均出自 AWS 官方博客与 Mobileye 自述,非独立评测;方案绑定单一云厂商(Amazon Bedrock),迁移成本与横向对比未披露。

来源:AWS ML Blog · Mobileye

Prime Intellect 开源 Prime Agent:子智能体即持久 IPython 内核里的函数调用

Prime Intellect 开源 MIT 许可的编码与研究框架 Prime Agent,用「递归语言模型」把子智能体调用变成持久 IPython 内核内的函数;配合 Opus 5 在 ARC-AGI-3 报告 95.5%。

事实:Prime Intellect 开源了 Prime Agent —— 一个编码与研究用的智能体 harness,采用 MIT 许可。据 MarkTechPost,它建立在两个抽象之上,核心是「递归语言模型(Recursive Language Model, RLM)」:把子智能体调用变成一个持久 IPython 内核内部的函数调用,从而在同一运行时里递归展开研究与编码任务。成绩方面,报道称搭配 Opus 5 时,Prime Agent 在 ARC-AGI-3 上报告 95.5%,高于所报告的人类专家基线 95.4%,并称 token 用量更低。

局限:上述许可证与成绩均出自 Prime Intellect 一方口径、由 MarkTechPost 单一来源转述,暂无第三方独立复测;「token 用量更低」未给出对照基准与具体数值,运行开销等细节需回项目仓库核对后再深挖。

来源:MarkTechPost

区域与早期信号

「千问办公」上架鸿蒙,打通 Windows/macOS/HarmonyOS 三端

阿里企业级 Agent 产品「千问办公」8 月 6 日推出鸿蒙电脑版,至此覆盖三大主流桌面操作系统。

事实:据雷峰网,8 月 6 日阿里巴巴旗下企业级 Agent 产品「千问办公」推出鸿蒙电脑版,用户可在华为应用市场下载;至此「千问办公」已支持 Windows、macOS 和 HarmonyOS 三大主流操作系统。文中还提到,「千问办公」通过了中国信通院办公智能体能力评估。

局限:这是一次平台可用性更新,本条未涉及模型能力或参数变化;来源为中文单一媒体报道,信通院评估的具体项目与分数未在文中给出。

来源:雷峰网

觅光联创郦轲另起炉灶,组前千问训练团队做「AI+女性健康」硬件

雷峰网独家:AMIRO 觅光联创郦轲成立丛容地健康科技,切入 AI 女性健康硬件,AI 负责人来自阿里千问模型训练团队。

事实:据雷峰网·鲸犀独家,头部美护品牌 AMIRO 觅光联合创始人、CMO 兼首席创新官郦轲已低调成立深圳市丛容地健康科技有限公司,切入「AI+女性健康」赛道;知情人士称首款产品可能为女性 AI 健康项链,后续计划围绕饮食、情绪、生理周期等场景推出智能硬件系列。报道称其核心班底已组建:AI 负责人来自阿里千问模型训练团队,设计团队来自法国 Lucas-Bernard(LB)珠宝团队。郦轲 1989 年生,曾任 MIT 媒体实验室研究科学家,2015 年与校友共同创立宗匠科技并推出 AMIRO 觅光。

局限:产品尚未发布(报道用词为「可能」),团队与方向均出自雷峰网独家与知情人士转述、无官方公告或融资披露,属早期信号;来源为中文单一媒体。

来源:雷峰网·鲸犀

AI for Science 热潮之下,实验室基建成为关键变量

Pandaily 分析:AI 生成假设的速度已超过 AI 验证实验的速度,MegaRobo 押注为机器而非人重建实验室工具。

事实:据 Pandaily,在 AI-for-Science 热潮中,「基础设施」正成为决定性变量:AI 生成的科学假设产出速度,已超过 AI 能验证实验的速度。报道称 MegaRobo 押下十年赌注——为机器而非人重建实验室工具,并把「感知—构想—执行(Perception–Conception–Execution)」的闭环系统交付进制药行业(pharma)。

局限:本条为 Pandaily 的行业分析报道,候选池未给出具体产线规模、通量或第三方验证数据;闭环系统的实际效果需以一手材料为准。

来源:Pandaily