概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · OpenAI 向监管者预览 Astra,押注长程智能体协调
- 重点 · Tracer 发布 Echo,称以三分之一成本逼近 Claude Fable
- 重点 · DeepSeek-V4 两则实测:论文的重试教训与 V4 Flash 编程成绩
全球 AI 资讯 4. 谷歌上线一天即撤下 Google Earth 的 AI 生成功能 5. 亚马逊完成对 OpenAI 的 500 亿美元投资 6. AWS 在 Amazon Quick 推出 Agentic Catalog 体验
区域与早期信号 7. InfoQ 用 LangChain4j 做"自构建智能体"实验 8. 丘脑智能完成数千万元种子轮,做多模态长记忆基座 9. Seedance 2.5 视频模型登陆创作工具"小云雀"

九凤根据本期已引用来源整理。
热门模型动态
OpenAI 向监管者预览 Astra,押注长程智能体协调
Altman 本周把未发布的 Astra 模型族演示给华盛顿的政策制定者,正值一项联邦审查逼近 8 月 1 日的期限。
据 RuntimeWire 援引 The Information 报道,OpenAI CEO Sam Altman 本周在华盛顿向政策制定者与监管者演示了一个名为 Astra 的未发布模型族,定位是让多个 AI 智能体在长时间跨度内保持协调。报道称,这会把 OpenAI 从"并行智能体功能"推向"围绕持续协调构建的模型",并把联邦审查直接纳入发布流程。
Astra 目前仍未发布,参数量、上下文长度与可用性均未公开,相关信息来自 The Information 的转述,OpenAI 尚无正式技术说明。把演示对象选在监管者而非开发者,本身也说明发布与合规审查已深度绑定。
来源:RuntimeWire · OpenAI
Tracer 发布 Echo,称以三分之一成本逼近 Claude Fable
单人创始团队用一个 OpenAI 兼容端点,把请求分配给多个开源权重模型,主打推理成本。
Tracer(旧金山 AI 实验室,创始人 Adam Rida,YC S26)于 7 月 31 日发布自适应推理系统 Echo:它协调多个开源权重模型,并通过一个 OpenAI 兼容 API 返回单一答案。Tracer 在 X 上的八条长推中称,Echo 在 MATH-500 上得分 98.6%,记录的推理成本为 4.58 美元,并对标 Anthropic 的 Claude Fable 5,宣称以约三分之一的成本达到接近的分数;可通过 OpenCode 及兼容的智能体框架调用。
上述分数与成本均为 Tracer 自行公布、来自创始人的 X 长推,尚无第三方复现;Echo 出自单人创始团队,其覆盖的模型与任务范围也未完整披露。
来源:RuntimeWire · Tracer(X) · Claude Fable
DeepSeek-V4 两则实测:论文的重试教训与 V4 Flash 编程成绩
一段 DeepSeek-V4 论文细节提醒"失败请求直接重试会引入长度偏差";另一份社区实测给 V4 Flash 的编程能力划了边界。
DeepSeek-V4 论文中的一段提醒引发关注:从头重新生成未完成的请求在数学上并不正确,因为较短的回答更容易在中断中"存活",重试会让模型更偏向产出更短的序列,即长度偏差(length bias)。有开发者据此做了实验,用约 10 万首 AI 生成的诗验证了这一效应。另一份社区实测把 DeepSeek V4 Flash 跑上 SlopCodeBench:严格口径下只解出 17 个检查点中的 3 个(17.6%)、3 道题目端到端全部未通过;放宽标准后 6 个检查点单独通过、11 个通过较弱的正确性判据,整轮花费 0.68 美元。
SlopCodeBench 这份实测样本很小(3 道题、总花费 0.68 美元),且由社区个人在 GitHub 上公布,非官方评测;论文那条"重试引入偏差"更偏向通用的评测方法学提醒,而非针对某一次跑分。
来源:Quesma 博客 · DeepSeek-V4 论文 · SlopCodeBench 实测
全球 AI 资讯
谷歌上线一天即撤下 Google Earth 的 AI 生成功能
该功能让用户用文字提示在真实卫星影像上叠加 Nano Banana 2 生成的图像,因可能传播虚假信息一天内被下线。
据 TechCrunch 报道,谷歌周四在卫星影像应用 Google Earth 中上线新功能,允许用户调用其 AI 图像生成模型 Nano Banana 2,在真实地图上生成并叠加虚构图像;谷歌称初衷是"发挥地理创意"。但批评者很快指出,该功能基于文字提示、几乎可把任意图像叠加到真实地图上,容易被用来制造和传播虚假信息。谷歌在上线约一天后关闭了该功能。
官方博客的功能介绍页仍可访问。这是产品因误用风险被快速回撤,而非模型本身出现技术故障。
来源:TechCrunch · Google 博客
亚马逊完成对 OpenAI 的 500 亿美元投资
这笔股权投资把 OpenAI 与 AWS 云及 Trainium 芯片绑得更紧,是 OpenAI 本轮创纪录融资中最大的一笔。
据 RuntimeWire 援引《金融时报》,亚马逊已完成对 OpenAI 的 500 亿美元投资,把此前的有条件承诺转为实缴,成为 OpenAI 创纪录融资中最大的一块。报道称,OpenAI 本轮新增投资总额达 1100 亿美元,资金主要来自三家为其训练和服务模型提供资本与基础设施的公司;亚马逊则以股权换取 OpenAI 成为 AWS 与自研 Trainium 芯片的重要客户。
这是一笔资本与基建深度捆绑的交易:亚马逊 500 亿美元的回报被直接系于对其 AI 基础设施的需求,而非独立的财务回报。具体股权比例、投资节奏与合约条款均未完整披露。
来源:RuntimeWire · OpenAI
AWS 在 Amazon Quick 推出 Agentic Catalog 体验
面向数据管理者的 AI 工作流:用自然语言检索上游目录资产,自动创建带继承语义的 Datasets 与 Topics。
AWS 宣布在 Amazon Quick 中推出 Agentic Catalog Experience。AWS 称,随着企业转向 AI 分析,自然语言(Text2SQL)答案的质量取决于背后的业务语境,因此表/列描述与关系等语义信息需要从上游数据目录与语义工具直接流入服务终端用户的 AI 产品。新体验让数据管理者用自然语言发现上游目录资产,并自动创建带继承语义的 Datasets 与 Topics。
这是一项企业级数据治理功能,面向数据管理者而非终端用户;官方公告未给出可用区域、定价与量化的效果指标。

九凤根据本期已引用来源整理。
区域与早期信号
InfoQ 用 LangChain4j 做"自构建智能体"实验
把 LangChain4j 的文档交给代码助手,让它参照框架自身设计出一个能写、测、调代码的多智能体系统。
InfoQ 的一篇实验文章记录了一个"元实验":把 LangChain4j 的文档交给代码助手,要求它参照框架自身构建一个智能体,设计出能像工程师那样编写、测试和调试代码的多智能体系统。作者称,LLM 仅凭文档就能"构建出自己",一方面说明其 API 足够清晰、模型可直接使用,另一方面说明框架提供了足够的协调能力,让生成的系统能在真实调试任务中端到端运行;该过程也顺带压测了 LangChain4j 新增的监控工具。最终项目已公开在 GitHub 代码库。
这是单篇工程实验记录(Chinese-language source),非通用基准,其结论依赖于所选提示词与框架版本,尚无第三方复现。
来源:InfoQ 中文 · GitHub 代码库
丘脑智能完成数千万元种子轮,做多模态长记忆基座
这家 2025 年 11 月成立的公司押注"主动智能",推出原生多模态记忆基座,本轮融资用于研发与团队扩张。
据 36 氪"涌现新项目"报道,丘脑智能近日完成数千万元种子轮融资,投资方包括深圳一线基金与产业资本,资金主要用于技术研发与人才补充。公司成立于 2025 年 11 月,创始人兼 CEO 张源为北大电子与经济双学科背景,团队平均年龄约 26 岁,核心成员来自阿里达摩院、腾讯、商汤及港中文、北大等机构。公司主打原生多模态记忆基座,押注 AI 从通用走向个性化、最终走向"主动智能"(在了解用户的基础上主动交互),并把 Memory 视为必须跨过的门槛。
报道称其为"国内唯一做多模态长记忆的公司",这是公司自述、非独立核验;具体融资金额、产品形态与落地进展均未量化披露(Chinese-language source)。
来源:36 氪
Seedance 2.5 视频模型登陆创作工具"小云雀"
首个官方版 Seedance 2.5 的创作工具,主打 30 秒原生直出、多模态参考与更可控的长镜头。
据爱范儿体验报道,Seedance 2.5 视频模型上线创作工具"小云雀",后者是首发官方版 Seedance 2.5 的 AI 创作工具。文章称,其升级点包括 30 秒原生直出、最多 50 个多模态参考素材、白模渲染、绿幕编辑、音频分离,以及角色素材包与角色库、3D 导演台、片段重拍和自带配音等功能,意在把 AI 视频从"生成短片段"推向更接近专业制作的可控流程。
以上功能为媒体体验与厂商公布,非独立评测;模型的参数、许可证、开放范围与客观基准成绩均未给出(Chinese-language source)。
来源:爱范儿
获取九凤最新的 AI 模型洞察与教程。
了解更多


