概览
本期共 9 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · OpenAI 公测 Agents API,托管 Codex 执行框架
- 重点 · Claude 社区办 Fable 5.1 Build Days,9 月 11 日至 25 日多城开场
全球 AI 资讯
- 重点 · Google 把 Dreambeans 开放给全美 18 岁以上用户
- 环球音乐联手 ElevenLabs 做 AI 音乐平台,可基于授权曲库二创
- SageMaker 推理上线前缀感知路由,P50 首 token 延迟最多降 77%
- Bedrock 知识库接入 Marengo Embed 3.0,可用自然语言搜视频片段
- Redis LangCache 语义缓存,称最多省 90% 的 API 成本
- NVIDIA BioIR 把 Boltz-2 折叠吞吐提到 2.90 倍
区域与早期信号
- 蚂蚁数科推出 Agentar 金融版,首批预置十大金融智能体专家团

九凤根据本期已引用来源整理。
热门模型动态
01/09
OpenAI 公测 Agents API,托管 Codex 执行框架
OpenAI 把 Codex 背后的执行框架和云端基础设施做成托管服务:开发者指定任务、模型、工具和运行环境,智能体循环由 OpenAI 在自家基础设施上运行。
OpenAI 9 月 10 日推出 Agents API,面向构建长时运行智能体的开发者,以公测形式向所有开发者开放。它在智能体工作期间协调模型调用、工具使用和上下文。OpenAI Developers 账号的说法是,编排、长时会话与上下文管理都交给 OpenAI。OpenAI 称,扩展 Codex 和 ChatGPT for Work 的经验说明,长时运行的智能体既需要能管理上下文、高效使用工具、协调子智能体的框架,也需要能连续稳定运行数天的基础设施。
- 核心概念:官方文档把 API 组织成 4 个概念,包括 Agent(模型、指令、工具和可用的 MCP 服务器)、Environment(可选沙箱,智能体在其中访问文件、加载技能、执行命令)和 Session(持久的智能体实例)
- 运行位置:智能体代码可以跑在 OpenAI 托管沙箱、开发者自己的基础设施或合作方沙箱上
- 计费:官方文档写明,模型按所选模型的 API 费率计费,OpenAI 工具按标准费率计费,托管沙箱按标准容器费率计费
- 开源部分:核心 Codex harness 仍在 GitHub 开源,开发者可以查看协调模型、工具与上下文的逻辑
局限:目前仍是公测版。据 MarkTechPost,数据只留在美国境内,且不支持零数据保留(Zero Data Retention)。
来源:OpenAI · Agents API 文档 · OpenAI 托管沙箱文档 · Codex(GitHub) · RuntimeWire · MarkTechPost
02/09
Claude 社区办 Fable 5.1 Build Days,9 月 11 日至 25 日多城开场
Anthropic 在 9 月 11 日至 25 日推广由各地社区组织的 Fable 5.1 Build Days,参与者可以带着问题、想法或未完成的项目来。
据 RuntimeWire,这批 buildathon 由 Claude Community 的各地组织者举办,范围从奥斯汀到墨尔本。官方公告配图列出了内罗毕、斯德哥尔摩、开普敦、奥斯陆和墨西哥城,Claude Community 日历上的活动均由当地社区成员在全球各地主办。邀请写得很宽松:可以带一个问题或想法来,也可以只来看别人做了什么。RuntimeWire 认为,这降低了一个被 Anthropic 定位在高难度编码、科研和企业工作的模型的上手门槛。
局限:这是一组由各地社区主办的活动,不涉及 Fable 5.1 本身的能力、价格或可用性变化。RuntimeWire 指出,成效取决于这些短期实验能否转化为持续的 API 调用、产品和职场采用。
来源:RuntimeWire · Claude on X
全球 AI 资讯
03/09
Google 把 Dreambeans 开放给全美 18 岁以上用户
Google Labs 的 AI 故事流应用取消了 6 月首发时的订阅门槛,按用户授权连接的 Google 服务数据,每天生成一组插画故事。
Google 于 9 月 10 日(周四)把 Dreambeans 扩大开放给美国所有 18 岁及以上用户,The Verge 当天报道了这次推送。它由 Google Labs 产品经理 Gozde Oznur 在 6 月 3 日发布,当时只面向美国符合条件的 Google AI Ultra 订阅者。应用每天生成数量有限的一组插画故事,数据来自用户自选连接的 Google 服务,可包括 Gemini、Gmail、日历、Google 相册、YouTube 和搜索记录;内容从购物、旅行推荐,到活动提醒和与爱好相关的建议。
应用可在 Google Play 和苹果 App Store 下载,需要个人 Google 账号,并至少连接一项受支持的服务才能使用。
局限:目前只面向美国 18 岁以上、使用个人账号的用户。RuntimeWire 指出,Dreambeans 不等提示词就会跨服务组合个人数据来行动,扩大开放将检验这种便利能否抵过它所要求的权限。
来源:The Verge · RuntimeWire · Google 6 月发布稿
04/09
环球音乐联手 ElevenLabs 做 AI 音乐平台,可基于授权曲库二创
环球音乐集团通过与 ElevenLabs 的多年授权协议,开发一个让用户基于授权曲库做混音、混搭和新演绎的 AI 平台。
据 The Verge,环球音乐集团(UMG)周四宣布这一 AI 平台:用户可以从其授权曲库中取材,生成歌曲的混音、混搭和新版本。平台通过与 ElevenLabs 的多年授权协议开发,ElevenLabs 专做 AI 语音与音乐生成。艺人可以自行选择是否参与。这是 UMG 的又一笔 AI 合作:它正与 Udio 开发另一个 AI 音乐平台,并已与 Spotify、Nvidia 和 Klay 签有 AI 授权协议。
局限:报道把它称为即将推出(upcoming)的平台,目前还不能使用;艺人是否加入由其自行决定。本条只有 The Verge 单一来源。
来源:The Verge
05/09
SageMaker 推理上线前缀感知路由,P50 首 token 延迟最多降 77%
共享同一段提示前缀的请求被送到同一个实例,让该实例上的 KV 缓存保持热状态。
AWS 宣布 Amazon SageMaker Inference 新增前缀感知路由(prefix-aware routing),把共享相同提示前缀的请求路由到同一实例。出发点是应用提示通常由固定部分(指令、参考文档、对话历史)加可变的用户输入构成:以客服机器人为例,开头的指令可能有 3000 个 token,用户问题只有 50 个 token。vLLM、TensorRT-LLM 等推理框架会缓存已见过前缀的 KV 对,新请求只需处理末尾的新 token,这就是前缀缓存。AWS 在 Llama 3.1 70B 上的基准显示,前缀感知路由把 P50 首 token 时间(TTFT)最多降低 77%,并提高了 KV 缓存命中率。
局限:这项路由只对共享相同提示前缀的请求起作用;77% 是 AWS 自测的「最多」降幅,暂未见第三方复现。
06/09
Bedrock 知识库接入 Marengo Embed 3.0,可用自然语言搜视频片段
TwelveLabs 的多模态嵌入模型在 Amazon Bedrock Knowledge Bases 中正式可用,视频、图片和音频可以按语义检索。
AWS 宣布,TwelveLabs Marengo Embed 3.0 作为嵌入模型在 Amazon Bedrock Knowledge Bases 中正式可用(GA)。AWS 给出的场景是媒体、体育分析、教育、安防和零售团队要在数小时素材里用自然语言找到特定片段,示例查询是「给我看下半场的点球」。AWS 称,自建视频语义搜索通常要拼接转写服务、抽帧流水线、嵌入模型、向量数据库和同步逻辑。
- 模型:Marengo Embed 3.0 把视频、音频、图片和文本联合编码成紧凑的 512 维向量
- 格式:视频支持 MP4、MOV,图片支持 JPEG、PNG,另支持音轨
- 托管范围:Bedrock Knowledge Bases 负责存储、摄取、嵌入、重排序和检索,原生连接 Amazon S3、SharePoint、Confluence 等数据源
局限:信息来自 AWS 官方博客,属厂商自述,暂未见独立评测。
07/09
Redis LangCache 语义缓存,称最多省 90% 的 API 成本
托管在应用和模型之间的语义缓存:换了说法的同一个问题直接返回已存的答案,不再重新全额调用模型。
据 MarkTechPost,Redis LangCache 是全托管的语义缓存服务,按含义而非精确文本,把新提示与已回答过的提示做匹配,找到足够接近的就返回已存储的响应。报道的出发点是:客服助手和 RAG 流水线每天要以不同措辞处理数千次相同意图,而多数技术栈把每种措辞都当成一次全额计费的新请求。Redis 称它最多可节省 90% 的 API 成本,缓存命中时的响应最多比重新调用模型快 15 倍。
- 可用性:目前在 Redis Cloud 上以公开预览形式提供
- 接入方式:REST API,配 Python 与 JavaScript SDK
局限:这些都是 Redis 给出的「最多」数值,出处也不一致:据 MarkTechPost,Redis 此前的公开预览公告给出的是 15 倍和 70%,当前产品页写的是 90%。速度优势只针对命中缓存的请求;产品仍在公开预览,Redis 提示功能和行为可能变化。本条只有 MarkTechPost 单一来源。
来源:MarkTechPost
08/09
NVIDIA BioIR 把 Boltz-2 折叠吞吐提到 2.90 倍
NVIDIA 公布 BioNeMo Inference Runtime(BioIR):一个不脱离原生 PyTorch 的 Python 库,专门加速 NVIDIA GPU 上的生物分子结构预测模型。
据 MarkTechPost,BioIR 在 NVIDIA GPU 上加速生物分子结构预测模型,同时保持在原生 PyTorch 之内。在 8 张 H100 上针对 1000 个人类二聚体目标做的匹配基准中,经 BioIR 加速的 Boltz-2 折叠吞吐提高到 2.90 倍,每 GPU 小时可处理 5.85 万个残基。
局限:两个数字都来自 8×H100 上的 Boltz-2 这一组基准,由 NVIDIA 给出、经 MarkTechPost 转述,暂未见第三方复现。本条只有单一来源。
来源:MarkTechPost

九凤根据本期已引用来源整理。
区域与早期信号
09/09
蚂蚁数科推出 Agentar 金融版,首批预置十大金融智能体专家团
在外滩大会上发布的金融智能体平台,把智能体专家团、Skill、MCP、评测与治理能力打包给金融机构。
9 月 10 日,蚂蚁数科 AI 业务总裁余滨在 2026 Inclusion·外滩大会见解论坛上发布 Agentar 金融版,提供开箱即用的金融智能体专家团、行业 Skill、MCP、智能体评测工具和治理能力,覆盖智能体开发、部署、协作、评测与管理。首批预置十大金融智能体专家团,覆盖智能投顾、财富管理、客户经营等场景;每个数字专家对应一个完整岗位角色,能拆解任务并调度多个专业智能体协同执行。
- 评测:超过 2000 项金融专属评测工具,覆盖专业性、合规性、准确性和执行质量
- 规模:蚂蚁数科称已联合合作伙伴在金融场景打造 300 多个专业智能体,服务全部国有银行和股份制银行、超过 60% 的地方商业银行
- 试点:「数字客户经理」方案让试点客群客户总资产规模提升 10%、客户活跃度提升 15%,服务客户数量提升 5 倍以上
局限:试点效果与客户覆盖都是蚂蚁数科自己给出的数字,暂无独立核验;本条目前只有雷锋网单一中文来源。
来源:雷锋网
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

