概览
本期共 10 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Cline 桌面版开测,可接手 Claude Code 与 Codex 的会话
- 重点 · 苹果重建版 Siri 跑在 Gemini 上,欧盟和中国暂不上线
- 重点 · SealGate 把 Grok 接到 Flipper Zero,用对话控制酒店电视
全球 AI 资讯
- OpenAI 收购 Glass Imaging,招进两名前苹果相机工程师
- Agent-net 开源 Webagent:填一份 JSON 就把网站变成智能体
- Ninth Wave 把开放金融接入搬上 Bedrock AgentCore
- Grab 用 LLM-Kit 统一 500 多个内部智能体服务
区域与早期信号
- 阶跃发布 StepAudio 3 系列,多项语音榜单称第一
- 无问芯穹联合清华、上交开源端侧具身推理引擎 APXInf
- 飞书与豆包工作推出「豆包工作伙伴」,智能体进群办公

九凤根据本期已引用来源整理。
热门模型动态
01/10
Cline 桌面版开测,可接手 Claude Code 与 Codex 的会话
Cline 把开源编码智能体从 IDE 插件做成独立桌面应用,支持导入其他智能体的历史任务并换模型继续。
Cline 创始人 Saoud Rizwan(@sdrzn)于 9 月 14 日发布 Cline Desktop,beta 版覆盖 macOS 与 Windows,可搭配 Cline 账号、外部 API 供应商或本地托管模型使用。发布说明写明可以把 Claude Code、OpenAI Codex 等编码智能体的任务导入进来,再换一个模型继续这些会话。
桌面版还能调度周期性作业,例如 PR 评审、安全扫描和文档更新;内置市场统一管理插件、Model Context Protocol 服务与可复用的智能体技能。脱离 VS Code 之后,用户可以直接把 Cline 指向一个工作区,让它读文件、改代码、执行命令并跟踪当前 Git 分支。
局限:目前只有 beta 一档。导入他方会话、定时作业与市场分发都是随桌面版首发的能力,来源没有给出正式版时间表,也没有说明 ClinePass 与自带模型两条路径在额度上的差别。

图片来源:GitHub;已转存至九凤 R2。
来源:RuntimeWire · Cline on X · GitHub
02/10
苹果重建版 Siri 跑在 Gemini 上,欧盟和中国暂不上线
延期多年的 Siri 以 beta 形式放出,底层换成 Google 的 Gemini 模型。
按苹果的说法,「Siri AI」已作为 beta 开放,目前仅支持英文。它运行在 Google 的 Gemini 模型上,一部分在设备端处理,一部分经 Private Cloud Compute 走云端。新助手能读取屏幕内容以及来自消息、照片的个人上下文,并跨不同 app 执行任务。TechCrunch 编辑 Ivan Mehta 从 iOS 27 beta 起就在测试,称新 Siri 是一次实打实的进步。
局限:欧盟和中国暂时不在上线范围内,语言上目前只有英文一种。早期测试在肯定实用性改善的同时,也指出这个助手仍会出现理解错误。
来源:The Decoder · TechCrunch
03/10
SealGate 把 Grok 接到 Flipper Zero,用对话控制酒店电视
9 月 14 日的一段演示里,手机上的 Grok 通过 MCP 操作了身边的硬件。
SealGate 创始人 Eito Miyamura(@Eito_Miyamura)发布视频,展示用 SealGate 让 Android 手机上的 Grok 操作一台 Flipper Zero,再通过红外控制酒店房间的电视。连接走 Model Context Protocol,SealGate 的 Android 客户端以开源形式放在 GitHub 上。Miyamura 此前在 Wayve 做自动驾驶基础设施,其创办的伦敦公司 SealGate(原名 EdisonWatch)卖的正是一层控制面,用于监控和限制 AI 智能体访问企业数据与外部工具。
局限:公开的只有这一段演示,覆盖的是红外控制电视这一个场景。按来源说明,走这条路需要 Grok 的自定义连接器付费档,Android 的运行时权限与设备端授权弹窗仍然生效;网关会监控工具调用、给出风险评分并执行确定性策略。报道同时指出,一旦云端智能体能操作身边的硬件,权限控制与可审计的工具调用就成了设备安全的一部分。
来源:RuntimeWire · Eito Miyamura on X · GitHub
全球 AI 资讯
04/10
OpenAI 收购 Glass Imaging,招进两名前苹果相机工程师
做过 iPhone 人像模式的团队并入 OpenAI 硬件部门,交易估值超过 3 亿美元。
《华尔街日报》9 月 14 日报道,OpenAI 在最近几个月收购了 Glass Imaging,交易对这家公司的估值超过 3 亿美元。Glass Imaging 由前苹果相机工程师 Ziv Attar 与 Tom Bishop 于 2019 年创立,产品是神经网络图像处理器,此前多年的工作是从手机受限的镜头与传感器里榨出更好的照片。Attar 还在 2011 年创办过 LinX Imaging 并做到 2015 年被苹果收购,LinX 的双摄系统用于景深效果与弱光图像融合。
局限:交易金额与时间均来自《华尔街日报》报道,OpenAI 没有公开说明这支团队具体接入哪条产品线;「相机将成为设备主要输入」是报道给出的判断,不是官方表述。
来源:RuntimeWire
05/10
Agent-net 开源 Webagent:填一份 JSON 就把网站变成智能体
Go 写的 harness,Apache-2.0,九个可插拔槽各选一个实现,跑 webagent serve 即起服务。
Agent-net 开源了 Webagent,定位是把面向公众的业务智能体立起来的 harness。它不要求写编排代码,而是让企业填一份声明式 JSON spec,再为每个槽位挑一个 provider:
- 语言与许可:Go 编写,Apache-2.0,仓库构建通过
- 结构:1 个 Brain(一个 LLM 加一段指令)加 9 个可插拔槽,每个槽是一个服务提供者接口,实现注册在 spi/ 下并指定默认值
- 已跑通的形态:Slack、WhatsApp 与 HTTP 智能体,后端接 MCP 工具
- 设计依据:DESIGN.md 把整个项目建立在「架构而非模型能力决定智能体成败」这一研究结论上,引用 arXiv 2511.19477
局限:版本仍标 v0。浏览器动作 provider、受 OAuth 门控的 MCP、OTel 导出,以及 AgentNet 的身份与计费层都列为尚未构建。
来源:MarkTechPost · arXiv 2511.19477
06/10
Ninth Wave 把开放金融接入搬上 Bedrock AgentCore
银行 API 对 FDX 标准的校验、字段映射与合规打分,交给一组托管的多智能体完成。
Ninth Wave 在 Amazon Bedrock AgentCore 上构建了 Compass,一个多智能体的接入助手,用来校验银行 API 是否符合 Financial Data Exchange(FDX)标准、做字段映射并给出就绪度评分。Ninth Wave 本身提供金融机构与第三方应用之间的数据连接,对接 Plaid、Finicity、MX 等聚合方以及 Intuit QuickBooks、Xero、Sage 等记账系统,把各家口径不一的银行 API 归一到 FDX,使银行只需接入一次就能触达整个开放金融网络。运行层面,AgentCore 提供托管的智能体运行时,编排逻辑交给 Strands Agents 框架。
局限:这是 AWS 官方博客的客户案例。按文中说法,同样的校验、映射与就绪度评分过去要靠专家在邮件和表格里做上数周,但文章没有给出 Compass 上线后的量化对比,也没有第三方验证。
来源:AWS Machine Learning Blog · Strands Agents
07/10
Grab 用 LLM-Kit 统一 500 多个内部智能体服务
一套内部框架收编分散的智能体服务,新智能体上生产从两周压到一小时。
InfoQ 报道,Grab 上线了 LLM-Kit 框架,对内部 500 多个智能体服务做了标准化。这套系统统一了服务接入、效果评估与密钥处理,把部署一个新智能体的时间从两周缩短到一小时。
局限:LLM-Kit 面向的是 Grab 内部的智能体服务,两周到一小时是 Grab 自己的口径;本条目前只有 InfoQ 一篇报道,没有第三方复现这组数字。
来源:InfoQ
区域与早期信号
08/10
阶跃发布 StepAudio 3 系列,多项语音榜单称第一
一次放出五款语音模型,实时交互与语音识别在 Artificial Analysis 榜上被列为全球第一。
9 月 15 日,阶跃发布 StepAudio 3 系列,一次推出 Realtime、ASR、TTS、Gen、Music 五款模型,覆盖实时语音交互、语音识别、真人级语音生成与音乐创作。按阶跃引用的第三方评测机构 Artificial Analysis 榜单:
| 模型 | 榜单 | 名次与分数 |
|---|---|---|
| StepAudio 3 Realtime | Conversational Dynamics | 全球第 1,综合得分 98.9% |
| StepAudio 3 Realtime | Speech Reasoning | 全球第 1 |
| StepAudio 3 ASR | 非流式语音识别准确性 | 并列第 1,词错误率 1.7% |
Realtime 支持原生全双工对话,能判断何时回应、何时等待并处理临时打断,推理与语音生成可以并行,Tool Call 和长任务异步执行、不打断当前对话。TTS 采用流式生成架构,生成与播放同时进行,还能产出笑声、迟疑、重复、改口这类副语言表现;Gen 则把人声、音效、环境声与背景音乐合进一次生成。
局限:榜单成绩是阶跃自述、由雷锋网单一中文来源转述,没有第三方复现。开源与否、许可证、定价和开放时间均未提及。
来源:雷锋网
09/10
无问芯穹联合清华、上交开源端侧具身推理引擎 APXInf
面向机器人本体的推理引擎开源,官方称 Thor 上 Pi 0.5 端到端时延降到 26 毫秒以内。
无问芯穹与清华大学、上海交通大学开源了具身智能端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin、Jetson Thor 等主流计算平台,覆盖从模型开发、效果验证到机器人本体部署的完整链路。团队给出的优化路径是在 Pipeline、Graph、Kernel 与量化等多层上压低端到端推理延迟,用 Agent4Kernel 技术生成融合算子,并为模型做定制化运行时以裁掉冗余。
按团队公布的数据,在 Jetson Thor 上跑 Pi 0.5 的 FP8 端到端推理延迟从 278 毫秒降到 26 毫秒以内,降幅 10.7 倍,频率可达 38.46 Hz。
局限:「Pi 0.5 性能 SOTA」与上述时延数字都是发布方口径,量子位这篇是目前唯一来源,没有第三方复现;开源许可证也未写明。
来源:量子位
10/10
飞书与豆包工作推出「豆包工作伙伴」,智能体进群办公
一个有独立组织身份的智能体被拉进群聊,按群和资源的授权范围干活。
飞书与豆包工作发布了「豆包工作伙伴」。它拥有独立的组织身份,可以被加入群聊、接收不同成员的任务,并在授权范围内使用文档、会议和工具。实测中它能跟踪任务、处理飞书文档、做数据分析、定时监控提醒并追踪负责人;权限按群聊、资源和应用授权生效,飞书原有的权限规则继续有效。它还能被指定去查另一个群此前的讨论并把结论带回主群,在被告知协作偏好后把这条写进记忆。报道把它对标 Slack 里的共享智能体 Claude Tag。
局限:目前仍处于早期企业共创阶段,没有向所有用户开放。爱范儿这篇是拿到体验资格后的实测稿,属单一中文来源,未公布参与企业数量、开放时间与定价。
来源:爱范儿
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

