概览
本期共 10 条,前 3 条为今日重点;正文按板块展开。
热门模型动态
- 重点 · Claude Sonnet 5.5 发布,每任务成本最多低三成
- 重点 · WSJ 称 OpenAI 搁置 GPT-6.1 Astra,原定 10 月上 ChatGPT 与 Codex
- 重点 · Grok 4.7 上架 Amazon Bedrock,50 万上下文四档推理
- Qwen3-TTS 上 SageMaker,边生成边播的流式语音
- 950 个智能体跑 21 小时,生物学家不认这算「发现」
全球 AI 资讯
- Shopify 把结账开放给浏览器里的 AI 智能体
- Gemini 的 Gems 将下线,11 月 17 日起转成 skills
- 20 多位研究者警告:AI 研发自动化风险极高
区域与早期信号
- Cloudflare 提出智能体开发生命周期,要替掉传统 SDLC
- 蚂蚁灵波与阿拉伯数字经济联盟签框架备忘录

九凤根据本期已引用来源整理。
热门模型动态
01/10
Claude Sonnet 5.5 发布,每任务成本最多低三成
Anthropic 把 Claude 5.5 家族的第二款模型对准「界定清楚的日常活」,用更省的 token 换速度和单价。
Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型。官方给出的口径:
- 成本:靠更高效的 token 用量,每个任务的成本比上一代 Sonnet 5 最多低 30%
- 速度:输出生成比 Sonnet 5 快 30% 以上
- 分工:Opus 5.5 面向需要仔细判断的复杂任务,Sonnet 5.5 面向修 bug、写文档、做演示文稿和表格这类界定清楚的工作
- 可用性:AWS、Google Cloud 与 Azure 三家云均已可用
官方与 The Decoder 列出的同口径榜单成绩:
| 基准 | Sonnet 5.5 | 对照 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | Sonnet 5:10.3% |
| CursorBench 4.0 | 55.5% | Opus 5.5:57.8% |
| GDPval-AA(分数) | 1844 | Opus 5.5:1846 |
另外在 Chartography 上拿到 61.6%。
局限:Sonnet 5.5 并没有全面追平 Opus 5.5——CursorBench 4.0 与 GDPval-AA 两项仍低于后者;每任务成本「最多低 30%」与输出「快 30% 以上」这两个数,都是对比自家上一代 Sonnet 5,不是跨厂商比较。Anthropic 同时说明为这一代新增了针对网络安全滥用与蒸馏攻击的防护。
来源:The Decoder · Anthropic
02/10
WSJ 称 OpenAI 搁置 GPT-6.1 Astra,原定 10 月上 ChatGPT 与 Codex
研究人员在内部测试中提出安全顾虑,这一版没等到发布。
《华尔街日报》记者 Maxwell Zeff 报道,OpenAI 因研究人员在内部测试中提出的安全顾虑,取消了 GPT-6.1 Astra 的发布,该模型原定 10 月在 ChatGPT 和 Codex 上首发。RuntimeWire 说这条报道对应一条 2026 年 9 月 28 日发布的 X 帖(作者 Leo,@synthwavedd),帖子贴的是《华尔街日报》的标题截图。
OpenAI 公开材料里能查到的是 9 月 3 日推出的 GPT-6 Astra,其 API 目录列出:
- 上下文:105 万 token
- 最大输出:12.8 万 token
- 价格:输入每百万 token 10 美元,输出每百万 token 50 美元
- 渠道:ChatGPT 套餐、API、Microsoft Azure、Amazon Bedrock
局限:OpenAI 的产品与 API 材料里没有 GPT-6.1 这个版本,公开记录只能证实 GPT-6 Astra,既无法证实 10 月的 6.1 发布计划,也无法证实它被取消。OpenAI 此前已在 9 月的安全更新里披露过围绕 Astra 的安全顾虑,并推迟过 Astra 的部分开发。
来源:RuntimeWire · OpenAI API 目录 · OpenAI 安全更新
03/10
Grok 4.7 上架 Amazon Bedrock,50 万上下文四档推理
xAI 的新旗舰进了 Bedrock 模型目录,主打长时间跑的编码与智能体任务。
AWS 宣布 Grok 4.7 在 Amazon Bedrock 可用。规格与接入方式:
- 上下文:50 万 token
- 推理档位:low / medium / high / xhigh 四档可配
- 接入:通过跨区域推理配置在 bedrock-runtime 端点提供
- 接口:支持 Responses、Chat Completions 与 Converse 三套 API
AWS 这篇另设「Independent evaluation」一节,引 Artificial Analysis 的第三方测评数据:
- Intelligence Index:46
- Coding Agent Index:56
- AA-Briefcase:1657
- 幻觉率:29%
xAI 在 9 月 21 日的发布公告里把 Grok 4.7 定位为自家编码与知识工作最强的模型,强调的是「耐力」而不是速度:在难任务上工作更久,并在继续下一步之前更仔细地自查输出。
局限:能力表述来自 xAI 自己的发布公告与模型文档;AWS 这篇没有列 Bedrock 上的价格。
来源:AWS · xAI 公告 · Grok 4.7 文档
04/10
Qwen3-TTS 上 SageMaker,边生成边播的流式语音
AWS 用专门的 vLLM-Omni 容器,把千问的语音合成模型做成一条持久双向连接。
AWS 发布教程,用 vLLM-Omni 深度学习容器在 Amazon SageMaker AI 上部署 Qwen3-TTS。文本进、音频出走同一条持久的双向连接,语音可以在整段响应生成完之前就开始播放,另配一个 Gradio 应用试跑。
这是专用容器系列的第一篇,同系列还包括 WhisperX 与 llama.cpp 容器,第二篇讲图像与视频生成。
局限:这是部署指南而不是模型更新,vLLM-Omni 容器的能力描述来自 AWS 自己;图像与视频那部分要等系列第二篇。
来源:AWS · AWS Deep Learning Containers
05/10
950 个智能体跑 21 小时,生物学家不认这算「发现」
Anthropic 说 Claude 智能体做出了实验室的第一个发现,MIT Technology Review 把判据摊开来问。
Anthropic 上周公布,它在今年早些时候建了一个分子生物学实验室:Claude 智能体阅读文献、对困难的生物学问题提出猜想,人类科学家再去做实验验证,公司称这套系统已经做出第一个发现。按 MIT Technology Review 的复盘,950 个智能体跑了 21 小时后找到的不是一条全新的 DNA 序列,而是一个已知酶周边的重复模式,Anthropic 称这个模式此前没有被编目过。
局限:Anthropic 的公告把这个模式形容为「让人想起」某个曾经导向突破的线索,这类措辞让一部分生物学家不满;其中一位生物学家的帖子被一家制药公司的董事长兼 CEO 转发后广泛传播。报道的落点是「AI 什么时候才算做出了科学发现」这个判据本身仍无共识。
来源:MIT Technology Review · 生物学家的帖子
全球 AI 资讯
06/10
Shopify 把结账开放给浏览器里的 AI 智能体
拿到买家授权的智能体,现在可以在 Shopify 商家站点上改订单信息并付款。
Shopify 周一宣布把 WebMCP 支持扩展到结账环节:跑在浏览器里的 AI 智能体在获得买家授权后可以更新订单信息并完成购买,能力从原来的搜商品、加购物车延伸到下单。TechCrunch 同时指出方向相反的一边——Amazon 在封堵代客下单的智能体,一条 X 帖显示 Adidas 似乎也在拦。
局限:报道没有说明这项能力覆盖哪些商家、何时全量,也没有写买家授权具体怎么走;Adidas 拦截的依据只是一条社交媒体帖子。
来源:TechCrunch · X 帖
07/10
Gemini 的 Gems 将下线,11 月 17 日起转成 skills
Google 停掉按任务定制助手的功能,把它并进可以跨任务复用的 skills。
Google 宣布关停 Gemini 的 Gems——这项功能此前允许用户为特定任务搭建自定义助手。Gemini App 内的提示写明:从 2026 年 11 月 17 日起 Gems 变成 skills,用户已有的 Gems 会自动迁移,不需要做任何操作;在那之前 Gems 仍可继续使用。TechCrunch 把这次调整放在一体化智能体走热的背景下,提到了 Meta 的 Muse 和 Instinct。
局限:报道没有说 skills 与 Gems 在能力、上下文或自定义指令上有什么差别,也没有说迁移后原有配置会保留到什么程度。
来源:TechCrunch · Gems 官方介绍
08/10
20 多位研究者警告:AI 研发自动化风险极高
Hinton、Bengio 与 OpenAI 研究负责人同署一篇论文,担心自我改进的 AI 触发「智能爆炸」。
20 多位 AI 研究者在一篇新论文里警告,自我改进的 AI 可能带来一场「智能爆炸」,署名者包括 Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki。论文称在造这些系统的公司内部,AI 已经写下大部分代码,整条 AI 研发流水线有可能在几年内被自动化,原本需要数年的进展会压缩到几个月。作者担心社会跟不上、对超人类 AI 的控制可能失手、国家与公司之间的力量平衡被侵蚀,并要求政策制定者大幅提高对「AI 研究正在怎样被自动化」的可见度。
局限:论文自己写明「仍有大量不确定性」,只说自动化「可能很快」触发,没有给时间表或可验证指标。The Decoder 把它列进近期一串同类警告,此前 42 位数学家也呼吁关注生存风险。
来源:The Decoder

九凤根据本期已引用来源整理。
区域与早期信号
09/10
Cloudflare 提出智能体开发生命周期,要替掉传统 SDLC
把 Workflows 当编排层,@cloudflare/ci 让智能体自己跑 CI/CD。
Cloudflare 提出「智能体开发生命周期」,主张由智能体自主管理整个生命周期,取代人工节奏的评审与线性流水线。落地方式是把 Workflows 定为核心编排层:可以动态生成容器、运行无头浏览器、调度子智能体;在其上推出 @cloudflare/ci,一个直接跑在 Workflows 上的持续集成与交付系统,提供步骤串联、依赖缓存与凭证管理,让智能体自行处理故障、修错与分诊。
配套的可观测面板提供兼容 OpenTelemetry 的追踪,能看到具体的模型调用、工具执行与 token 消耗。Cloudflare 还要求给每个智能体建预览部署,以便并行对照生产环境测试,并保证变更的原子性。
局限:这些都是 Cloudflare 自己的产品主张,来源没有给规模化落地案例、成本或性能数据。
来源:InfoQ 中文
10/10
蚂蚁灵波与阿拉伯数字经济联盟签框架备忘录
具身「大脑」把国际合作签到了中东,但目前停在框架阶段。
在全球数字贸易博览会的配套活动「中阿数字经济产业对接会」上,阿拉伯数字经济联盟(AFDE)与蚂蚁集团旗下的蚂蚁灵波科技签署框架合作备忘录,由 AFDE 助理秘书长 Ayman Ghoneim 与灵波商业化负责人俞靓代表双方签约。备忘录列了五个方向:在阿联酋等中东市场的部署与商业化,酒店餐饮、零售、物流、工业运营等场景的联合概念验证,面向阿拉伯语交互与本地流程的本地化,真实场景下的数据与训练协作,以及政企学研的生态合作。厂商披露的技术底座是自研的 LingBot-VLA 2.0,称其在预训练阶段已支持 17 个品牌、20 种机器人构型,相关开源模型在 GitHub 累计 3.18 万星。
局限:备忘录是框架协议,没有金额、部署时间表和订单;「一脑多机」、星数与药房落地效果都是厂商口径,未见第三方验证。本条目前只有中文来源(雷锋网)。
来源:雷锋网
在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。
免费生成图片

