AI 热点资讯

Claude Haiku 5.5 发布,成本较上代低约75%

核心速览

Anthropic 发布 Claude Haiku 5.5,称运行成本比 Haiku 4.5 平均低约 75%,并已上架 Amazon Bedrock。英伟达的 Nemotron 微调版在 IOI 2026 拿到 535.4/600。Liquid 开放两款多模态决策模型的权重,Google 推出 Playground 游戏创作平台。

jiufeng
2026年10月8日
16 分钟阅读
本文目录

概览

本期共 9 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Claude Haiku 5.5 发布,运行成本较 Haiku 4.5 平均低约 75%
  2. 重点 · 英伟达 Nemotron 微调版在 IOI 和 IMO 2026 都达到金牌水平
  3. 重点 · Liquid 开放 d1-3B 与 d1-omni-600M 多模态决策模型权重

全球 AI 资讯

  1. 微软公布英伟达芯片版 Surface Laptop Ultra 规格与售价
  2. Google 推出 Playground,用文字提示就能做浏览器游戏
  3. ChatGPT 青少年版将加入大学申请规划工具 College Planner
  4. 美国政府、科技公司与 Biohub 投入 18 亿美元建设 AI 生物学数据集

区域与早期信号

  1. Nous Research 完成 9000 万美元 B 轮融资,推出面向企业用户的智能体
  2. Amazon Quick 与 Bedrock 知识库在检索前过滤之外加一层查询时权限校验
2026-10-08 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

01/09

Claude Haiku 5.5 发布,运行成本较 Haiku 4.5 平均低约 75%

Anthropic 的新一代小模型面向子智能体和高并发场景,已可在 Amazon Bedrock 上使用。

Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,称它是公司迄今最便宜、最快、能力最强的小模型,多数任务的平均运行成本比 Haiku 4.5 低约 75%。AWS 宣布 Haiku 5.5 已上架 Amazon Bedrock 和 Claude Platform on AWS。AWS 文中援引 Anthropic 的说法,称它是「Claude 5.5 家族里最快、最高效的模型」,主要用于子智能体和成本敏感的高并发任务。

  • Bedrock 侧:支持按区域驻留数据,可接入 IAM 权限、CloudTrail 审计、CloudWatch 监控和 Bedrock Guardrails,费用计入 AWS 账单
  • Claude Platform on AWS:通过 AWS 控制台使用 Anthropic 原生 API、功能和控制台,鉴权与计费统一走 AWS
  • 上手材料:aws-samples 仓库已放出 Getting Started notebook

局限:据 RuntimeWire 报道,Anthropic 的发布帖没有给出每 token 单价、基准成绩、上下文上限和 API 标识符。Haiku 4.5 的文档标价为输入每百万 token 1 美元、输出 5 美元;在新价格公布之前,「平均成本低 75%」这一说法没法直接换算成新的 token 单价。

anthropic-on-aws/notebooks/claude_haiku_5_5_getting_started/claude-haiku-5-5-getting-started.ipynb at main · aws-samples/anthropic-on-aws

图片来源:GitHub;已转存至九凤 R2。

来源:RuntimeWire · AWS Machine Learning Blog · Getting Started notebook

02/09

英伟达 Nemotron 微调版在 IOI 和 IMO 2026 都达到金牌水平

同一个 Nemotron 3 基座分别做专项训练后,在信息学和数学两项奥赛上都达到了金牌线。

英伟达团队在 Hugging Face 博客介绍,他们以 Nemotron 3 为基座,结合监督微调(SFT)、强化学习(RL)和基于反馈的推理,做出了两个专项系统。IOI 2026 由 Nemotron-3-Ultra-CC 加上 SFT 和 GenCorrect 参赛,得分 535.4/600。IMO 2026 用的是「生成—验证—修正」系统,也达到了金牌水平。

IMO 部分的训练方法已写成 arXiv 论文;NeMo-Skills 仓库公开了 IMO 推理流水线的配方。

局限:成绩来自英伟达团队自己的博客和论文,属于厂商自述;两项任务用的是分别专项化的模型,并不是同一个通用模型一次跑出两项金牌。

来源:Hugging Face Blog · arXiv 论文 · NeMo-Skills

03/09

Liquid 开放 d1-3B 与 d1-omni-600M 多模态决策模型权重

Liquid AI 发布 Open d1,是 d1 决策模型家族中的两款开放权重模型,支持图像和音频输入,不生成文本。

Liquid AI 发布 Open d1,包含两款开放权重的多模态模型:

  • d1-3B:输入为文本和图像
  • d1-omni-600M:输入为文本加图像,或文本加音频
  • 输出方式:不写文本,一次前向传播直接返回经过校准的类型化答案,输出 token 为零
  • 部署:权重已上 Hugging Face,可用 Transformers 加载,llama.cpp 首日支持,目标硬件是 DGX、RTX 工作站和 Jetson 边缘板
  • 许可:LFM Open License v1.0,年收入低于 1000 万美元的机构可免费商用

局限:d1-omni-600M 是早期研究版本,官方没有公布延迟数据。

来源:MarkTechPost · d1-3B 模型页

全球 AI 资讯

04/09

微软公布英伟达芯片版 Surface Laptop Ultra 规格与售价

微软公布了搭载英伟达芯片、面向运行 AI 模型和智能体的 AI PC 的价格。

微软周三在旧金山科技周期间举办活动,公布了 Surface Laptop Ultra 的规格和价格。这批 AI PC 采用英伟达芯片,设计用途是运行 AI 模型和智能体,同时推出的还有改版后的 Windows 11。

配置价格(美元)
基础型号一(起售价)2,600
基础型号二(起售价)3,700
加配内存与存储的最高价5,900

局限:微软表示最高配置已经售罄;目前只有 TechCrunch 一家报道来源。

来源:TechCrunch

05/09

Google 推出 Playground,用文字提示就能做浏览器游戏

这是一个由 Gemini、Nano Banana 和 Lyria 驱动的实验性游戏创作平台,美国成年用户可以免费使用。

用户在 Playground 里用文字描述,就能修改游戏规则、物理效果、角色和场景,改完可以马上试玩。做好的游戏可以通过链接分享,也能发布到公开画廊;部分类型的游戏支持排行榜和多人模式。平台本身免费,Google One 订阅用户按套餐享有更高的每周用量上限。同日 Google 还和 Unity 宣布了面向专业开发的 Unity Spark,可以调用 Unity Asset Store。

局限:Playground 目前是实验产品,只对美国成年用户开放;公开发布的游戏要按社区准则做安全审核;Unity Spark 还处在计划中的封闭测试阶段。

来源:Google Blog · The Decoder

06/09

ChatGPT 青少年版将加入大学申请规划工具 College Planner

OpenAI 计划让 ChatGPT 青少年版覆盖从截止日期到助学金的整个申请流程,但青少年安全防护正受到外部质疑。

OpenAI 表示,College Planner 会汇总学生意向院校的申请要求、截止日期、待办事项和助学金步骤,并支持进度跟踪、查找奖学金和申请费减免。首个版本面向美国 10 到 12 年级、申请四年制大学的学生,之后计划扩展到其他国家,以及两年制学院、技术学院和职业学校。同批更新还包括闪卡、测验功能和一个青少年 AI 顾问委员会。

局限:OpenAI 没有给出 College Planner 的上线日期。同一天,Common Sense Media 发布的评估认为 ChatGPT 青少年版对 18 岁以下用户属于「不可接受的风险」,双方的分歧在于默认开启的防护在高风险对话中是否可靠。

来源:OpenAI · RuntimeWire

07/09

美国政府、科技公司与 Biohub 投入 18 亿美元建设 AI 生物学数据集

一个由六家以上公私机构组成的联盟要为「虚拟细胞」类模型补齐训练数据。

据 SiliconANGLE 报道,这个联盟于 10 月 7 日宣布,承诺为项目投入 18 亿美元,目标是产出训练生物学专用 AI 模型所需的大规模数据集。报道指出,要验证细胞对新疗法的反应,通常需要搭建实体实验环境,可能耗时数年、花费数百万美元;用高可靠度的模拟细胞做测试有望缩短这一过程。

局限:报道称,能替代实验设备的高精度细胞模拟目前还不存在,这次的投入是用来生产数据,不是已经建成的模型。

来源:SiliconANGLE

区域与早期信号

08/09

Nous Research 完成 9000 万美元 B 轮融资,推出面向企业用户的智能体

开源 Hermes Agent 的开发方证实估值 15 亿美元,同时发布了企业版智能体产品。

Nous Research 的 B 轮融资由 Robot Ventures 领投,Nvidia、Union Square Ventures、Menlo Ventures、三星和 1789 Capital 参投。这家成立三年的公司累计融资达到 1.58 亿美元,同时推出了面向企业用户的 AI 智能体。

局限:目前只有 TechCrunch 单一报道来源,企业版智能体的功能、价格和开放范围在摘录中都没有细节。

来源:TechCrunch

09/09

Amazon Quick 与 Bedrock 知识库在检索前过滤之外加一层查询时权限校验

AWS 给企业 RAG 权限问题的做法是两层把关:先用索引里存的 ACL 属性过滤,再在查询时回源实时核对。

AWS 介绍,Amazon Quick 和 Amazon Bedrock Knowledge Bases 在已有的检索前 ACL 过滤(依据索引中存储的 ACL 属性)之上,增加了查询时的实时校验:直接向 SharePoint、Google Drive、Confluence 等权威数据源核验访问控制列表,目标是让每个员工拿到的 AI 回答只来自自己有权查看的文档。

局限:这是 AWS 官方技术博客,属于厂商自述,目前还没有第三方测评。

来源:AWS Machine Learning Blog

用 JIUFENG 自己生成一张

在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。

免费生成图片