AI 热点资讯

Claude Opus 5.5 打印桥承重 130 磅拿下第一

核心速览
  • •Claude Opus 5.5 在五模型 3D 打印桥比试里承重约 130 磅居首
  • •GPT-6 Astra 直连 Unitree G1 收拾陌生厨房
  • •Fireworks 用 Kimi K3 改出的 Ember-1 少生成四成 token
  • •匿名模型 Space Bunny 登顶 OpenRouter 调用日榜。
jiufeng
2026年9月28日
17 分钟阅读
本文目录

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Claude Opus 5.5 打印桥承重约 130 磅,五模型第一
  2. 重点 · GPT-6 Astra 直连机器人,在陌生厨房自己收拾
  3. 重点 · Ember-1 基于 Kimi K3 改造,推理 token 少四成
  4. 744B 的 Atria Dawn Preview 复盘:智能体提方案、人类拍板

全球 AI 资讯

  1. Jev 在 Minecraft 里 24 毫秒做一次决策
  2. TinyAIArena 让四个模型在 8×8 格子上对决
  3. Engram 用机上小模型把 AI 幻觉做成声音

区域与早期信号

  1. 匿名模型 Space Bunny 登顶 OpenRouter 调用日榜
  2. FermiQLLM 1.0 在千问基座上做量子增强
  3. 豆包手机助手用户在《王者荣耀》里被踢下线
2026-09-28 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

01/10

Claude Opus 5.5 打印桥承重约 130 磅,五模型第一

Anthropic 的 Claude Opus 5.5 在一场五模型 3D 打印承重桥比试里排第一,桥体承重约 130 磅。

Roberto Nickson(@rpnickson)9 月 27 日在 X 上公布了这场比试的结果。参赛的是 Anthropic Claude Opus 5.5、月之暗面 Kimi K3、Meta Muse Spark 1.3、OpenAI GPT-6 Astra 和 SpaceXAI Grok 4.7,他把五个模型都设在「High」推理档。题目有三条硬约束:桥要跨过两英尺、耗材不超过 500 克、打印时间少于 18 小时;配重的种类和压在桥上的位置也由他指定。

模型桥体承重
Claude Opus 5.5约 130 磅
Muse Spark 1.326.5 磅
GPT-6 Astra约 17.5 磅
Kimi K3未完成挑战
Grok 4.7未完成挑战

RuntimeWire 写道,在 Nickson 的这组对比里,Claude 在承重和打印效率两项都领先。

局限:这是一个人在自己设定的条件下跑出来的结果,报道明确说它描述的是他测试条件下的这几个设计,而不是五个模型工程能力的通用排名;130 磅与 17.5 磅都被明确标注为估计值,结果出自 Nickson 自述,他在 X 帖里附了一段约 15 分钟的视频。

来源:RuntimeWire · Roberto Nickson 在 X 的原帖 · Claude Opus 5.5 产品页

02/10

GPT-6 Astra 直连机器人,在陌生厨房自己收拾

斯坦福与加州理工把 GPT-6 Astra 直接接到 Unitree G1 上,跳过了中间那层专门训练的控制模型。

这套系统叫 HomeBody。它把语言模型与机器人之间常见的已训练控制层去掉,换成一个可替换的视觉语言模型(这里是 GPT Astra)直接调用可扩展的技能库——抓取、导航、开抽屉。机器人先在房间里探索,在 NVIDIA Isaac Sim 里建一个数字孪生,把物体和位置记进空间记忆,因此东西离开视野后它仍能找到。遇到「把厨房收拾一下」这类任务,语言模型逐步规划,出错就自我纠正。

局限:研究者列出的短板是 Astra 的延迟、手指伺服过热和高算力成本。这是一套研究系统,目前能依据的只有研究团队自述的运行结果,没有第三方复现。

GitHub - Stanford-TML/homebody

图片来源:GitHub;已转存至九凤 R2。

来源:The Decoder · HomeBody 项目仓库 · NVIDIA Isaac Sim 文档

03/10

Ember-1 基于 Kimi K3 改造,推理 token 少四成

Fireworks 说这个从 Kimi K3 改出来的模型能给出相当的答案,但少生成约 40% 的 token。

Fireworks AI 联合创始人 Dmytro Dzhulgakov(@dzhulgakov)9 月 27 日在 X 上推广 Ember-1。公司 9 月 23 日推出这个模型,定位是压低推理密集的编码与智能体负载的成本,官方发布材料用基准测试和客户实测结果支撑了「少 40% token」这一项。Dzhulgakov 在帖子里说它「在 HN 上很热」,并称它快 40%、更便宜。他是 Fireworks 七位联合创始人之一,团队页写明他曾是 Meta 的 PyTorch 核心维护者。

局限:RuntimeWire 指出,官方材料并不支持「响应速度普遍快 40%」这个说法——少生成 token 能降低单任务成本,但不等于跨负载的延迟更低。40% 是厂商自测数字,且与具体负载相关。

来源:RuntimeWire · Dmytro Dzhulgakov 在 X 的原帖

04/10

744B 的 Atria Dawn Preview 复盘:智能体提方案、人类拍板

一支含复旦大学研究者的团队复盘自家模型的开发日志:智能体贡献了最多 55% 的方法提案,但超过 85% 的最终决定还是人做的。

  • 样本:769 条任务日志,来自 56 名参与者,另加他们使用的智能体日志
  • 被开发的模型:Atria Dawn Preview,混合专家架构、7440 亿参数,面向研究与工程任务
  • 训练方式:每个任务绑定一个真实执行环境,调用工具、产出中间结果,再用测试、指标或来源证据这类外部信号校验
  • 自述成绩:团队称在 16 个基准里有 5 项领先,含网页搜索与网络安全

局限:这是团队对自己项目的复盘,不是第三方观察;16 项基准里另外 11 项并未称第一,成绩也全部来自团队自述。

来源:The Decoder · Atria Dawn Preview

全球 AI 资讯

05/10

Jev 在 Minecraft 里 24 毫秒做一次决策

Hao AI Lab 放出一段 Minecraft 对战演示,称 TypeSafe 的 Jev 每次决策约 24 毫秒。

演示发布于 9 月 27 日。实验室说,在一块 NVIDIA B200 上跑 DJev,系统每秒最多能做 40 次决策,并把这个速度描述为快过人类反应时间。这套设计的前提是:给软件一组预先定义好的选项,让模型快速给它们打分,而不是让通用聊天模型现场生成一段回复。实现记在 Matt Mastracci(@mmastrac)名下,他的 DJev 仓库描述的正是这种结构化决策服务端。TypeSafe 9 月 15 日完成 4000 万美元种子轮,由 DCVC 领投。

局限:帖子没有公布比赛结果、对照实验或对手信息,24 毫秒和「很难打赢它」都是实验室自述,不是第三方实测;在预设动作里选得快,也不等于在生产软件里可靠。

来源:RuntimeWire · DJev 代码仓

06/10

TinyAIArena 让四个模型在 8×8 格子上对决

一个 Show HN 项目把四个模型放进 8×8 的格子里打生死局,访客可以点开任意一场旁观。

作者 hp6 把 TinyAIArena 发上 Hacker News,说它针对的是「点进一个 AI Arena、期待一场恶战,结果只看到一张跑分表」的失望。页面上每一场对局都可以点进去观战,代码放在 ai-arena 仓库,README 把规则写全了:

  • 胜负:最后存活的模型获胜,违规动作由服务端裁判驳回
  • 行动:每轮行动顺序随机;移动、攻击(15–24 点伤害)、等待各耗 1 点行动力
  • 地图与道具:8×8 棋盘上随机放 4 个障碍格;拾取金币 +1 行动力,击杀 +1 行动力并回 50 HP
  • 排名:排行榜按 Elo 计算

帖子在约 8 小时内拿到 93 分、40 条评论。

局限:胜负与排名都出自这个项目自己的服务端裁判和 Elo 排行榜,不是独立评测;本条的证据只有作者自述与代码仓,Hacker News 讨论只能算线索。

来源:Show HN 讨论 · ai-arena 代码仓

07/10

Engram 用机上小模型把 AI 幻觉做成声音

Thoughtful Things 给它的第一台乐器 Engram 开了 Kickstarter:一台用 AI 揉碎输入音频、甚至凭空生成声音的采样器。

Engram 是采样器加 groovebox,公司把它形容成「潜空间里的一台现场录音机」,做的是对小模型的电路弯折。它刻意不做一键出歌那种设备——目标是实验性的、听起来不对劲的声音,把 AI 音频模型推到它的边界之外。设备不联网,机上跑一颗 tiny AI;按 Kickstarter 页面的说法,这颗模型由公司自研设计并自行训练。

局限:这是众筹阶段的硬件,成品表现要等交付后才能判断,声音效果取决于那颗自研小模型;目前可依据的只有公司自述与众筹页面的描述。

来源:The Verge

区域与早期信号

08/10

匿名模型 Space Bunny 登顶 OpenRouter 调用日榜

一个没有厂商认领的匿名模型几天内冲到 OpenRouter 与 OpenCode 的调用日榜第一,量子位做了一轮编码实测。

量子位从 OpenRouter 取 API,接进 DeepSeek Harness 跑了四个随机抽取的 case。用 Three.js 搭一座带交互细节的立方体风格天坛,模型在一到两小时内跑完,还自行加了没被要求的东西:底部控制条里有夜、黎明、正午三个时刻和雨、烟两个天气开关;昼夜自动循环,一天约 3.5 分钟,时辰文字从子时走到亥时。第二题做仿苹果系统的闹钟,追加了每个月闹铃响不响的开关,起床时间设到 7:23。第三题做一个 App,首版窗口不能拖动,也没有关闭和最小化按钮。

局限:模型仍是匿名的,参数、定价与归属都要等厂商认领才知道;两张榜排的是调用量,不是能力。实测是一个人的非受控评测,模型自己也说合成鼠标事件在那个环境里会被系统丢掉一部分,拖动是否与指针同步它没法在无头环境里断言。本条目前只有中文来源(量子位),没有对应的英文报道。

来源:量子位 · @Fei2411 的原帖

09/10

FermiQLLM 1.0 在千问基座上做量子增强

清华背景的初创公司费米宇宙称推出了全链路量子增强大模型,基于 Qwen 开源基座改造。

  • 公司:费米宇宙,专注 Q4AI(Quantum for AI);项目今年 3 月启动,先用 4B 小模型验证可行性,5 月正式成立公司
  • 融资:种子轮累计 1 亿元人民币,投后估值约 10 亿元,资金正在陆续交割
  • 做法:把张量网络、量子模拟退火、规范自由度等方法嵌进数据表征、模型结构、训练、强化、评测五个环节;不依赖容错量子计算机,在现有 GPU 上训练和部署
  • 内测数字:对标同参数量级传统模型,推理性能提升超 15%、持续强化学习环节训练成本降 25% 以上;MATH-500、GPQA-Diamond、BBH 等基准相较同规模开源基座综合提升 10%~20%

局限:所有数字都来自公司内测和量子位的独家报道,没有公开的模型权重、技术报告或第三方复现,也没有披露具体参数规模与基座版本;融资还在陆续交割中。本条只有中文来源(量子位)。

来源:量子位

10/10

豆包手机助手用户在《王者荣耀》里被踢下线

搭载豆包手机助手的努比亚 NaviX Ultra 上,用户登录《王者荣耀》会被提示设备环境异常并强制下线,双方口径还没对上。

按 IT之家 9 月 27 日的消息,字节跳动旗下豆包手机助手 9 月 25 日在官方社区发文说明:从 9 月 24 日晚开始陆续收到多条用户反馈,在这台机器上登录《王者荣耀》或进行匹配对战时,会被提示设备环境异常、被强制踢下线。声明称全程未对腾讯游戏系统做任何操作,AI 不存在违规点击、外挂或模拟行为,团队仍在与腾讯相关方接洽,截至发文未收到明确回复。官方建议用户暂时不要在该机型上反复尝试登录,账号已被封禁的通过官方游戏客服渠道申诉。努比亚 NaviX Ultra 是第二代豆包手机,5999 元起。

局限:两边口径没对上——豆包侧称自己没动游戏系统,腾讯侧没有公开回应,只有知情人士称安全风险策略是为保障游戏公平、没有做针对性调整;受影响用户数与封号数都没有公开数字。本条只有中文来源(IT之家)。

来源:IT之家

用 JIUFENG 自己生成一张

在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。

免费生成图片