AI 热点资讯

Clef开源,flash版中位延迟39毫秒

核心速览
  • •Cloudflare发布基于Qwen的Clef决策模型,官方公布两档延迟
  • •Meta开放Muse硬件接入代码,苹果调整完全磁盘访问权限,英伟达推出64GB版DGX Spark,另有Grok实验性SDK与llama.cpp决策接口动态。
jiufeng
2026年10月3日
10 分钟阅读
本文目录

概览

本期共 8 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Cloudflare开源Clef,基于Qwen输出分类概率

全球 AI 资讯

  1. 重点 · Meta开放Muse硬件接入代码
  2. 重点 · 苹果调整完全磁盘访问权限
  3. DGX Spark新增64GB配置,支持两机组集群
  4. AWS展示Claude Desktop接入托管网页搜索

区域与早期信号

  1. Nebula把外部智能体接入团队工作区
  2. Grok推出实验性TypeScript SDK
  3. llama.cpp加入五类模型的结构化决策接口

热门模型动态

01/08

Cloudflare开源Clef,基于Qwen输出分类概率

Clef与Clef-flash支持文本和图像输入,用预定义选项的概率替代长文本回答。

Cloudflare发布两款基于Qwen的决策模型,面向工单分类、紧急程度判断等任务,下游代码可依据结果分派请求或触发升级处理。官方公布的响应时间如下:

模型中位响应时间(毫秒)
Clef-flash39
Clef209

两款模型均可通过Workers AI使用,并以Apache-2.0许可证开放。

局限:表中延迟来自Cloudflare公布的数据,并非报道方的独立复测;关于智能体无需人工介入的说法,也属于厂商主张。

Cloudflare开源Clef,基于Qwen输出分类概率:中位响应时间(毫秒)对照

九凤根据本期已引用来源整理。

Cloudflare/clef · Hugging Face

图片来源:huggingface;已转存至九凤 R2。

来源:The Decoder · Cloudflare模型仓库

全球 AI 资讯

02/08

Meta开放Muse硬件接入代码

开发者可用ESP32或Raspberry Pi,把Muse接到自己组装的设备上。

据The Verge报道,Meta开放了用于制作Muse gadgets的代码与SDK,支持连接显示屏、按钮、传感器和执行器。官方举出的项目包括彩色电子墨水提醒屏、用于大屏显示的HDMI设备,以及小型触摸屏终端。

局限:这些是需要用户自行搭建的设备方案。

来源:The Verge · Nat Friedman公告

03/08

苹果调整完全磁盘访问权限

苹果调整完全磁盘访问权限,以限制AI智能体滥用授权。

Ars Technica报道了这项权限调整。报道摘要同时指出,Meta与苹果对Muse读取消息涉及的完全磁盘访问权限存在不同解释。

局限:两家公司对权限的解释不能视为一致结论。

来源:Ars Technica

04/08

DGX Spark新增64GB配置,支持两机组集群

英伟达为DGX Spark增加64GB版本,两台设备可组成总计128GB内存的集群。

据MarkTechPost报道,新配置由Acer、ASUS、Dell、Gigabyte、HP和MSI提供,定位于桌面端本地模型与智能体工作负载。其主要硬件与软件配置包括:

  • 芯片:GB10 Grace Blackwell。
  • 内存:单机64GB统一内存。
  • 网络:ConnectX-7。
  • 软件:NVIDIA CUDA加速AI软件栈。
部署配置总内存(GB)
单台64GB版64
两台64GB版集群128

局限:128GB指两台设备的集群内存总量;所提供材料没有给出售价或具体模型的实测吞吐。

来源:MarkTechPost · NVIDIA DGX Spark

05/08

AWS展示Claude Desktop接入托管网页搜索

AWS通过AgentCore Gateway,把兼容MCP的网页搜索接入Bedrock上的Claude Desktop。

AWS发布集成教程,搜索服务使用覆盖数百亿份文档的Amazon网页索引,用于查询近期文档、实时价格等模型训练知识之外的信息。教程涉及的接入方式包括:

  • 连接入口:启用Web Search目标的AgentCore Gateway。
  • 工具协议:托管MCP服务器。
  • 入站认证:基于JSON Web Token(JWT)的认证。
  • 查询路径:AWS称查询流量留在其基础设施内,无需管理外部API密钥。

局限:这是需要配置网关与认证的集成方案;未接入搜索时,模型仍无法自行检索当前信息,教程也不代表Claude模型本身获得了新版本。

来源:AWS教程

区域与早期信号

06/08

Nebula把外部智能体接入团队工作区

Nebula允许团队在同一工作区内使用自建智能体,以及已有的Claude、Codex智能体。

据RuntimeWire报道,Furqan Rydhan创办的Nebula在10月2日公告中介绍了创建与连接智能体的方式,其产品网站列出了Claude和Codex支持。Nebula定价页面列出的收费为每席位每月25美元,Nebula自有智能体另行计量。

局限:该产品仍需验证能否融入团队日常工作;所提供材料没有列出自有智能体的计量单价。

来源:RuntimeWire · Nebula公告

07/08

Grok推出实验性TypeScript SDK

@xai-official/sdk把Grok多类API与服务端工具放进同一个TypeScript客户端。

SpaceXAI的Eric Zakariasson于10月2日公布该SDK,覆盖文本响应、语音、图像和视频生成,以及由xAI服务器运行的搜索与代码工具。RuntimeWire查阅时,开源仓库仅有3次提交,项目仍处于1.0之前的阶段。

局限:官方明确表示接口可能随版本变化;托管工具依赖xAI服务端,接入方需要考虑版本固定与后续兼容性调整。

来源:RuntimeWire · 开发者公告 · SDK代码仓库

08/08

llama.cpp加入五类模型的结构化决策接口

新接口让本地程序直接获取是非判断、分类、评分及其概率分布。

据RuntimeWire报道,llama.cpp于10月2日合入Xuan-Son Nguyen编写的/v1/systemone接口,支持Laya、Julia-1、Lev、OpenJev和Kev五个模型家族。接口可基于共享输入同时提出多个问题,例如判断工单是否紧急、应交给哪个团队,以及客户的情绪程度。

局限:目前可用的是开发构建,v0.6.0仍为预期发布版本;返回概率在实际工作负载中的可靠性尚需验证,这也不是Meta Llama模型的版本更新。

来源:RuntimeWire · llama.cpp代码仓库

用 JIUFENG 自己生成一张

在浏览器里输入提示词就能出图,支持 1K / 2K / 4K,可加最多 15 张参考图。注册即送 50 次免费生成,无需信用卡。

免费生成图片