本文目录
AI 热点资讯

Gemini 3.8 Flash 上线:六周内第三款,价格不变

核心速览
  • Google 六周内第三款 Flash 模型 Gemini 3.8 上线,定价与 3.7 持平但可能更耗 token
  • Anthropic 公布 Fable 5.1 基准与 Mythos 5.1 分层
  • RuntimeWire 发现 Kimi Work 3.2.4 未经批准读取本地文件
  • Qwen 团队开源本地检索层 zg。
jiufeng
2026年9月3日
24 分钟阅读
Gemini 3.8 Flash 上线:六周内第三款,价格不变

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Gemini 3.8 Flash 上线:六周内第三款 Flash,定价与 3.7 持平
  2. 重点 · Gemini 3.8 Flash Cyber 经 Fairwind 计划限量开放
  3. 重点 · Fable 5.1 科研基准翻倍,Agent 成本最高降 45%
  4. Kimi Work 3.2.4 隐藏系统提示覆盖,未经批准读取本地文件

全球 AI 资讯 5. Qwen 团队开源 zg:ripgrep、BM25 与向量检索合一 6. GPT-5.6 三款模型可从澳大利亚区域经 Bedrock 调用 7. IBM 启动 K-12 AI 领导者奖学金,首批最多百人

区域与早期信号 8. Ollama 用本地代理把开放模型接回 Claude Desktop 9. Meta 发布 Muse Spark 1.3,主打长程智能体与编码 10. Multiverse 推出 Quasar 438B,智能指数居欧洲模型首位

2026-09-03 AI 热点信号地图
2026-09-03 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

Gemini 3.8 Flash 上线:六周内第三款 Flash,定价与 3.7 持平

Google 于 9 月 2 日发布 Gemini 3.8 Flash,定价与 3.7 Flash 相同,但 The Decoder 称其「更努力」的推理每个任务约多耗 30% 输出 token。

Google DeepMind 于 9 月 2 日发布 Gemini 3.8 Flash,距 3.7 Flash 仅三周,是六周内的第三款 Flash 模型。官方称这是其迄今最强的推理与编程模型,速度和成本与 3.7 相同:介绍性定价为输入每百万 token 0.75 美元、输出每百万 token 3.75 美元。此次同时推出两个变体:面向通用工作负载的 3.8 Flash,以及面向漏洞检测与自动修补、仅通过 Fairwind 计划向可信防御方开放的 3.8 Flash Cyber。RuntimeWire 称已能通过 Gemini API 调用该模型;@LuminaBench 在 9 月 2 日截获的 API 元数据显示,gemini-3.8-flash 的上下文窗口为 1,048,576 token、输出上限 65,536 token,支持 generateContent、batchGenerateContent、countTokens 与 createCachedContent。

局限:The Decoder 引述 Google 的数据称,3.8 Flash 在部分智能体编程基准上以更低成本追平 Claude Opus 5,但其推理每个任务约多用 30% 输出 token,实际花费可能高于 3.7 Flash。RuntimeWire 指出能调用不等于对所有开发者普遍可用,其与 Fable 5.1 的对比测试尚未出结果。The Decoder 还提到 Gemini 3.5 Pro 与 Gemini 4 仍未发布。

来源:Google DeepMind · Google 官方博客 · RuntimeWire · The Decoder

Gemini 3.8 Flash Cyber 经 Fairwind 计划限量开放

Google 同日启动 Fairwind 计划,把 3.8 Flash Cyber 与 CodeMender harness 打包给政府和可信伙伴,用于发现、验证并修复漏洞。

Google 安全与隐私副总裁 Four Flynn 于 9 月 2 日宣布启动 Fairwind Program,这是一个面向政府和可信伙伴的限量访问计划,用于使用 Google 最先进的网络防御能力。该计划把 Google 称为其最强网络安全模型的 Gemini 3.8 Flash Cyber 与 CodeMender harness 组合起来,帮助防御方以智能体规模发现、验证并修复漏洞。Google 在公告里描述了防御者此前的两难:庞大的前沿模型部署昂贵、难以在企业代码库中控制,而较小的开放权重模型在复杂漏洞修复上力不从心、还得自建工具链。官方把 3.8 Flash Cyber 定位为在漏洞检测与自动修补上具备前沿级表现。

局限:这是分阶段推进的限量访问计划。公告写明首批面向政府与国家网络安全机构、关键基础设施运营者以及核心技术平台,参与机构须承诺把访问限于内部安全、应急响应与渗透测试团队,并启用多因素认证。公告未提定价与具体时间表;3.8 Flash Cyber 不对公众开放,其表现主张来自 Google 自述,本文未见第三方评测。

来源:Google DeepMind · Google 官方博客:Fairwind 计划 · Google 官方博客:Gemini 3.8

Fable 5.1 科研基准翻倍,Agent 成本最高降 45%

Anthropic 公布 Fable 5.1 与 Mythos 5.1 的基准:Terminal-Bench-Science 从 24.7% 升到 52.6%,Agent 工作负载调用成本最高降约 45%。

据 InfoQ 中文整理 Anthropic 官方页面,Anthropic 于当地时间 9 月 1 日正式发布 Claude Fable 5.1 与 Claude Mythos 5.1。两者使用相同的底层模型,区别在安全保护级别:Fable 5.1 面向公众与企业全面开放,Mythos 5.1 只通过受信任访问计划提供给部分网络安全与生命科学机构。在 Terminal-Bench-Science 0.1 上,Fable 5.1 得分 52.6%,Fable 5 为 24.7%、Opus 5 为 29.0%、GPT-5.6 Sol 为 22.4%;在 Terminal-Bench 4.0 上,Fable 5.1 为 55.8%,放开部分限制的 Mythos 5.1 为 60.9%。Anthropic 称 Agent 工作负载的实际调用成本最高下降约 45%,缓存读取更便宜。

局限:Fable 5.1 内置网络安全与生物安全保护机制,触发风险规则的请求一部分会被阻止、另一部分会被路由到能力较弱的 Opus 模型,InfoQ 认为 Terminal-Bench 4.0 上与 Mythos 的差距主要来自这套安全系统在部分网络安全任务中的介入。InfoQ 还指出,把推理强度拉满时,完成一次任务仍可能比前代更贵。以上分数均为 Anthropic 自报。

来源:InfoQ 中文 · Anthropic:Claude Fable 与 Mythos 5.1

Kimi Work 3.2.4 隐藏系统提示覆盖,未经批准读取本地文件

RuntimeWire 逆向 Kimi Work 3.2.4 发现一个未公开的系统提示覆盖:启用后一道普通数学题就触发了对工作区外本地文件的读取,且没有弹出批准对话框。

RuntimeWire 通过逆向 Moonshot 8 月 31 日发布的 Kimi Work 3.2.4 Windows 版,发现其中含有一个未在文档中记录的系统提示覆盖(自定义指令)机制。在 Manual approval(手动批准)模式下启用该覆盖后,一个与文件无关的普通数学问题触发了一次本地文件工具调用,并原样返回了所选工作区之外一个合成「金丝雀」文件的内容,期间没有出现读取批准对话框;恢复默认提示并新开会话后,同一问题不再产生任何工具调用。写入与 Shell 操作仍被独立的权限控制拦住:另一项测试中智能体在 Write 被拒后尝试绕道,两次尝试都被权限系统阻止。RuntimeWire 称测试全程未观察到网络传输。

局限:这是 RuntimeWire 基于逆向工程与合成数据的独家调查,仅在 Windows 版复现;报道摘录中未见 Moonshot 的回应或修复版本信息。RuntimeWire 指出,Kimi Work 文档承诺手动批准可防止未经同意的操作,而自动批准的读取让系统级指令有机会在用户看到闸门之前暴露本地数据。

来源:RuntimeWire · Kimi Work 发行说明

全球 AI 资讯

Qwen 团队开源 zg:ripgrep、BM25 与向量检索合一

Qwen Developer 团队开源本地优先检索层 zg(zvec-grep),Apache 2.0 许可,把精确匹配、关键词与语义检索放到同一个接口后面。

Qwen Developer 团队宣布开源 zg(zvec-grep),一个本地优先的检索层,把语义搜索、BM25 与 ripgrep 放在同一接口之后,供人和智能体共用。代码托管在 zvec-ai GitHub 组织下,采用 Apache 2.0 许可,允许商用。它通过 npm 以 @zvec/zvec-grep 安装,要求 Node.js 22 或更新版本,支持 macOS、Linux 与 Windows,使用默认模型时不需要 GPU。快速上手的默认嵌入模型是 local/potion-code-16m-v2(Model2Vec 静态模型,256 维,输入上限 8,192 token),也可换用 jina-embeddings-v2-base-code、embeddinggemma-300m、qwen3-embedding-0.6b 等模型。zg 对工作区建一次索引,之后提供多条检索路径:MarkTechPost 把这套设计概括为「一个索引、四条检索路线」,Qwen 团队在 X 上的公告则写作「语义、BM25、混合与 rg 检索合于一个工具」。MarkTechPost 的分析指出,编程智能体把大量工具预算花在搜索上:已知符号用 ripgrep 能精确命中,但按自然语言描述的行为往往关键词匹配不到,智能体只好猜词、整文件读取、手工拼上下文,每次绕路都要花工具调用、token 和时间。

局限:报道摘录未给出检索质量或 token 节省的量化数据;本条来源为 MarkTechPost 报道与 Qwen 团队在 X 上的公告。

来源:MarkTechPost · Qwen Developers on X

GPT-5.6 三款模型可从澳大利亚区域经 Bedrock 调用

AWS 让悉尼与墨尔本区域的应用通过全球跨区域推理调用 OpenAI GPT-5.6 Sol、Terra 与 Luna,三者都支持最高 100 万 token 上下文。

AWS 在机器学习博客发文称,澳大利亚团队现可通过 Amazon Bedrock 调用 OpenAI 的 GPT-5.6 Sol、Terra 与 Luna:应用调用亚太(悉尼)或亚太(墨尔本)区域的 Bedrock Runtime 端点,由 Bedrock 把请求路由到某个受支持的商业区域处理,以获得更大的容量池,应用无需自行管理目标区域。三款模型均接受文本与图像输入、输出文本,上下文窗口最高 100 万 token,可用 Responses API、Chat Completions API 与 Converse API 调用。AWS 给出的定位是:Sol 适合高要求的推理、编程与智能体负载,Terra 平衡性能与成本,Luna 面向高并发、低延迟场景。端点接受 SigV4 签名或 Bedrock 模型推理 API key,示例用 AWS Bedrock Token Generator for Python 从当前凭据生成短期 key;Codex 也可在 ~/.codex/config.toml 里把 model 设为 global.openai.gpt-5.6-sol、把 model_provider 指向 Bedrock。

局限:这是「跨区域」推理,请求会被路由到某个受支持的商业区域处理,不一定在澳大利亚境内完成;文中未给出发布日期、定价与延迟数据。

来源:AWS Machine Learning Blog · Codex 配置参考 · AWS Bedrock Token Generator for Python

IBM 启动 K-12 AI 领导者奖学金,首批最多百人

IBM 面向大纽约地区最多 100 名学区负责人开办 AI 领导者奖学金,回应课堂 AI 使用跑在教师培训前面的调查结果。

IBM 于 9 月 2 日启动 IBM K-12 AI Leaders Fellowship,起因是一项由 IBM 资助的调查发现,课堂里的 AI 使用已远远走在教师培训和家长指导之前。该调查由 Morning Consult 于 2026 年 7 月为 IBM 在线进行,覆盖 1,019 名 K-12 教育从业者与 1,029 名家长,各样本误差约 ±3 个百分点。首期今年秋季开班,招收大纽约地区最多 100 名学区总监、教育负责人与教师;学员通过 IBM 免费的 SkillsBuild 项目接受 AI 教学并获得证书,完成负责任 AI 课程,并做一个可在本学区落地的结业项目。IBM 计划在第一年把这一批次模式推广到更多州,由副总裁兼首席影响官 Justina Nixon-Saintil 牵头。RuntimeWire 指出科技公司正在搭建这层「培训层」:Google 与 ISTE+ASCD 在推面向约 600 万美国教育工作者的免费 Gemini AI 素养培训,OpenAI 则承诺五年投入 1000 万美元,支持美国教师联合会到 2030 年覆盖 40 万名 K-12 教育者的项目。

局限:单一报道来源(RuntimeWire 转述 IBM 新闻稿),调查由 IBM 出资委托;项目首期仅限纽约地区,不是全国性计划。

来源:RuntimeWire · OpenAI 与 AFT 合作页

2026-09-03 AI 热点重点信号
2026-09-03 AI 热点重点信号

九凤根据本期已引用来源整理。

区域与早期信号

Ollama 用本地代理把开放模型接回 Claude Desktop

Ollama v0.33.0 用一个本地代理让 Qwen、DeepSeek、Kimi、GLM 等开放模型直接在 Claude Desktop 界面里运行,绕开了 Anthropic 四月的模型名单封锁。

据钛媒体,Ollama 在 8 月 21 日发布的 v0.33.0 中加入了面向 Claude Desktop 的专用本地代理,并于 8 月 26 日在官方博客宣布:Claude Desktop 可把 Ollama 配置为「第三方网关提供商」,从而在 Anthropic 自家应用里运行 Qwen、DeepSeek、Kimi、GLM 等开放模型。文章回顾了此前的封堵:今年 1 月 Ollama 支持 Anthropic Messages API,Claude Code 可指向 Ollama;4 月 Anthropic 在 Claude Desktop 加入连接第三方推理网关的开发者设置,Ollama 随即推出 ollama launch claude-desktop 一键接入,但数日后 Claude Desktop 更新为拒绝所有非 Anthropic 模型 ID。有用户贴出的日志显示,网关的 /v1/models 返回 39 个模型、可用数却为 0,应用坚持调用 claude-sonnet-4-6 并报错,Ollama 随后下架功能。新方案把绕行点挪到本机:代理源码位于 internal/proxy/claude_desktop.go,Claude Desktop 的请求先落到代理再转发给 Ollama 托管的任意模型;配置压成一次点击,Mac 菜单栏常驻「使用 Ollama 模型」开关,关闭后原有 Claude 设置原样恢复。

局限:本条来源为钛媒体专栏「AI唱反调」的分析稿,Ollama 官方博客与 Anthropic 的说法未在本文直接引用;文章把这段过程称为「猫鼠游戏」,Anthropic 是否会再次调整,文中没有说法。

来源:钛媒体

Meta 发布 Muse Spark 1.3,主打长程智能体与编码

Meta 于 9 月 2 日发布其迄今最强模型 Muse Spark 1.3,首席 AI 官 Alexandr Wang 称其编码能力超过 GPT-5.6 Sol、与 Claude Fable 5.1 持平,定价与 1.2 相同。

据 IT之家,Meta 于 2026 年 9 月 2 日发布 Muse Spark 1.3,称这是公司迄今最强大的 AI 模型,专为延长智能体工作流与增强编码能力设计。Meta 首席 AI 官 Alexandr Wang 表示,该模型在编码能力上超越 OpenAI 的 GPT-5.6 Sol,与 Anthropic 的 Claude Fable 5.1 表现持平。定价维持与前代 Muse Spark 1.2 相同,通过 Meta Model API 向开发者付费提供。

局限:以上能力对比是 Meta 高管的口头主张,IT之家的报道摘录未附基准名称与分数;本条仅有中文媒体来源,Meta 官方页面与定价明细本文未能核对。

来源:IT之家

Multiverse 推出 Quasar 438B,智能指数居欧洲模型首位

西班牙 Multiverse Computing 发布 4380 亿参数、100 万 token 上下文的 Quasar 438B,在 Artificial Analysis 智能指数 v4.1.1 上得 43 分,为参与比较的欧洲模型最高。

据 IT之家,西班牙 AI 公司 Multiverse Computing 推出 Quasar 438B 模型,参数量 4380 亿,上下文窗口 100 万 token。按 Artificial Analysis 的评分,该模型在 Intelligence Index v4.1.1 上得 43 分,在参与比较的欧洲模型中排名最高;该指数综合 9 项评测,覆盖智能体、代码、科学推理、通用知识与长上下文推理。作为对比,Mistral Medium 3.5 得 30 分,NVIDIA Nemotron 3 Ultra 得 38 分。该模型目前是专有模型,权重未公开,仅支持文本输入输出,通过 CompactifAI API 提供访问,API 价格为每百万输入 token 0.60 美元、每百万输出 token 1.80 美元。

局限:本条仅有中文媒体来源;权重不开放,只能经 API 使用;「欧洲最强」的说法限于 Artificial Analysis 当次比较的范围。

来源:IT之家