全新上线GPT-IMAGE-2 现已加入 Jiufeng Hub 画廊!立即体验
本文目录
AI 热点资讯

Grok 4.6 接入 Devin,主打仓库探查与根因诊断

核心速览
  • Cognition 把 xAI 的 Grok 4.6 接入 Devin 编程平台
  • 阿里开放 Qwen3.8-2.4T-A95B 权重(2.4T MoE、激活 95B、原生 256K)
  • DeepSeek V4 Pro 上线百万上下文
  • Gemini 份额跌至 1.9%,Anthropic 升至 14.9%。
jiufeng
2026年8月13日
14 分钟阅读
Grok 4.6 接入 Devin,主打仓库探查与根因诊断

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Grok 4.6 接入 Devin,主打仓库探查与根因诊断
  2. 重点 · 阿里开放 Qwen3.8-2.4T-A95B 权重,2.4T MoE 首度开源
  3. 重点 · DeepSeek V4 Pro 上线,百万上下文逼近前沿梯队
  4. Gemini 市场份额下滑,Anthropic 升至 14.9%

全球 AI 资讯 5. Google DeepMind 发布手语转文字模型 SL2T 6. Liquid AI 发布端侧视觉模型 LFM2.5-VL-3B 7. 研究者从输出文本近乎完美还原 LLM 提示词 8. Twitch 上线开关,允许退出训练亚马逊 AI

区域与早期信号 9. 自变量机器人直播分拣 1816 件/小时(中文来源) 10. 腾讯云开源 Agent 沙箱 Cube Sandbox(中文来源)

2026-08-13 AI 热点信号地图
2026-08-13 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

Grok 4.6 接入 Devin,主打仓库探查与根因诊断

Cognition 把 xAI 的 Grok 4.6 加进 Devin,佐证「编排层比单一底座模型更耐久」的产品主张。

Cognition 于 8 月 12 日把 xAI 的 Grok 4.6 加入 Devin Desktop 与 Devin CLI,让开发者在本地代码库里多了一个可选底座模型。公司在 X 上发布集成公告,并附一份技术说明,称 Grok 4.6 尤其擅长「先探查仓库、定位根因,再动手改代码」,还能遵循仓库既有约定、改完自测。Cognition 由 Scott Wu 带队,称创始团队合计拿过 10 枚国际信息学奥赛金牌,一直以可度量的编程能力为产品重心。

Cognition 把 Devin 定位成「模型中立的智能体控制层」,这份对 Grok 4.6 的能力描述出自 Cognition 官方、尚无第三方基准佐证;集成当日未公布定价或额度细节。

来源:RuntimeWire · Cognition on X

阿里开放 Qwen3.8-2.4T-A95B 权重,2.4T MoE 首度开源

Qwen-Max 级别模型首次开放权重,原生 256K 上下文、可扩到约 100 万 Token。

阿里 Qwen 团队 8 月 12 日深夜在魔搭 ModelScope 社区开放 Qwen3.8-2.4T-A95B 模型权重:总参数 2.4T,每个 Token 激活 95B,原生支持 262,144(256K)Token 上下文,可扩展至 1,010,000 Token。官方称这是 Qwen-Max 级别的模型首次开源权重。

模型页给出的是参数与上下文规格,许可证条款、榜单成绩与推理吞吐等细节需以 ModelScope 官方页为准;本文未见第三方独立评测数据。

来源:ModelScope

DeepSeek V4 Pro 上线,百万上下文逼近前沿梯队

DeepSeek-V4-Pro-0813 登陆 API,配百万 Token 上下文与智能体开发工具,定价为 Flash 档三倍。

DeepSeek 在 API 平台上线 DeepSeek-V4-Pro-0813,主打一百万 Token 上下文窗口,并面向智能体开发者提供显式工具接口;定价为 Flash 档的三倍。Pandaily 称该版本正逼近前沿梯队。

「逼近前沿」是 Pandaily 的表述,报道未附与具体前沿模型对比的榜单分数;目前为单一媒体来源,尚无独立基准复核。

来源:Pandaily

Gemini 市场份额下滑,Anthropic 升至 14.9%

三组数据同向:Pangram 测得 Gemini 从 12% 跌到 1.9%,OpenAI 稳守 50% 以上,Anthropic 从 4.3% 升至 14.9%。

据 The Decoder 汇总的三组数据:文本识别平台 Pangram 按提交文本统计,OpenAI 自开始追踪起每月份额均超 50%,Anthropic 从 4.3% 升到 14.9%(主要在技术与科研领域),Gemini 则从 12% 跌至 2026 年 7 月的 1.9%,被 Pangram 称为「崩塌」,OpenRouter 数据亦反映同一趋势。Similarweb 数据显示谷歌网站份额上月由 27% 微降至 26.8%,但一年前仅 9.4%;谷歌另称 Gemini App 月活达 10 亿。

报道明确列出各来源盲区:Pangram 主要衡量写作类任务(Gemini 一贯偏弱),OpenRouter 偏向开放权重模型,而月活是「质量很低的信号」。三组口径不同,只在 Gemini 份额收缩这一点上一致。

来源:The Decoder · Similarweb

全球 AI 资讯

Google DeepMind 发布手语转文字模型 SL2T

首次把手语 AI 推进消费级产品,率先支持美国手语(ASL)转英文。

Google DeepMind 发布大规模多语手语转文字(SL2T)翻译模型,称在质量与通用性上取得突破,并首次把手语 AI 从实验室带入消费级产品:SL2T 已驱动 Pixel 11 上 Gboard 与 Live Transcribe 的手语转文字听写,首发 ASL 转英文。DeepMind 指出,全球有 200 多种手语、约 7000 万聋人及听障者,此前的语音 AI 进展未覆盖到他们。

首发仅支持 ASL→英文,官方称「更多设备与语言即将到来」,尚未给出时间表与其它语种的准确率。

来源:Google DeepMind

Liquid AI 发布端侧视觉模型 LFM2.5-VL-3B

3B 视觉语言模型,主打屏幕/界面理解、目标定位与函数调用,可在本地设备运行。

Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,可在自有硬件上运行,搭配 SigLIP2 视觉编码器。相较上代,官方列出四项改进:屏幕/界面理解、以自然语言查询做目标定位与检测、多图输入推理,以及在纯文本与图文场景下更强的函数调用;模型采用「直接作答、不做显式推理」的方式以保证端侧实时响应。

官方对函数调用的增强未给出量化分数,具体基准与延迟数据以 Hugging Face 模型页为准;3B 定位于端侧,能力边界与大模型不同。

LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

图片来源:huggingface;已转存至九凤 R2。

来源:Hugging Face

研究者从输出文本近乎完美还原 LLM 提示词

IIT 孟买与 Adobe Research 提出 PTP 逆向模型,仅凭输出文本重建原始 prompt。

IIT 孟买与 Adobe Research 提出名为「Previous-Token Prediction(PTP)」的方法:训练一个逆向语言模型来预测上一个 Token,仅凭 LLM 生成的输出文本,就能以接近完美的准确率重建原始提示词。该逆向模型完全用目标 LLM 生成的合成数据从零训练,无需访问模型权重,甚至适用于第三方模型。

论文称因「多个不同 prompt 可能产生相似输出」,此类还原此前被视为不切实际;「接近完美」为论文在其设定下的结果,尚属 arXiv 预印本、待同行复现。

来源:The Decoder · arXiv

Twitch 上线开关,允许退出训练亚马逊 AI

用户可选择不让直播、录播、剪辑与聊天被用于训练亚马逊的生成式 AI 模型。

Twitch 上线一个开关,允许用户退出把自己的内容用于训练亚马逊生成式 AI 模型。据 The Verge,退出后「你的直播、VOD、剪辑、直播聊天,以及频道上的图片与文字」将不被用于「未来」训练目标为生成文本、音频、图像或视频的亚马逊 AI 模型;字幕、安全工具等其它 AI 支持功能不受影响。

该开关只作用于「未来」训练——据 The Verge,退出后你的内容不再被用于将来的训练,仅对将来生效;开关原文为「Allow your channel content to train generative AI content models at Amazon…」,关闭该开关即为退出。此外,若你在他人频道聊天,是否可用于训练由对方的退出设置决定。

来源:The Verge · Twitch on X

区域与早期信号

自变量机器人直播分拣 1816 件/小时(中文来源)

厂商直播实测:双臂+夹爪方案分拣异形包裹,称效率超 Figure AI 公开纪录 45%。

据量子位报道,自变量机器人在一场公开直播实测中,用双机械臂+夹爪方案连续一小时分拣随机异形包裹,效率达 1816 件/小时,称超过美国 Figure AI 此前公开的 1248 件/小时平均纪录约 45%,且硬件成本较 Figure 的人形机器人+五指灵巧手方案低约 70%。分拣对象包含纸盒、快递软袋、圆柱件与泡沫封装生鲜件,摆放为随机姿态,由自研 WALL-B「世界统一模型」实时识别并匹配抓取策略。

以上为厂商自办直播的实测主张,效率与成本对比均出自自变量机器人一方口径,尚无独立第三方复核;本条为中文来源单源报道。

来源:量子位

腾讯云开源 Agent 沙箱 Cube Sandbox(中文来源)

亚百毫秒级启动的智能体执行环境,7 月被 OpenClaw 作者合入其 provider 体系。

据 InfoQ 报道,腾讯云 2026 年 4 月开源 Cube Sandbox,定位为面向 AI Agent 的执行环境底座,主打亚百毫秒级启动;其底层由 2023 年前后的 Serverless 生产系统演进而来,后转向代码执行、数据分析、Agent RL 与 Agent Runtime。今年 7 月,OpenClaw 作者 Peter Steinberger 主动提交并合入 PR,把 Cube 接入其 provider 体系,与 E2B、Modal 等沙箱服务并列。背景是终端 Agent 拿到文件系统、浏览器、账号等权限后,隔离与可恢复的执行环境成为刚需。

报道将 Cube 视为观察 Agent 基础设施演进的样本,未给出与 E2B、Modal 的量化性能对比;本条为中文来源,附 GitHub 仓库供核验。

来源:InfoQ · GitHub