本文目录
AI 热点资讯

DeepSeek V4 Flash托管上线:输入每百万0.15美元

核心速览
  • DeepSeek V4 Flash新增低价托管,Qwen3.6进入JetBrains本地智能体,GPT‑5.6接入Kiro
  • 本期还覆盖Mistral中东合作、AWS的Ray与ARD、Agent Lightning及机器人早期信号。
jiufeng
2026年8月25日
11 分钟阅读
DeepSeek V4 Flash托管上线:输入每百万0.15美元

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · DeepSeek V4 Flash托管价低至每百万输入0.15美元
  2. 重点 · JetBrains用Qwen3.6-27B打造本地Junie
  3. 重点 · GPT‑5.6接入Kiro开发环境
  4. Mistral与HUMAIN筹划中东本地化模型

全球 AI 资讯 5. SageMaker HyperPod加入托管Ray能力 6. ARD开放智能体资源发现规范 7. Agent Lightning 1.0.1开放智能体优化技能 8. 假Codex安装器诱导Mac用户执行恶意命令

区域与早期信号 9. GEN-1.5用数秒演示学习机器人任务 10. 京东搭建7000平方米机器人赛事服务中心

2026-08-25 AI 热点信号地图
2026-08-25 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

DeepSeek V4 Flash托管价低至每百万输入0.15美元

OneTriangle上线DeepSeek V4 Flash托管服务,以低价和低延迟推理为卖点。

服务按每百万输入Token 0.15美元、输出Token 0.35美元计费,运行在八张H100组成的推理栈上。报道给出的保留配置在128个并发请求下约为每秒10039个输出Token,中位首Token时延约0.35秒;官方模型仓库显示,DeepSeek V4 Flash 0731采用MIT许可证。

OneTriangle所称“最快”尚无报道内的独立对比验证,其价格亦高于DeepSeek直连API。

deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face

图片来源:huggingface;已转存至九凤 R2。

来源:RuntimeWire · 发布帖 · 模型仓库

JetBrains用Qwen3.6-27B打造本地Junie

Junie Local内置4比特Qwen3.6-27B,可在Mac上离线运行编程智能体。

用户在Junie中执行/local后,约20GB的模型和本地服务器会自动安装,无需配置运行时或端点。服务不消耗Token额度,代码无需离开本机,但要求配备64GB内存的M5 Mac。

JetBrains称,在其私有测试中,Qwen3.6-27B与Sonnet 4.5得分相当,GPT-5略高;启用推理的Qwen3.8执行任务约慢四倍。相关结果来自JetBrains内部测试,材料未披露完整基准设置。

来源:JetBrains

GPT‑5.6接入Kiro开发环境

Kiro已向开发者提供GPT‑5.6,用于规划、构建、审查和测试软件。

OpenAI称,GPT‑5.6现已在Kiro中可用,可帮助开发者规划、构建、审查和测试软件,并将此次接入定位为兼顾价格与性能的开发者选项。

现有材料未给出具体价格、基准分数、上下文长度或开放范围,相关描述目前仅来自OpenAI公告。

来源:OpenAI

Mistral与HUMAIN筹划中东本地化模型

双方将围绕沙特及中东市场开展模型开发、本地化和部署合作。

合作规模达数亿欧元,范围包括AI基础设施、先进模型开发和解决方案部署,初步方向包含网络安全。Mistral表示,项目将面向沙特阿拉伯及更广泛的中东地区推进主权AI能力。

公告使用“将寻求开发”等表述,尚未公布具体模型、参数、时间表或可用入口。

来源:Mistral AI

全球 AI 资讯

SageMaker HyperPod加入托管Ray能力

AWS把Ray集群的创建、监控和开发环境连接整合进SageMaker HyperPod。

新功能运行在Amazon EKS上,可创建和监控Ray集群,并将JupyterLab及Code Editor笔记本连接至运行中的集群。它还预置Ray Dashboard和Amazon Managed Grafana可观测能力,底层集群生命周期由开源KubeRay管理。

AWS公告未提供价格、支持区域或相对自行部署KubeRay的性能数据,因此运维收益尚缺少量化对比。

来源:AWS · KubeRay

ARD开放智能体资源发现规范

ARD试图用统一规范发现分散在不同环境中的智能体、工具、技能和MCP服务器。

AWS Agent Registry提供集中、可搜索的资源目录,可收录智能体、MCP服务器、工具、技能及自定义资源。配套的Agentic Resource Discovery规范采用Apache License 2.0,并已开放GitHub仓库。

当前材料主要描述规范和目录结构,未给出跨客户端兼容测试、外部采用规模或大规模目录的检索性能。

来源:AWS · ARD GitHub

Agent Lightning 1.0.1开放智能体优化技能

微软把提示词、工具和工作流优化封装成可由编程智能体使用的技能。

用户提供可编辑的智能体和基准后,该技能会引导智能体系统调整提示词、工具、工作流、模型及推理设置,并以准确率、成本、延迟和可靠性衡量迭代。v1.0.1是该技能的首个正式版本。

发布材料未披露标准任务上的提升幅度或运行成本;Hacker News线索当时仅有27分和1条评论,社区反馈仍有限。

来源:GitHub · Hacker News

假Codex安装器诱导Mac用户执行恶意命令

攻击者借助搜索广告和仿冒下载页实施ClickFix社会工程攻击。

Cato研究人员发现,查询“codex macos download”等关键词时,恶意赞助结果可能排在OpenAI官方链接之前。仿冒页面托管于Google Sites,通过iframe载入攻击内容,并诱导用户打开终端粘贴命令;研究人员识别出三组相关基础设施。

目前观察到的载荷仅针对macOS,攻击仍需要用户主动执行命令;公开材料未说明受影响用户数量。

来源:SiliconANGLE

区域与早期信号

GEN-1.5用数秒演示学习机器人任务

GEN-1.5可从一次3至12秒的演示中学习短时程操作任务,但仍属于研究发布。

模型在30秒上下文窗口中接收传感与动作数据,在10项操作任务上直接进行上下文学习的平均成功率为59%±10%。每项任务再使用5分钟数据训练10个梯度步骤后,平均成功率升至83%±9%。

测试任务被开发团队明确描述为简单、短时程任务;上述结果由Generalist AI报告,目前没有公开权重或API,尚不能直接部署。

来源:MarkTechPost

京东搭建7000平方米机器人赛事服务中心

“机器人之家”为2056台参赛机器人提供存储、维修、充电和数字化登记服务。

第二届世界人形机器人运动会吸引16个国家的666支队伍,京东建设的服务中心设有可容纳1500余台机器人的存储区、24个维修站点、近200个充电柜和100个独立充电位。其“一机一码”“一电池一码”系统宣称可在30秒内完成存取登记。

该条仅有单一中文区域媒体报道,现有材料未提供服务故障率、实际维修完成量或相关数据的独立核验结果。

来源:雷锋网