本文目录
AI 热点资讯

Kimi K3 衍生法律模型 Tenet 开放研究预览

核心速览
  • Harvey 基于 Kimi K3 后训练法律模型 Tenet
  • 本期还关注 Codex 的 Luna Reserve、Fable 5 企业采用、百万上下文 Ox Alpha,以及智能体治理与区域产品信号。
jiufeng
2026年8月24日
14 分钟阅读
Kimi K3 衍生法律模型 Tenet 开放研究预览

概览

本期共 10 条,前 3 条为今日重点;正文按板块展开。

热门模型动态

  1. 重点 · Harvey Tenet:基于 Kimi K3 的法律后训练模型
  2. 重点 · Codex 测试 Luna Reserve 备用额度
  3. 重点 · Fable 5 在 Ramp 企业支出中仅占约 11%

全球 AI 资讯 4. 匿名模型 Ox Alpha 开放百万 Token 上下文 5. Netflix 开源因果推断智能代理工作流 6. Replit 为 Agent 打包七项工作流与治理功能 7. agent.md 模板要求修复缺陷前先写测试

区域与早期信号 8. Wan3.0 支持 30 秒视频与文档输入 9. 上海 AI 片场新增 50 台 DGX Spark 10. LEAPTIC Cube 以 55.9 克机身录制 8K 视频

2026-08-24 AI 热点信号地图
2026-08-24 AI 热点信号地图

九凤根据本期已引用来源整理。

热门模型动态

Harvey Tenet:基于 Kimi K3 的法律后训练模型

Harvey 将 Kimi K3 后训练为长周期法律智能体模型 Tenet,目前仅开放研究预览。

Tenet 由 Harvey 与 Fireworks 使用异步强化学习完成后训练,训练材料包括合成数据、公开法律数据和人类专家数据;Harvey 称未使用客户数据。在 Harvey 的 Legal Agent Benchmark 上,Tenet 完成的留出任务数接近 Kimi K3 基座的两倍,在 LAB: Contracts 上增加约 20%,两项测试的 all-pass rate 分别提高 9 个和 2 个百分点。

Tenet 尚不可部署,权重和正式服务均未公开。其主要成绩来自 Harvey 自测,Redline Bench 的公开排行榜目前没有对应结果,因此跨基准增益仍缺少公开复核。

crosbylegal/RedlineBench · Datasets at Hugging Face
crosbylegal/RedlineBench · Datasets at Hugging Face

图片来源:huggingface;已转存至九凤 R2。

来源:MarkTechPost · GSPO 论文 · Redline Bench

Codex 测试 Luna Reserve 备用额度

Codex 客户端代码显示,部分 Plus 和 Pro 用户耗尽高级模型额度后,可能获得独立的 Luna 备用额度。

RuntimeWire 逆向分析生产版 Codex 的 app.asar,发现 gpt-reserve 模型标识、reserve_enabled 功能门、Plus/Pro 资格检查和独立计量逻辑。客户端会保留用户原先选择的模型,并在 Reserve 结束后恢复;OpenAI 文档所列 GPT-5.6 Luna API 价格为每百万输入 Token 0.20 美元、输出 Token 1.20 美元。

Luna Reserve 尚未出现在 OpenAI 的公开功能公告中,当前证据仅表明客户端存在受功能门控制的测试代码,不能据此确认开放范围或正式上线时间。

来源:RuntimeWire · OpenAI 模型文档

Fable 5 在 Ramp 企业支出中仅占约 11%

Ramp 的企业支出样本显示,Anthropic 客户正更多选用较便宜模型,Fable 5 的支出占比趋于平稳。

英国《金融时报》经 IT之家转述称,Ramp 汇总的约 7 万家公司支出数据显示,Fable 5 发布两个多月后仅占 Anthropic 相关支出的约 11%。报道将这一变化归因于 Fable 5 的价格,以及旧模型已能处理多数企业任务;该模型在美国政府批准后于 7 月 1 日恢复上线。

这组数据只覆盖 Ramp 能观察到的企业付款,并不代表 Anthropic 全部 API、消费订阅或云渠道用量。Hacker News 的讨论反映了用户对价格和额度规则的意见,但属于社区反馈,不能替代完整采用数据。

来源:IT之家 · Hacker News

全球 AI 资讯

匿名模型 Ox Alpha 开放百万 Token 上下文

Ox Alpha 免费提供前沿级编程模型访问,但开发者身份、数据去向和长期可用性均未公开。

Ox Alpha 自 8 月 20 日起出现在 OpenRouter 与开源终端智能体 OpenCode 中,上下文窗口为 1,048,576 Token,单次输出上限为 131,072 Token。模型接受文本、图像和视频输入,不接受音频;OpenCode 宣称可提供每天 100 万亿 Token 的容量。

OpenRouter 的免费通道计划持续至 8 月 24 日,OpenCode 的公告则指向约 8 月 27 日。没有公司承认开发该模型,报道亦无法确认提交的代码会发送到哪里,因此不适合处理未公开或敏感代码。

来源:SiliconANGLE

Netflix 开源因果推断智能代理工作流

Netflix 的 oci-agent 用执行代理与评审代理自动迭代观察性因果分析,并把轻量版本开放到 GitHub。

该工作流从分析计划生成规格说明,填写并运行 Jupyter Notebook,再由评审代理将结果标记为 not_satisfactorysatisfactory_with_caveatsfully_satisfactory。在一项评估新型娱乐内容与两个月留存率关系的案例中,简单线性回归基准由 Claude 执行,而 oci-agent 得到的估算效果仅为基准的 25%,并识别出早期采用者偏差和安慰剂测试失败。

Netflix 使用 ACIC 竞赛数据进行评估,但没有给出可概括所有任务的统一成绩。项目保留人工监督,高层问题构建与最终结果判断仍由分析人员负责。

来源:InfoQ 中文 · InfoQ English · oci-agent

Replit 为 Agent 打包七项工作流与治理功能

Replit 将低成本聊天、定时任务、可移植指令、实时干预、模型策略和安全扫描组合进 Agent 更新。

8 月 21 日的更新共归拢七项功能,覆盖 Free Mode、可重复执行的 routines、可复用指令、运行中的实时引导、企业模型控制及三级安全检查。其目标是让一次性提示生成的项目可以沉淀为可调度、可复用并受企业策略限制的工作流。

部分能力此前已经单独发布,此次更新主要展示它们如何组合。现有材料未给出所有功能的套餐范围、用量上限或扫描覆盖率,企业治理效果仍取决于具体配置。

来源:RuntimeWire · Raouf Chebri

agent.md 模板要求修复缺陷前先写测试

一份面向编程智能体的 agent.md 模板,把“先观察失败测试,再修改代码”写成明确工作规则。

模板要求智能体处理缺陷时先编写测试并确认其失败,随后实施修复,再观察测试通过;相关 TDD 技能采用相同的执行顺序。文章及讨论还涉及自审、多轮实现,以及将通用编码规范拆到独立文件以减少无关上下文。

现有材料没有提供采用模板前后的缺陷率或受控实验结果。Hacker News 讨论中有人质疑这类指令是否真正改善模型迭代,也有人指出偶尔会产生意义有限的测试。

来源:原文 · Hacker News · TDD 技能

区域与早期信号

Wan3.0 支持 30 秒视频与文档输入

阿里云正式上线 Wan3.0,单次可生成 30 秒视频,并接受五类常用文档作为输入。

Wan3.0 支持 docxlspptpdfmd,已进入阿里云百炼、万相、万镜一刻、千问 AI 平台及千问客户端等入口。480P、720P 和 1080P API 价格分别为每秒 0.3 元、0.6 元和 1.2 元,8 月 24 日至 9 月 23 日在百炼与千问 AI 平台限时七折。

当前只有中文区域媒体转述阿里云信息,来源没有提供标准化视频评测、生成速度或不同文档格式的还原准确率。关于指令遵循、跨镜头一致性和音频质感的改进均为官方定性表述。

来源:IT之家

上海 AI 片场新增 50 台 DGX Spark

上影昊浦与筷子科技为昊帧影视创制平台增加本地算力,并推出年度万亿级多模态 Token 补贴。

该平台在既有百卡规模影视算力池上新增 50 台英伟达 DGX Spark,面向制片、编剧、美术、后期等多岗位协作。平台强调私有环境、确定性算力和素材集中管理,以减少专业团队在多个生成工具之间搬运提示词与资产。

这是仅见于中文区域报道的项目发布,年度“万亿级”指补贴额度而非实际消耗量。报道所称“全国首个工业级影视 AI 生产体系”属于发布方定位,尚无独立行业统计验证。

来源:爱范儿

LEAPTIC Cube 以 55.9 克机身录制 8K 视频

光子跃迁在 BIRTV 2026 展示 8K 拇指运动相机及语音、追踪和多设备协同功能。

LEAPTIC Cube 重 55.9 克,采用 1/1.3 英寸传感器,最高录制规格为 8K/30fps,并配备双屏结构。现场方案包含 Moko 语音助手、实时主体追踪和暗光算法,可通过语音开始记录或调整拍摄设置。

该产品目前仅有中文区域报道,性能描述来自展会展示和厂商材料。来源没有提供续航、码率、存储容量、量产日期或第三方画质测试,“全球首款”亦是厂商口径。

来源:雷锋网