2026 Harvey Tenet是什么:Kimi K3后训练与法律代理基准全解析

Harvey 把第一份后训练开源权重模型写成 Tenet。下文按官方博文与 Law.com 分开能核对的数字。

法律科技公司 Harvey 本周把一份研究预览写成可核对的技术说明:不再只租用别人的旗舰接口,而是在开源底座上做法律后训练,并给出自家 Legal Agent Bench 上的数字。

核心对象是 Harvey Tenet。官方写它是 Kimi K3 底座、与 Fireworks 一起做异步强化学习,面向「长程、智能体式」法律任务。下文只整理官方博文与 Law.com 8 月 20 日稿能对上的口径,不写成「已全面超过 Fable 5 / GPT-5.6」。

约两个月前:宣布自训法律模型8 月 18 日前后:Harvey II8 月 20 日:Tenet 研究预览见报

官方写成了什么

Harvey 写过去六个月两条线:用开源权重做前沿法律智力;并让律所自建、自有模型。Tenet 是第一条线的首个后训练检查点。训练环境仿 LAB:合伙人式任务说明、客户事项材料、专家量规。智能体在沙箱里检索、读文件、把交付物写到磁盘,再用 LLM 评判。

×2
官方:LAB hold-out 完成量相对 K3
+9 pp
官方:LAB hold-out all-pass
0
官方:后训练未用客户数据

能核对的几条口径

  1. 1

    底座与算法写得很具体

    官方:Kimi K3 + Fireworks 异步 RL;策略用 GSPO(组内优势、近平局重评、长度项、双端裁剪)。评判消融后收敛到 Kimi 2.6。语料是合成数据、公开法律数据与人类专家数据;与 Mercor 等合作做专家集与合成数据审校。

  2. 2

    LAB 数字是相对 K3,不是独立实验室榜

    官方:hold-out 完成任务「几乎两倍」、LAB Contracts 多 20%;all-pass +9 与 +2 个百分点。自称 LAB Contracts 最强、LAB 第二。基线分数图注写 Vals LAB 榜。未见第三方按同一协议复跑整表。

  3. 3

    另外三组能力实验不要和 Tenet 混成一个模型

    M&A 尽调写的是 GLM-5.2 在 RLM 线缆里自蒸馏,标准通过率到 60.1%。Review Table 也是后训练 GLM-5.2。Firm Knowledge 是与 Engram 训的 Qwen3.8-27B。这些是「将并入产品」的分项,不是 Tenet 本体。

01

成本写的是帕累托,不是单价清单

官方说开源权重单价更低,后训练还用奖励塑造压推理 token。LAB hold-out 有质量—成本图。没有在正文给出每百万 token 的公开价目。

02

「开源权重」不等于已经人人可下

官方标题与 Law.com 都写 open-weight / 开源权重。同页把它标成 Research Preview,并写还要把研究推进生产。下载入口与许可证全文没有写成与权重一并公开的仓库地址。

03

估值报道互相打架,不宜当事实

Startup Fortune 写「估值接近 155 亿美元」,Business Insider 写「建立在 110 亿美元业务上」。两者都是媒体口径。能核对的是 Tenet 技术说明,不是一轮新融资公告。

说法能核对的来源读法
K3 底座 + Fireworks 异步 RLHarvey 官方博文研究预览的方法声明
LAB Contracts 第一、LAB 第二Harvey 官方;Law.com 转述厂商评测,对照名单见 Law.com
未用客户数据Harvey 官方训练节公司声明,不是外部审计

官方把迁移写到「训练未见过」的 APEX Agents 与 Redline Bench。这是他们的泛化声明。基准本身仍可能与法律工作分布重合,不宜读成法庭认证。

# Harvey Tenet (official, research preview)
base: Moonshot Kimi K3
post-train: async RL + Fireworks
optimizer: GSPO
judge: Kimi 2.6
no customer data in post-training

读法与边界

完成量翻倍 ≠ 法律意见已可无人签发
数字是 LAB hold-out 与量规。官方同时写知识类基准(LegalBench、CUAD、MAUD 等)「未伤底座」。这不是执业许可或监管批准。
LLM 评判有噪声
奖励是量规细项加权 + 整体法律争点,满分有奖金。他们用更重旗舰做消融后选 Kimi 2.6。评判器本身会错。
Harvey II 的 Memory 是产品,不是 Tenet
Law.com:Tenet 见报两天前发布 Harvey II 与上下文保持。Startup Fortune 写 Memory 不用于训模型。应分开读。

还想核对的问题

Tenet 已经对所有客户替换掉 OpenAI / Anthropic 了吗?

官方没有这样写。它是研究预览,下一步才是扩算力进生产。Harvey 长期建立在第三方模型上,Law.com 与 Business Insider 都这样叙述。

LAB 第一是不是独立实验室结论?

不是。LAB 是 Harvey 自有开源法律代理基准。官方自称 Contracts 第一、总榜第二。Law.com 列出对照模型。第三方复跑未见。

尽调 60.1% 是 Tenet 的分数吗?

不是同一检查点。官方尽调节写 GLM-5.2 + RLM,自蒸馏后标准通过率 60.1%,并称技术报告待发。不要和 Tenet 的 LAB 数字叠成一张表。

免费开始开会