2026 Harvey Tenet是什么:Kimi K3后训练与法律代理基准全解析
Harvey 把第一份后训练开源权重模型写成 Tenet。下文按官方博文与 Law.com 分开能核对的数字。
法律科技公司 Harvey 本周把一份研究预览写成可核对的技术说明:不再只租用别人的旗舰接口,而是在开源底座上做法律后训练,并给出自家 Legal Agent Bench 上的数字。
核心对象是 Harvey Tenet。官方写它是 Kimi K3 底座、与 Fireworks 一起做异步强化学习,面向「长程、智能体式」法律任务。下文只整理官方博文与 Law.com 8 月 20 日稿能对上的口径,不写成「已全面超过 Fable 5 / GPT-5.6」。
官方写成了什么
Harvey 写过去六个月两条线:用开源权重做前沿法律智力;并让律所自建、自有模型。Tenet 是第一条线的首个后训练检查点。训练环境仿 LAB:合伙人式任务说明、客户事项材料、专家量规。智能体在沙箱里检索、读文件、把交付物写到磁盘,再用 LLM 评判。
能核对的几条口径
- 1
底座与算法写得很具体
官方:Kimi K3 + Fireworks 异步 RL;策略用 GSPO(组内优势、近平局重评、长度项、双端裁剪)。评判消融后收敛到 Kimi 2.6。语料是合成数据、公开法律数据与人类专家数据;与 Mercor 等合作做专家集与合成数据审校。
- 2
LAB 数字是相对 K3,不是独立实验室榜
官方:hold-out 完成任务「几乎两倍」、LAB Contracts 多 20%;all-pass +9 与 +2 个百分点。自称 LAB Contracts 最强、LAB 第二。基线分数图注写 Vals LAB 榜。未见第三方按同一协议复跑整表。
- 3
另外三组能力实验不要和 Tenet 混成一个模型
M&A 尽调写的是 GLM-5.2 在 RLM 线缆里自蒸馏,标准通过率到 60.1%。Review Table 也是后训练 GLM-5.2。Firm Knowledge 是与 Engram 训的 Qwen3.8-27B。这些是「将并入产品」的分项,不是 Tenet 本体。
成本写的是帕累托,不是单价清单
官方说开源权重单价更低,后训练还用奖励塑造压推理 token。LAB hold-out 有质量—成本图。没有在正文给出每百万 token 的公开价目。
「开源权重」不等于已经人人可下
官方标题与 Law.com 都写 open-weight / 开源权重。同页把它标成 Research Preview,并写还要把研究推进生产。下载入口与许可证全文没有写成与权重一并公开的仓库地址。
估值报道互相打架,不宜当事实
Startup Fortune 写「估值接近 155 亿美元」,Business Insider 写「建立在 110 亿美元业务上」。两者都是媒体口径。能核对的是 Tenet 技术说明,不是一轮新融资公告。
| 说法 | 能核对的来源 | 读法 |
|---|---|---|
| K3 底座 + Fireworks 异步 RL | Harvey 官方博文 | 研究预览的方法声明 |
| LAB Contracts 第一、LAB 第二 | Harvey 官方;Law.com 转述 | 厂商评测,对照名单见 Law.com |
| 未用客户数据 | Harvey 官方训练节 | 公司声明,不是外部审计 |
官方把迁移写到「训练未见过」的 APEX Agents 与 Redline Bench。这是他们的泛化声明。基准本身仍可能与法律工作分布重合,不宜读成法庭认证。
# Harvey Tenet (official, research preview)
base: Moonshot Kimi K3
post-train: async RL + Fireworks
optimizer: GSPO
judge: Kimi 2.6
no customer data in post-training读法与边界
- 完成量翻倍 ≠ 法律意见已可无人签发
- 数字是 LAB hold-out 与量规。官方同时写知识类基准(LegalBench、CUAD、MAUD 等)「未伤底座」。这不是执业许可或监管批准。
- LLM 评判有噪声
- 奖励是量规细项加权 + 整体法律争点,满分有奖金。他们用更重旗舰做消融后选 Kimi 2.6。评判器本身会错。
- Harvey II 的 Memory 是产品,不是 Tenet
- Law.com:Tenet 见报两天前发布 Harvey II 与上下文保持。Startup Fortune 写 Memory 不用于训模型。应分开读。
还想核对的问题
Tenet 已经对所有客户替换掉 OpenAI / Anthropic 了吗?
官方没有这样写。它是研究预览,下一步才是扩算力进生产。Harvey 长期建立在第三方模型上,Law.com 与 Business Insider 都这样叙述。
LAB 第一是不是独立实验室结论?
不是。LAB 是 Harvey 自有开源法律代理基准。官方自称 Contracts 第一、总榜第二。Law.com 列出对照模型。第三方复跑未见。
尽调 60.1% 是 Tenet 的分数吗?
不是同一检查点。官方尽调节写 GLM-5.2 + RLM,自蒸馏后标准通过率 60.1%,并称技术报告待发。不要和 Tenet 的 LAB 数字叠成一张表。