2026 Harvey Tenet是什麼:Kimi K3後訓練與法律代理基準全解析
Harvey 把第一份後訓練開源權重模型寫成 Tenet。下文依官方博文與 Law.com 分開能核對的數字。
法律科技公司 Harvey 本周把一份研究预览寫成可核對的技术說明:不再只租用别人的旗舰介面,而是在开源底座上做法律後訓練,并給出自家 Legal Agent Bench 上的數字。
核心对象是 Harvey Tenet。官方写它是 Kimi K3 底座、与 Fireworks 一起做異步强化学习,面向「长程、智能体式」法律任务。下文只整理官方博文与 Law.com 8 月 20 日稿能對上的口徑,不寫成「已全面超過 Fable 5 / GPT-5.6」。
官方寫成了什么
Harvey 写过去六个月兩條線:用開源權重做前沿法律智力;並讓律所自建、自有模型。Tenet 是第一条线的首个後訓練檢查點。训练环境仿 LAB:合夥人式任务說明、客戶事項材料、專家量規。智能体在沙箱里檢索、读文件、把交付物写到磁盘,再用 LLM 評判。
能核對的幾條口徑
- 1
底座与算法寫得很具體
官方:Kimi K3 + Fireworks 異步 RL;策略用 GSPO(組內優勢、近平局重評、長度項、雙端裁剪)。評判消融後收斂到 Kimi 2.6。語料是合成資料、公開法律資料與人類專家資料;与 Mercor 等合作做專家集與合成資料審校。
- 2
LAB 數字是相对 K3,不是獨立实验室榜
官方:hold-out 完成任务「幾乎兩倍」、LAB Contracts 多 20%;all-pass +9 与 +2 个百分点。自称 LAB Contracts 最強、LAB 第二。基線分數圖註寫 Vals LAB 榜。未見第三方按同一協議複跑整表。
- 3
另外三组能力实验不要和 Tenet 混成一個模型
M&A 盡調寫的是 GLM-5.2 在 RLM 線纜裡自蒸餾,標準通過率到 60.1%。Review Table 也是後訓練 GLM-5.2。Firm Knowledge 是与 Engram 訓的 Qwen3.8-27B。这些是「將併入產品」的分項,不是 Tenet 本體。
成本寫的是帕累托,不是單價清單
官方说開源權重单价更低,後訓練還用獎勵塑造壓推理 token。LAB hold-out 有質量—成本圖。没有在正文給出每百万 token 的公开价目。
「開源權重」不等於已經人人可下
官方标题与 Law.com 都寫 open-weight / 開源權重。同頁把它標成 Research Preview,並寫還要把研究推進生產。下载入口与许可证全文没有寫成与权重一并公开的仓库地址。
估值報道互相打架,不宜當事實
Startup Fortune 寫「估值接近 155 億美元」,Business Insider 寫「建立在 110 億美元業務上」。兩者都是媒體口徑。能核对的是 Tenet 技术說明,不是一轮新融资公告。
| 說法 | 能核對的來源 | 讀法 |
|---|---|---|
| K3 底座 + Fireworks 異步 RL | Harvey 官方博文 | 研究預覽的方法聲明 |
| LAB Contracts 第一、LAB 第二 | Harvey 官方;Law.com 转述 | 廠商评测,对照名单见 Law.com |
| 未用客戶資料 | Harvey 官方训练节 | 公司聲明,不是外部審計 |
官方把遷移寫到「訓練未見過」的 APEX Agents 与 Redline Bench。這是他們的泛化聲明。基準本身仍可能與法律工作分布重合,不宜讀成法庭認證。
# Harvey Tenet (official, research preview)
base: Moonshot Kimi K3
post-train: async RL + Fireworks
optimizer: GSPO
judge: Kimi 2.6
no customer data in post-training讀法与边界
- 完成量翻倍 ≠ 法律意見已可無人簽發
- 數字是 LAB hold-out 与量规。官方同時寫知識類基準(LegalBench、CUAD、MAUD 等)「未傷底座」。這不是執業許可或監管批准。
- LLM 評判有噪声
- 獎勵是量規細項加權 + 整體法律爭點,滿分有獎金。他们用更重旗艦做消融後選 Kimi 2.6。評判器本身会错。
- Harvey II 的 Memory 是產品,不是 Tenet
- Law.com:Tenet 見報两天前發布 Harvey II 與上下文保持。Startup Fortune 寫 Memory 不用於訓模型。應分開讀。
還想核對的問題
Tenet 已經對所有客戶替換掉 OpenAI / Anthropic 了嗎?
官方沒有這樣寫。它是研究预览,下一步才是擴算力進生產。Harvey 長期建立在第三方模型上,Law.com 与 Business Insider 都這樣敘述。
LAB 第一是不是獨立实验室结论?
不是。LAB 是 Harvey 自有開源法律代理基準。官方自稱 Contracts 第一、總榜第二。Law.com 列出對照模型。第三方複跑未見。
盡調 60.1% 是 Tenet 的分數嗎?
不是同一檢查點。官方盡調节写 GLM-5.2 + RLM,自蒸餾後標準通過率 60.1%,並稱技術報告待發。不要和 Tenet 的 LAB 數字叠成一张表。