2026 年 8 月 20 日,美国法律 AI 公司 Harvey 公布首个经过后训练的开放权重模型 Harvey Tenet,选择月之暗面 Kimi K3 作为底座,并与 Fireworks Research 合作进行法律领域后训练。
Harvey 表示,过去半年公司的研究重点包括两个方向:1)利用开放权重模型构建前沿法律智能;2)以及开发能够让律所训练并拥有自身专业模型的系统。
Tenet 是这一研究工作的首个公开成果。
Tenet 以 Kimi K3 为底座,训练数据包括合成数据、公开法律数据以及人类专家数据,重点提升模型处理长周期、Agent 化法律任务的能力。
134 块 B300,训练两个月
Harvey 与 Fireworks Research 从 Kimi K3 出发,在真实法律工作环境中进行异步强化学习训练。
训练环境采用与 Legal Agent Benchmark(LAB)类似的结构。每项任务包括律所合伙人式的工作指令、包含相关材料的客户 Matter,以及由专家制定的评分标准。模型需要在沙盒环境中搜索材料、阅读文件并完成最终法律工作成果。
Tenet 使用 GSPO(Group-Sequence Policy Optimization)进行强化学习,并采用 Rank-64 LoRA 对完整 Kimi K3 网络进行适配,包括 Attention、MLP 和路由专家权重。
Harvey 训练数据集包含约 1750 个法律 Agent 任务环境,每个训练 Epoch 执行 150 个优化步骤,累计超过 1 万次独立 Rollout。
整个训练过程使用 134 块 NVIDIA B300 GPU,持续约两个月。
Harvey 还明确表示,整个后训练过程没有使用任何客户数据。
测试数据
Harvey 公布的测试结果显示,法律领域后训练明显提高了 Kimi K3 在复杂 Agent 法律任务中的表现。
在 LAB 留出测试任务中,Tenet 的 All-pass Rate 相比原始 Kimi K3 增加 9 个百分点;在 LAB Contracts 上增加 2 个百分点。
从成功完成的任务数量看,Tenet 在 LAB 上完成的任务接近原始 Kimi K3 的两倍,在 LAB Contracts 上多完成约 20%。
Harvey 官方披露的具体测试成绩显示,Tenet 在 Legal Agent Bench 上的 All-pass Rate 为 19.7%,Kimi K3 为 10.8%;在 LAB Contracts 上,Tenet 为 11.3%,Kimi K3 为 9.3%。
按相对增幅计算,Tenet 在 LAB 上的 All-pass Rate 相比 Kimi K3 提升约 82%,在 LAB Contracts 上提升约 22%。
Tenet 在 LAB Contracts 上达到当前最佳水平,在综合 LAB 测试中排名第二。
Harvey 还在训练数据之外的第三方法律 Agent 基准上测试了 Tenet。
在 Mercor APEX Agents Corporate Law 中,Tenet 得分 74.0,高于 Kimi K3 的 58.8;在 Crosby Redline Bench 中,Tenet 得分 55.5,也高于 Kimi K3 的 49.3。
Harvey 表示,APEX Agents 和 Redline Bench 均没有出现在 Tenet 的训练数据中,后训练获得的能力可以迁移到不同的法律 Agent 基准和运行环境。
在 APEX-v1、Scale Professional Reasoning Benchmark、LegalBench、CUAD 和 MAUD 等侧重法律知识和推理能力的基准中,Tenet 整体保持了 Kimi K3 原有的法律知识水平。
性能提高,成本基本保持稳定
Harvey 此次公布的另一项主要结果是成本效率。
Harvey 表示,开放权重模型本身拥有更低的 Token 价格,同时模型总成本还取决于完成任务所消耗的 Token 数量。
在后训练过程中,Harvey 通过 Reward Shaping 鼓励模型减少不必要的工具调用和推理步骤,在任务表现相同的情况下优先选择消耗 Token 更少的执行路径。
结果显示,Tenet 在 LAB 留出任务上的 All-pass Rate 从 Kimi K3 的 10.8% 提升至 19.7%,与此同时,单任务成本基本保持稳定。
Harvey 开始扩大开放权重模型投入
Harvey 将 Tenet 及其扩展能力视为公司在训练环境设计、后训练和开放权重模型研究上的一个阶段性成果。
下一步,公司计划将 LAB 扩展至更多司法辖区、业务领域和工作流程,同时扩大训练算力,将目前的研究成果逐步推进至生产环境。
Tenet 目前仍处于 Research Preview 阶段。
更值得关注的是 Harvey 底层模型路线的变化。
Harvey 没有从零训练一个大型基础模型,而是以 Kimi K3 为底座,再利用法律数据、专业任务环境、专家评分体系和强化学习构建自己的法律模型。
对 Kimi K3 而言,这也是一次具有代表性的高价值专业服务场景落地。
除了被 Harvey 用作 Tenet 的底座模型,Kimi K3 本身在第三方法律 Agent 测试中也表现突出。
在 Artificial Analysis 独立运行的 Harvey LAB-AA 基准中,Kimi K3 的 All-pass Rate 达到 26.7%,明显领先 Claude Fable 5 的 14.2% 和 Grok 4.5 的 13.3%。该指标统计的是任务中所有评分标准全部通过的比例,不计部分得分。
Harvey LAB-AA 基于 Harvey 提供的 120 个私有法律任务,覆盖 24 个法律业务领域,由 Artificial Analysis 使用自己的 Agent Harness 独立运行。
Harvey 面向大型律所和企业法律部门提供 AI 服务。拥有超过 2400 家机构客户和 20 多万名专业用户,业务覆盖 70 多个国家,超过 75 家 Am Law 100 律所已经使用 Harvey。
今年 3 月,Harvey 以 110 亿美元(739 亿元人民币)估值完成 2 亿美元融资,目前年化经常性收入约 3.5 亿美元,并正在寻求约 155 亿美元的新估值进行融资。
Harvey 首个公开的法律后训练开放权重模型选择 Kimi K3,也显示开放模型正在进入过去主要由闭源前沿模型占据的高价值专业应用领域。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。