

Harvey(OpenAI投资的法律AI独角兽,估值110亿美元)基于中国月之暗面开源模型Kimi K3推出自研法律智能体Tenet,通过两个月长程强化学习和律师定义的专业评价体系,显著提升复杂法律任务完成能力,验证了开放权重模型在高专业门槛场景的可行性与可训练性。
原文标题:《OpenAI投资的110亿美元估值法律AI独角兽,开始「套壳」中国开源模型》 原文作者:动察Beating
原文作者:动察 Beating
原文来源:https://mp.weixin.qq.com/s/aAORq78Qu1zhqAXX0pu1ug
转载:火星财经
8 月 20 日,OpenAI 投资的法律 AI 公司 Harvey 发布 Tenet。这家 2022 年成立的公司现在估值 110 亿美元,是全球估值最高的法律 AI 公司,服务上千家机构,股东名单里还有红杉、a16z 和 GIC。
Tenet 是它第一套自有模型,底座用的是月之暗面 7 月开放权重的 Kimi K3。Tenet 目前仍处在研究预览阶段,Harvey 计划把其中验证过的能力逐步放进产品。
Harvey 的创始人 Winston Weinberg 原本是 O'Melveny & Myers 的诉讼律师,Gabe Pereyra 做过 Google Brain 和 Meta 的大模型研究。OpenAI 很早就投了它,此后双方还一起训练过一套案例法模型,把约 100 亿 token 的美国案例法数据加入训练。OpenAI 当时发布的客户案例里,Pereyra 说 Harvey 评估过不同方案,最后只信任与 OpenAI 一起完成这次定制训练。
过去几年,它几乎一直是闭源模型在专业服务行业最典型的客户,也一直能调用全球最强的一批闭源模型。但当它第一次决定把自己的法律任务、律师的评分标准和两个月的算力真正写进一套权重,选中的底座却是一个来自中国的开放权重模型。
一个模型发布以后,行业很快就会知道两件事。它有多聪明,以及这些能力卖多少钱。几个小时之内,基准测试更新,Arena 排名变化,各种智能和价格的坐标图开始流传。一个训练了几个月、消耗大量算力的模型,最后被压缩成图上的一个点。
对多数开发者来说,这套方法依然有效。它背后的前提是,模型交到用户手里时,能力已经基本定型。闭源 API 占主流时,这个前提是成立的。模型公司完成预训练和后训练,再把能力封装成接口。下游企业可以改提示词、做检索、搭智能体,但很难继续改变模型本身。
开放权重把这个前提打破了。企业拿到权重以后,可以继续放入自己的数据和专家反馈,把真实任务和评价标准带进训练。同样是发布时拿到 90 分的两个模型,用同一批数据和算力继续训练,一个最后停在 91 分,另一个可以到 97 分。对准备投入几个月时间、算力和专家资源的公司来说,发布时相同的 90 分,已经是天壤之别了。
不过这件事有个前提。企业愿意押上几个月时间和一批算力去继续训练,首先得有一套值得训练的权重。过去几年开放模型和最前沿的闭源模型之间始终隔着一段距离,通用问答和日常写代码上差得不算多,一旦进入错误代价很高的专业场景,这段距离就会被放大。法律又是其中要求最高的那一类,过去能真正进入 Harvey 这类公司核心业务的,基本都是当时能力最强的一批闭源模型。开放权重当然更容易控制和改造,但如果连最基本的专业任务都完成不了,后面的训练空间也就无从谈起。

Kimi K3 让这道长期存在的门槛第一次被跨过。它的总参数达到 2.8 万亿,支持 100 万 token 上下文,在长程任务、工具使用和复杂推理上已经具备较好的基础能力。对 Harvey 来说,开放权重模型第一次不再只是一个成本更低、控制权更多的备选方案,开始进入了可以和前沿模型一起被认真评估的范围。
于是它们开始关心一个过去很少被单独拿出来讨论的问题,这套权重到底有多容易被继续训练。
Cursor 训练 Composer 2 时就没有按照常见的编程智能体榜单挑模型。它的判断是,智能体和长程任务能力会在强化学习过程中发生很大变化,训练开始前的排名未必能预测最后的结果。相比榜单分数,Cursor 更看重模型的编程知识、状态追踪能力、在内部代码库上的困惑度,以及它在自家基础设施里的运行效率。最后被选中的底座是 Kimi K2.5 模型。
Devin 背后的 Cognition 也有相同的判断。K3 开放权重之后,它很快把模型接进 Devin Desktop 和 CLI,在自家的 FrontierCode 1.1 Extended 上,K3 拿到 58.2% 的分数和 63.6% 的通过率。这套测试考察的是真实工程任务,代码最后能不能合进主干、质量够不够都要计入。Cognition 还提到,K3 在复现 bug 和管理自己的运行环境上表现尤其好,这两件事恰恰是长程编程任务里最容易掉链子的环节。它随后也在这套权重上做了后训练。
Harvey 增长很快。今年 3 月,它服务约 1300 家机构和超过 10 万名律师,五个月之后客户数量就翻了将近一倍,覆盖 70 个国家,AmLaw 100 中超过四分之三的律所都在使用 Harvey。
法律服务的项目金额高,对错误的容忍度很低。一份并购尽调报告,可能要从成百上千份文件里找到控制权变更条款,判断交易是否触发,再识别风险并附上原文依据。中间往往有几十个判断需要连续成立,只要漏掉一个真正影响交易的问题,前面做对的大部分工作都没有太大意义。
随着服务的律所越来越多,Harvey 手里也积累起一类基础模型公司很难自己获得的数据。它知道律师会怎样布置一项工作,也知道最后拿到结果的合伙人会从哪里挑错。

这些经验后来被做成了 Legal Agent Benchmark。里面已经有超过 1200 个长程法律任务,覆盖 24 个执业领域。每个任务的说明平均只有约 50 个词,模型随后会进入一个封闭的客户事项环境。相关文件和大量无关材料混在一起,它需要自己搜索、阅读、判断,最后交出一份能够被逐项检查的工作成果。
每项任务平均有约 50 条评分标准,复杂任务可以达到几百条。事实有没有找全,结论能不能成立,引用是否对应原文,风险等级和建议是否合理,都会被拆成可以单独判定的评分项。一项任务最长可以持续超过 1000 轮,消耗几十万 token。
年轻律师工作几年以后,会慢慢知道客户真正担心什么,也会记住哪些看起来不起眼的条款不能漏掉。这些经验过去很难被完整写进教材,大多留在合伙人的修改、团队内部的工作习惯,以及一份份已经交付的文件里。
Harvey 把其中一部分拆成任务、材料和评分标准,模型每一次完成工作的过程,也就有了可以被计算和比较的反馈。
提示词和检索能告诉模型去哪里找,评分标准则开始回答另一个问题,一项法律工作究竟做到什么程度才算完成。Harvey 过去几年真正积累下来的,除了客户和法律数据,还有一套能够直接用于模型训练的专业评价体系。
那些任务和评分标准开始真正进入训练,数据来自公开法律材料、合成数据和人类专家数据,执业律师参与任务构造、评分和合成数据复核。Harvey 一共准备了约 1750 个法律智能体任务环境。
模型进入带有材料和工具的工作空间以后,要自己阅读文件、调用工具并提交结果,系统再按照律师制定的标准检查整条工作轨迹,看具体要求完成了多少,法律问题解决到了什么程度。关键要求全部通过,还会获得额外奖励。
每个训练周期会产生超过一万条任务轨迹。Harvey 使用组序列策略优化,也就是 GSPO,让模型在同一个任务上产生多种做法,再根据结果之间的质量差异更新权重。两条轨迹得分过于接近时,系统还会重新评分,减少评价噪声对训练的影响。
整个过程持续约两个月,使用约 150 张 NVIDIA B300。预训练一套前沿模型通常要动用上万张卡,Harvey 这次投入的算力是另一个量级。Harvey 采用 rank-64 LoRA,覆盖 Kimi K3 的注意力层、前馈网络和路由专家权重,涉及约 50 万个专家张量。
长轨迹训练还面临着一个工程问题。一项法律任务可能持续几百轮,模型还在生成任务轨迹时,训练端的权重已经发生了更新。等训练器回头计算这条轨迹时,如果两边的模型状态对不上,当时每一步动作对应的概率也会发生变化,奖励就很难准确作用到原来的决策上。

Kimi K3 的混合专家结构让这个问题更复杂。每个 token 进入模型后,路由器会从 896 个专家中选择 16 个参与计算。训练端和执行端只要在数值精度、批处理方式上存在细小差异,同一个 token 就可能被分给不同的专家,原来的轨迹也就难以完整复现。
Harvey 和它的供应商因此把训练器和执行环境在内核层做了数值对齐。权重每完成一次更新,就直接热加载进执行环境,不需要反复停下任务生成。系统还会记录 token 对应的专家路由结果,让训练器重新计算时尽可能回到模型生成这条轨迹时走过的路径。
做到这里,Tenet 已经不太像一次把法律语料加入模型的常规微调。Harvey 搭起来的是一套可以反复运行的训练流程。法律任务不断进入环境,模型完成工作,律师制定的标准评价整条轨迹,权重随后更新,新模型再回到环境里做下一轮任务。
Kimi K3 能不能被稳定地继续训练,也是在这样的循环里被实际检验出来的。
Harvey 真正想提高的是模型完成长程法律工作的能力。它采用了很严格的 all-pass 口径,一项任务里的关键评分标准必须全部通过。按照 Harvey 公布的内部结果,在没有参与训练的 LAB 保留集上,Tenet 完整完成的任务数量接近原始 Kimi K3 的两倍,all-pass 率从约 11% 提高到 19.7%,增加约 9 个百分点。
在专门测试合同起草、审查和谈判的 LAB Contracts 中,完成任务数量增加约 20%,all-pass 率达到 11.3%,提高约 2 个百分点。按照 Harvey 自己的榜单,Tenet 在 LAB Contracts 排名第一,在完整 LAB 中排名第二。
它随后又把 Tenet 放进两套外部测试,Mercor 的 APEX Agents Corporate Law 和 Crosby 的 Redline Bench。前者测试模拟工作环境中的长程专业任务,后者要求模型连续修改合同,再按照律师制定的标准评分。

Tenet 没有接触过这两套测试的训练数据,成绩仍然明显高于原始 Kimi K3,说明在 Harvey 任务环境里练出来的能力,可以迁移到新的法律任务里。
不过,另一个问题是,专业后训练往往会让模型越来越擅长某一类工作,同时丢掉一部分原来的知识和推理能力。
在 LegalBench、CUAD 和 MAUD 上,Tenet 没有出现明显退步。Scale Professional Reasoning Benchmark 的困难子集中,得分还从 36.0% 小幅升到 36.8%。至少从这组结果看,Kimi K3 在法律任务上变得更强以后,没有出现明显的能力遗忘问题。
Harvey 的奖励设计会在结果质量接近时偏向更短的轨迹,因为法律智能体每多读一份文件、多调用一次工具,都会增加 token 消耗和等待时间。训练之后,Tenet 减少了一部分无效步骤,任务质量提高的同时,完成工作的成本基本保持稳定。
这次后训练改变得更多的,是 Kimi K3 处理复杂法律工作的方式。它更会安排步骤、调用工具,也更少漏掉任务里的关键要求。
Harvey 早在 2025 年就开始采用多模型策略,今年仍在持续接入 OpenAI 和 Anthropic 的新模型。Tenet 终于让这套体系里第一次多出了一套由 Harvey 自己训练、自己控制的开放权重模型。
它需要的是一套底座本身就已经过关的模型。Harvey 的法律任务可能要处理大量文件,连续执行几百甚至上千轮操作,模型还要在漫长的工作过程中维持状态。后训练可以继续塑造它处理法律工作的方式,却很难从头补上一套底座原本并不具备的能力。
另一个条件是控制权。Harvey 可以通过 API 调用 GPT 和 Claude,却没办法把 1750 个法律任务环境和律师的评价标准继续写进这些闭源模型。开放权重让它可以自己决定怎样训练、怎样设计奖励,也可以把训练出来的专业能力留在自己掌握的权重里。
不过拿到权重之后,还要考察这套模型适不适合继续训练。长轨迹强化学习能不能稳定跑下去,混合专家的路由能不能准确复现,专业能力提高以后会不会丢掉原来的知识,推理成本还能不能控制在生产可用的范围内,都要真正试过一次才知道。
Tenet 跑完两个月以后,Kimi K3 给出了这一轮答案。训练过程能够稳定运行,法律任务能力出现明显增长,没有看到显著的能力遗忘,成本也没有随着效果一起失控。
对 Harvey 来说,这些结果比「开放权重」本身更重要。权重可以下载,只说明企业有资格继续训练。训练之后还能留下多少能力,才决定这套模型值不值得继续投入算力、数据和专家时间。
Harvey 说,它的目标是让律所能够在开放权重上训练自己的专有模型,并且拥有训练以后形成的能力。Tenet 交出来的与其说是一套模型,不如说是一套做法。
过去,基础模型公司的生意大多发生在模型发布以后的调用里。开放权重带来了另一种关系,一家公司可以拿现成的基础模型继续训练,把自己的行业知识留进权重,最后得到一套更接近自身业务的模型。
这类需求以前很难形成一个真正的市场。通用模型能力不够强时,垂直公司即使拿到权重,也很难只靠后训练补齐长程推理、工具调用和复杂任务处理。自己从头预训练又太贵,多数公司根本没有必要做。

Cursor 在编程里训练出了 Composer 2,Cognition 也在同一套权重上继续训练了 Devin 用的模型,Harvey 又在法律里做出了 Tenet。编程和法律相距很远,却都选择从 Kimi 已经训练好的通用能力出发,再把自己最熟悉的专业工作继续放进去。
Tenet 也让这件事的门槛变得具体。两个月,约 150 张卡,加上一套由执业律师定义的评价标准,一家公司就可以把一套通用权重推到自己行业的前沿。算力门槛已经下降了一个数量级,更难复制的部分开始落到另一端,有没有人能够说清楚,一项专业工作做到什么程度才算完成。
软件开发和法律只是已经出现的两个案例。金融、咨询、医药、会计,以及大量专业服务行业,都有自己的数据、工作流和专家判断。这些行业本身就是规模以万亿美元计算的知识工作市场。里面最头部的公司未必会自己预训练基础模型,却越来越有条件在一套成熟权重上继续训练属于自己的模型。
如果这条路径继续成立,Kimi 面对的市场就不再只是有多少人调用它。接下来更值得关注的是,Harvey、Cursor 和 Devin 之后,还会有多少公司选择在 Kimi 上训练自己的模型。