
Z Highlights
Gabe Pereyra是法律AI公司Harvey联合创始人兼总裁,曾在Google Brain、DeepMind和Meta从事AI研究。Harvey由他与大学室友Winston Weinberg共同创立,为律师事务所和企业法务团队提供AI产品。2026年9月9日,Harvey宣布完成5.5亿美元融资,估值达到155亿美元。同一份公告里还披露出全美百大律所榜单中有超过80%的律所已经使用 Harvey。
Sonya Huang是Sequoia Capital合伙人。本次演讲来自Sequoia Capital举办的“Own Your Intelligence”活动。Gabe Pereyra介绍Harvey如何在无法与基础模型公司比拼预算的情况下,依靠评测数据、领域专家、开源模型和外部研究生态建立自己的研究实验室,并在问答环节讨论敏感数据、研究人才和持续学习等问题。
01 应用公司不必复刻基础模型实验室,但要先用真实任务建立评测和训练数据
Sonya Huang:接下来有请Harvey联合创始人兼总裁Gabe Pereyra。Gabe早年曾在DeepMind和Meta从事研究,后来向大学室友展示了GPT-3的能力,两人由此创办Harvey。今天在场的许多公司都在考虑怎样开展自己的研究、对模型进行后训练,并建立内部实验室。Harvey已经提供了一个很有代表性的案例。
Gabe Pereyra:这场演讲也可以叫作“怎样用有限预算建立研究实验室”。如果一家应用公司试图与基础模型公司正面竞争,这本来就是一场不公平的比赛。它们拥有更多资金、人才和算力,而应用公司处在资源最少的一端。
但竞争方式不一定是把对方拥有的一切重新建设一遍,而是利用已经形成的前沿技术生态。四年前Harvey刚成立时,今天的许多训练平台和研究公司还不存在。我们要么自己从头建设,要么暂时把资源投入市场拓展和产品。现在,应用公司已经可以借助外部生态开展前沿研究。
我们的做法可以概括为三部分:建设评测标准和训练数据,与不同研究团队合作完成后训练,以及建立能够把不同模型稳定部署到生产环境的基础设施。
Gabe Pereyra:第一步是建立可靠的评测标准。没有评测标准,就无法判断模型训练是否有效;无法训练,也就没有必要讨论怎样部署。今年,我们公开了三套数据集。
第一套是LegalAgentBench,它按照大型律师事务所初级律师的实际工作建立任务分类,覆盖多个业务领域,包括起草复杂的基金设立文件、检索判例等。
随后,我们建立了一套合同数据集,用来训练AI Agent像企业法务部门一样参与合同谈判。最近发布的尽职调查数据集,则是我最看重的一套数据。这是目前公开的规模最大的强化学习环境之一,其中最大的虚拟资料室包含约8000万个token,可以用于研究长上下文和复杂任务。
真正困难的是数据从哪里来。Harvey服务大型律师事务所和企业,它们的法律材料高度敏感并受到保密特权保护,不能放进通用模型,甚至不能直接用于训练Harvey自己的模型。
现如今明显奏效的方法,是让该领域专家指导合成数据生成。当前,越来越少的软件工程师逐行编写全部代码,更多时候是用自然语言指导编程模型生成和修改代码;法律专家也可以采取类似方式。
我的弟弟本身是律师,也是Harvey早期员工。他已经很熟悉怎样与编程模型合作,并把这套方法教给其他律师。由法律专家确定真实任务、材料之间的关系和需要发现的问题,再让模型生成初始数据,最终得到的资料才会更接近真实工作。
合成数据只能作为起点,仍然需要Mercor、Snorkel等公司协助扩大规模,并由专业人员把合同等材料校正得更真实。随后还要把数据集转化为高效的强化学习环境。例如,尽职调查数据集使用1000多个单元测试,并让大模型参与判断输出;如果直接调用最昂贵的模型进行大量训练,成本会迅速失控,因此评测效率本身也是研究问题。
我们还选择开放部分数据集。这最初存在争议,但一个数据集只有被许多研究者使用,问题才会充分暴露。ImageNet、CIFAR和MNIST之所以重要,正是因为研究社区持续使用、纠错和改进。公开数据也让基础模型公司在发布新模型时主动使用Harvey的评测标准。
Gabe Pereyra:评测标准建立以后,才有条件训练模型。现在值得关注的变化,是开源模型的竞争力显著提高。过去,预训练模型进步太快,应用公司刚完成一次后训练,下一代基础模型可能已经吸收了相同能力,因此这项投入很快失去价值。
现在,强大的开源基础模型经过后训练,已经可能在特定任务上达到前沿水平。它们未必拥有最强的通用能力,但在法律等明确领域中可以形成竞争力。
刚开始时,我们建议应用公司与专业研究团队合作。它们已经拥有训练经验、基础设施和成熟的方法,能够帮助企业检查数据集。如果合作后仍然无法得到更好的结果,问题往往出在数据本身。这是启动内部研究最有效的方式之一。
Harvey同时与Fireworks、Baseten、Trajectory、Applied Compute等团队开展不同项目。有人会问,为什么不只选择一家?原因是我们的研究项目已经超过内部团队或任何单一合作方的承载能力,而且不同团队对研究方法、开源模型和训练路线有不同判断。与多家团队合作,能够让我们更快学习,也能分散对单一路线的依赖。
随着Tinker一类API以及Fireworks、Baseten等公司提供的基础设施逐渐成熟,后训练和部署模型已经比过去容易得多,相关人才也在增加。受Cursor的启发,Harvey希望打造自己的“Composer”:把合成数据、Mercor提供的数据扩充能力、与外部研究团队的合作,以及内部后训练能力整合到一个模型中,再让它与闭源模型一起服务客户。
02 模型进入生产环境,依靠分层评测、模型路由和持续反馈
Gabe Pereyra:训练模型之后,真正困难的是把它稳定地投入生产。应用公司并不是只调用一个模型接口、提供一个聊天页面。Harvey在60个国家运营,有多个产品模块,不同客户对模型也有不同要求。即使只使用闭源模型,也要处理供应商切换、地区限制、服务等级和故障备用等问题。
所以每当一个新模型出现,无论它是开源、闭源还是由我们后训练得到,都要经过通用评测。LegalAgentBench可以快速判断它是否达到前沿水平、在哪些法律任务上表现较好;人工测试则把它与其他模型并排比较。
每一个产品模块还需要自己的关键用户流程和自动化测试。一个模型的通用能力可能很强,却未必适合某个具体产品。最终是否上线,要同时考虑自动评测、人工测试、成本、延迟和地区可用性。
上线之后仍然要继续评估。大型改动需要A/B测试,我们也会观察用户参与度、服务可用性、token效率和客户反馈。我把最后一项称为“愤怒客户发来的邮件”。这些信号共同判断模型是否按照预期工作。这套基础设施对后训练模型和普通模型同样适用,因此企业应当先把它建好,再考虑自己训练模型。
具备这套评测和部署基础设施后,企业也不必立刻用开源模型替换产品的核心能力。在真正部署自己后训练的模型之前,可以先从最简单的开源模型替换做起。
最直接的做法,是检查产品中所有调用模型的环节,找出哪些地方并不需要能力最强的模型。例如,Harvey产品中有些生成法律引证的功能,不必使用规模最大的模型,可以直接换用GLM-5.2等开源模型,从而降低成本或改善性能。通过这些相对简单的替换,团队可以逐步建立同时部署开源模型和闭源模型的能力。
再进一步,可以采用模型路由。有些功能无法完全换成开源模型,但可以根据查询类型,把其中一部分请求交给开源模型处理。完成这些简单替换和模型路由,并开始在生产环境中运行模型、收集反馈以后,企业才具备形成后训练闭环的条件。
这里所说的收集反馈需要非常谨慎。对Harvey而言,它并不意味着直接使用客户数据训练模型,而是利用用户测试等合规渠道获得的反馈信号,指导团队构建下一批数据集,并继续改进模型。
Gabe Pereyra:这就是Harvey用有限预算建立研究实验室的方法。未来,每家公司都需要成为一家AI公司,并找到适合自己的实现路径。尽管如此,许多人仍然不看好这条路线,也不看好应用层公司和前沿技术生态。
这让我想到电影《点球成金》中的一幕。球队刚刚取得20连胜,但Billy Beane说,如果最终没有赢得冠军,就不会有人真正理解他们做成了什么。
电影中的原话是:“如果我们用这样的预算和团队赢下来,就会改变整个行业的游戏规则。”今天,借助已经形成的前沿技术生态,在座各位也拥有同样的机会。去改变游戏规则。谢谢大家。
03 Harvey的最终目标,是让每家律所拥有能够持续学习的系统
现场观众:法律客户的数据非常敏感。你提到由内部律师参与生成数据,具体怎样操作?
Gabe Pereyra:大型律师事务所处理并购时,会收到包含目标公司合同、邮件和会议材料的资料室。这些输入数据都不公开。公开渠道也许能找到最终签署的收购协议,却找不到形成结果所需的完整材料。
让一群律师凭空制作一个包含上万份合同的虚构资料室也很困难,因为所有文件必须相互对应。我们的做法是从评分标准反向生成数据:先在场景中设计需要发现的问题,例如合同之间无法对应、某份材料缺失,再据此生成整个资料室。随后由外部专业人员把合同修正得更像真实文件。
这样,模型可以基于资料室生成尽职调查报告,而我们事先知道埋入了哪些问题,因此能够准确检查模型是否发现了它们。过去,我们向律所提出用客户材料训练模型,对方会要求先证明效果;我们又需要先看到数据才能证明,双方陷入循环。合成场景让我们可以先展示能力,再与愿意参与的律所开展更深入合作。
现场观众:你们怎样与基础模型公司争夺研究人才?是继续竞争顶尖研究员,还是更多招聘懂法律和业务的人?
Gabe Pereyra:创业早期,我曾试图邀请以前在研究实验室认识的人加入,这是我犯过的一个错误。他们拿到的薪酬方案可能超过一亿美元,而当时Harvey的规模不适合参与这种竞争。
情况正在改变。一些博士毕业生并不想进入大型实验室,而且企业现在可以调用现成的训练和部署基础设施。过去,少数研究员之所以不可替代,是因为他们不仅负责后训练,还要从头建设训练和推理系统。今天,Fireworks和Tinker一类工具降低了这部分门槛,能够胜任相关工作的候选人范围扩大了。
现场观众:法律专家怎样设计足以区分前沿模型能力的评分标准?
Gabe Pereyra:我们的首要目标不是刻意难倒模型,而是真实还原客户正在处理的工作。法律领域的优势在于,只要把顶级律所面对的客户事项做得足够真实,当前模型仍然很难完整解决。
领域专家也需要长期积累对模型的直觉。Harvey的法律团队已经与模型合作多年,知道怎样建立材料和评分标准。先制作真实资料室和尽职调查要求,再运行模型寻找能力缺口,比为了拉开榜单分数而设计人为难题更有意义。
现场观众:从数据生成、强化学习环境、训练算法到基础设施,任何一环都可能出问题。你们怎样定位故障?
Gabe Pereyra:没有一个固定答案。Harvey已经找到产品市场匹配,并先用闭源模型把产品投入真实环境,因此我们知道完整流程本身能够工作,也积累了监测生产表现的能力。
后训练只是整个系统的一项输入。模型先通过基准测试,再进入产品测试和真实使用。如果连基准测试都无法通过,就不必继续;如果基准测试很好、实际使用却让人感觉异常,可能是模型过度适应了测试数据,在测试分布以外迅速失效。完整的阶段检查可以帮助团队判断问题出在数据、训练、产品还是部署环节。
现场观众:开放评测标准会让其他实验室针对它提高分数;不开放又会让外界怀疑评测是否真实。你们怎样权衡?
Gabe Pereyra:即使不公开数据,我们也一直与基础模型公司分享部分材料,帮助它们改善模型,而模型改善最终也会让Harvey受益。公开评测还能帮助客户理解不同模型分别适合什么工作。
我创办Harvey时曾以为,只要做出最好的模型,客户自然会满意。后来才发现,不同客户有不同偏好,每种模型也有不同强项。开放数据集还能让外部公司自行验证新技术;如果结果有效,我们再决定是否投入合作。Harvey真正具有长期价值的数据,是帮助律所根据私有数据训练自身系统的那一部分,而不是所有合成评测材料都必须保密。
现场观众:你提到了寻找外部研究团队。对于Harvey来说,目前还有哪些尚未解决、希望外部团队帮助研究的问题?
Gabe Pereyra:目前仍有三个重要问题没有解决。
第一,合成数据即使非常逼真,分布也不完全等于真实产品中的使用情况。模型可能擅长分析尽职调查资料室,却不擅长用户随后要求它起草的一封普通邮件。由于我们不能查看客户数据,这个分布差距很难弥合。
第二,模型仍不擅长管理极长上下文。面对8000万个token的资料室,它需要在复杂环境中持续检索、判断和执行任务,现有能力仍有明显缺口。
第三,也是最终目标,是持续学习。Harvey不是要做出一个对所有律所都相同的“最佳法律模型”,而是希望每家律所和企业都能根据自己的工作方式进行定制。理想状态是,每完成一个客户项目,AI系统都会有所改善,同时客户材料仍然得到严格保护。这既是技术问题,也是运营问题,也是一个尚未解决的AI系统设计问题。
现场观众:你谈到了Harvey在模型、基础设施和开源能力方面为参与竞争所做的准备。从产品角度看,面对Claude Cowork这类通用产品,Harvey将如何竞争?
Gabe Pereyra:我们正在思考的一个重要转变是,Harvey最初的产品以及Claude Cowork一类工具,主要关注个人效率;而我们现在建设的产品,越来越关注整个组织的运行效率。
面对Claude Cowork等横向产品,Harvey的差异也不会只是帮助单个律师写得更快。大型律所同时服务上万名客户,每个项目可能持续半年,由二三十人和多家外部机构共同完成。
大型律所真正要解决的,不只是怎样让单个律师提高效率。它们可能同时服务一万名客户,需要确保所有客户项目顺利推进,并以可持续的方式获得收益。
从单个项目看,困难通常不在于怎样起草某一个章节。一项工作可能持续半年,需要协调律所内部二三十人的团队以及多家外部机构。因此,产品会越来越像一个项目管理系统,负责协调人、AI Agent和整个工作流程。
从组织层面看,律所可能同时开展上千个项目,还要处理人员和资源配置、计费以及客户拓展。大型企业面对的情况更加复杂:一家《财富》500强企业可能同时与上千家律所合作,内部还有上千名相关人员。Harvey的答案,是深入法律行业,把产品从个人效率工具发展成组织运行系统。这种行业深度,通常不是横向通用产品会进入的领域。
原视频:How Harvey Built a Research Lab on a Budget | Gabe Pereyra
https://www.youtube.com/watch?v=MGouk8W51v0
文章来自于微信公众号 “Z Potentials”,作者 “Z Potentials”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md