
Z Highlights
Sonya Huang是Sequoia Capital合伙人,长期关注AI基础模型、应用层与开发者工具。随着开放权重模型逼近前沿水平、后训练基础设施逐渐成熟,越来越多AI应用公司开始重新评估哪些智能能力应当自建、哪些能力适合继续向前沿实验室购买。
01 开放模型追上来之后,企业AI开始争夺控制权
要求企业“拥有自己的智能”的声音越来越响。Alex Karp最近鼓励企业“掌握生产资料”;不久后,Satya Nadella表示,从前沿实验室购买智能相当于付费两次:第一次支付金钱,第二次交出让智能真正有用的专有知识。所有人都在问同一个问题:企业核心的智能究竟应该由谁拥有?
这里需要说明,企业并非一定要拥有自己的智能,也不等于建议企业离开前沿实验室。对于许多工作负载,使用前沿模型的API和Agent依然是合适的选择。Sequoia在投资组合中观察到,越来越多公司开始为产品中的部分功能构建自有AI能力,通过纵向整合逐步拥有并塑造模型权重。
几周前,Sequoia召集一批AI公司的创始人和开发者,围绕“拥有自己的AI栈”举办活动。Harvey从客户需求出发分享实践,Mercor、LangChain、Trajectory和Fireworks则介绍后训练技术栈的各个组成部分。这些分享共同勾勒出一套清晰的方法。
第一,开放权重模型追赶前沿水平的速度超出预期。Kimi K3和GLM 5.2表现非常出色。过去,在开放模型上训练像在跑步机上奔跑:团队花数月微调,下一款前沿模型一发布,这些努力带来的优势就可能消失。如今,企业可以从非常接近前沿水平的基线开始。
第二,独立后训练栈已经成熟。Mercor和Fireworks等公司让每家企业都能使用前沿研究实验室级别的技术栈,从训练、推理到真人或合成数据一应俱全。借助扎实的evals、Harness工程、后训练和在线学习,开放模型如今可以在特定领域超过前沿模型。
一年前,选择开放权重意味着愿意牺牲性能;今天,是否采用开放权重模型,正成为关乎企业生存的战略问题。最新战场是智能层,产品与权重都只是这场竞争的一部分。

图片来源:Sequoia Capital
02 当AI成为核心成本,企业开始重新算账
不存在适用于所有公司的统一答案。除性能外,产品的一些环节可能因以下因素而受制于“租用智能”的方式。

图片来源:Sequoia Capital
03 从0到1路线图:评测、Harness、后训练与在线学习
当企业确定哪些智能能力要自建、哪些继续采购,接下来的问题是:如何从零走到一?
组建团队。不要把这项工作硬塞给平台团队。拥有智能需要一支主动探索的团队:构建evals、打磨数据、试验开放模型、调优Harness,并持续提升模型在特定领域的表现。小型新团队与少数生态伙伴合作,就能取得很大进展。Harvey仅用七人团队就完成了数量惊人的研究。
让外界看见并理解你的工作。如今,每位买家都在挑选自己看好的AI公司;当候选公司的实力相近时,公开的研究成果、基准测试或技术文章越来越能左右最终选择。如果企业在内部完成了优秀研究,应与生态分享。
执行技术步骤。下面是一套总体框架。

图片来源:Sequoia Capital
1.Evals
Harvey的Gabe Pereyra概括得很好:“没有好的基准,就无法训练模型。”eval是一组用来衡量系统能否把工作做好的任务。每项任务包含Prompt、模型可使用的上下文,以及评分机制。许多eval最初都始于创始人查看模型输出、凭经验判断结果是否正确;目标是把这种判断转化为可重复的流程。
Harvey把真实法律工作拆解成离散任务,建立Legal Agent Benchmark。第一版涵盖24个法律实践领域的1200多项Agent任务,并使用专家编写的75000多条评分准则进行评估。
在决定拥有自己的智能之前,企业必须先有eval。当每次前向传播都有评测结果可供参考时,选择模型就有了量化依据,无需再凭猜测做决定。
2.Harness与上下文工程
一个Agent由三部分组成:模型、上下文和Harness。Harness管理模型周围的产品逻辑,包括路由、检索、工具、记忆、回退和Trace。Harrison Chase的简洁定义是:“Harness的主要职责,是在正确的时间把上下文交给模型。”任务越偏离模型训练分布,开箱即用的Harness表现就越差。
优秀的Harness可以把任务路由到最合适的模型,在不同模型间复用同一组evals,并决定Agent可获得哪些上下文和工具。它也让Agent的运行过程可供检查:团队能够追踪输入了什么上下文、调用了哪些工具,以及流程卡在何处。
3.后训练
后训练涵盖多种技术,具体采用哪种技术,取决于团队希望改善什么。Lin Qiao给出了一套清晰的判断方法:模型缺少事实时无需后训练,使用上下文或RAG即可;输出格式或行为不正确时,使用监督微调;需要调整产品的风格与偏好时,使用偏好调优;模型需要提升专项任务能力时,使用RL;模型太慢或太贵时,对它进行蒸馏。
目标是选择能够改善 eval 结果、投入最少的方法,再通过同一套 Harness 提供模型服务,并在运行中测量质量、延迟和成本。
4.在线学习
系统拥有evals、Harness和模型之后,最后一步是在生产环境中持续改进。Arjun Karanam提出一个重要观察:模型不断变聪明,每次开启新Session,却仍像第一天上班。把Terence Tao放进会计师事务所,他至少在第一天很可能还不是最好的会计师。系统缺少的是经验,而非智能;Agent会在运行过程中创造这种经验。
Trajectory是Agent执行任务所经过的路径,包括模型看到的上下文、调用的工具和sub-agents、生成的答案,以及用户编辑、撤销或重试的内容。要建立在生产环境中持续改进的循环,就必须使用LangChain的LangSmith等工具捕获这些Trajectory。失败的任务可以转化为eval,缺失的信息可以补入上下文或记忆,工具响应中的错误则可以用来指导Harness修复。
04 更低的下限,更高的上限
买家需要警惕:拥有自己的智能会打开潘多拉魔盒。闭源模型栈很简单:调用前沿模型,使用Claude Code或Codex等开箱即用Harness,加入Prompt和上下文,然后发布。它提供较高的能力下限,但上限也相对较低。
拥有技术栈意味着自行承担更多系统工作。生产栈由开源模型、定制Harness、工具和上下文组成;开发栈由专有evals、领域数据和在线学习循环组成。工作量确实更大,能力下限可能更低,但上限也会更高。

图片来源:Sequoia Capital
前沿实验室会继续构建巨型“大脑”,所有人都应该使用它们。与此同时,最优秀的产品公司也在培养自己的“小天才”:速度快、有自己的判断、专注于特定领域,并根据实际工作持续调优。当更多公司拥有自己的智能,生态会更加繁荣,各自的特色也将得到充分发挥。
这就是企业拥有自有智能后,有望实现的未来。我们很高兴看到“小公司”不断进步,这些创业公司正努力让这样的世界成为现实。
原文:Own Your Intelligence: A How-To Guide
https://sequoiacap.com/article/own-your-intelligence-a-how-to-guide
文章来自于微信公众号 “Z Potentials”,作者 “Z Potentials”
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0