模型即产品,今天已经发展成模型即 Agent 了。
模型公司做 Agent 独特的优势在于:它能把 agent harness 和模型推理放在同一个团队里协同设计。Harness 端的每一个决策,system prompt 怎么写、tool calling 怎么组织、错误怎么处理,都直接影响推理端的缓存命中率、调度效率和 token 消耗。
MiniMax 过去一年的 agent 实践,从一个内部飞书 bot 开始,演化成了桌面应用 MiniMax Code,最终形成了一个训练-服务的闭环:模型在自己的 harness 里训练,通过 harness 服务用户,用户行为变成训练信号反哺下一个模型。这个闭环是模型公司设计 Agent 的核心逻辑。
模型公司怎么看待 model-inference-harness-agent 之间的关系,MiniMax DevRel 负责人 Vincent 在 AGI Playground 2026 上的演讲,分享了他们在 Agent 层面的实践和心得。
编译整理自大会演讲,内容经编辑调整。
今天要分享的是,我们在模型实验室内部是怎么看待 agent 的。
模型就是我们的产品,这一点没变过。但问题是,模型公司为什么还需要 agent?怎么设计自己的 agent?我们做了一年,走过了几个阶段。
最早是去年五六月份,我们做了一个云端 agent(agent.minimax.com),跟 Manus 类似,有自己的 Linux 沙箱和虚拟机,能帮用户做网站。用的是传统 tool calling,但已经能操作沙箱、运行 shell 脚本了。那个更像 demo。
真正让 agent 在公司内部扎根的,是我们叫「Agent 实习生」的东西。它以 bot 的形式在我们的日常办公软件里透出。Agent 实习生从一开始就不只是给工程师用的,公司里所有人都在用它--工程、HR、市场、财务。
销售每天要面对不同国家的潜在客户,每条消息都得写得不一样。他就让 Agent 实习生去研究每个人的背景,看他们过去发了什么内容,然后生成个性化文案。设计师的用法很直接。她们用 Cursor 做 vibe coding,把设计还原的问题在代码分支里解决掉,提交给前端同学。产品和客服的场景更杂,Agent 实习生帮产品经理处理用户投诉邮件,查后台任务 trace,判断积分消耗是否合理,建议退还比例,然后发邮件执行。计算平台的同事频繁用它分析告警--大模型推理的告警指标变化很快。数据分析的同事说它替代掉了传统写 SQL 的部分,HR 用它搜学校和筛简历,效率直接翻 10 倍。还有人拿它来自动写代码——做完需求列表,agent 自己全自动地写实现。
我觉得最有意思的一个变化是心态上的。有个工程师说得很好:「我们可能做的就是让 agent,让我们的实习生去创造一个能干这件事情的实习生。」它不再是一个工程师了,相当于是一个 leader。虽然我们现在叫它实习生,但我们觉得某一天它就会像一个数字员工一样。
这些内部实践推动了下一步。我们发现云端 agent 不够用——很多工作流实际上在本地电脑上。所以我们把它做成了桌面应用,发布为 MiniMax Code,能控制用户的电脑,但不需要是工程师才能用。
同时我们也发现 M2 系列模型,特别是 M2.1 和 M2.5,跟第三方开源 harness 配合效果很好,主要是 OpenClaw 和 Hermes。我们跟这些社区合作很紧密,优化了模型在它们里面的表现。这背后的原因是,MiniMax 的模型是通用型的,不只是编程或数学好,也擅长操作电脑、做管理性任务,加上性价比高。
这就到了今天:我们的新模型 MiniMax M3,以及 MiniMax Code。

讲 agent 怎么帮训练和服务之前,先解释一个简单的问题:一个基础模型公司到底在做什么?归根到底就两件事——训练模型,然后把模型服务出去。
训练的输入是算力、数据、gyms(训练环境)和训练算法。服务的输入是算力加推理算法。不是说有了模型权重和几块 GPU 就能把模型服务出去,推理服务背后有大量困难的工程。
Agent 在这里面的位置分两种。直接的方式是让模型帮我们做研发,写更好的训练算法,写更好的推理算法。
先说直接的。我们在 M2.7 发布时分享过,post-training 团队的工作流大致分五步,其中运行实验和分析实验这两步,可以完全由 M2.7 自主完成。剩下的步骤虽然没有全自动化,也全部有 AI 辅助。
更重要的是,用来做这些研究的 harness 代码本身也是 M2.7 写的。不是人写的。M2 写了 agent 的代码,然后通过这个 agent 执行递归式的自我改进任务。
为什么这件事帮助这么大?在没有 agent 之前,研究员的时间是串行的。提出假设,手动跑实验,花大量时间调试,因为这些实验很难跑,拿到结果,再提下一个假设。大部分时间不是在想新想法,而是在调试。
有了研究 agent 之后,运行和调试这些繁琐但困难的工作被接管了。研究员可以把更多时间花在提出新猜想、跟其他研究员辩论正确方向上。这是一个结构性的变化,不是做得更快,是能同时跑更多想法。
直接做研发只是一半。更有意思的是间接的方式,通过 harness 把训练和服务连成一个闭环。
逻辑是这样的:真实用户通过 MiniMax Code 做真实任务,我们的 harness 收集这些混乱的、长周期的工作流轨迹和环境,然后通过大量数据工程把它们变成可重复、可打分的 gyms,用于强化学习和其他 post-training。
Gyms 是模型训练的下一个关键方向。我们现在已经进入了「经验时代」,模型光在固定数据集和固定数学题上表现好不够了,需要在真实世界的工作中有实际表现。
我们甚至有专门的团队在做这件事。我们雇了金融、法律、医疗等行业的兼职和全职专家,他们的主要工作不是标注数据,而是在自己的专业工作流中使用 MiniMax Code 和 M3 模型。这些使用数据变成真实世界的、高价值的训练信号,进入下一个模型的 RL 训练。
这就构成了一个飞轮:模型训练完成,通过 harness 服务给用户,收集真实使用数据,变成训练信号,训练下一个模型。每转一圈,模型更好,数据质量更高,下一个模型也更好。
M3 在写 kernel 优化代码方面很强。Kernel 优化是推理服务的核心——把模型权重和 GPU 结合起来的那段代码。我们的推理团队可以用 M3 来写更好的 kernel 代码,服务 M3 自身。这又是一个自我改进的循环。
M3 本身也是在 MiniMax Code 里训练的,所以它在这个 harness 里天然跑得更好。
但这里面有一个更少人讨论的问题:为什么模型公司要自研 agent harness,而不是只依赖第三方?
用三个层次的协同设计来解释。
Model-Chip co-design 大家已经熟悉了,芯片和模型一起设计,让模型架构更好地在芯片上运行。Model-Harness co-design 也容易理解,模型在 harness 里训练,自然在那个 harness 里表现更好。
但第三种,Inference-Harness co-design,讨论的人少得多。意思是:因为 harness 和推理服务都在我们手里,harness 可以反过来帮推理团队优化服务效率。
怎么帮?更可靠和干净的 system prompt,渐进式技能披露,正确的 tool 调用模式,良好的 tool error 处理。这些看起来都是 harness 端的设计决策,但它们直接影响推理端的需求模式。需求模式更可预测,缓存命中率更高,调度更高效,每个任务消耗的 token 更少。
这也是 Anthropic 不允许订阅用户在第三方 harness 里使用服务的部分原因。一部分是品牌,但另一部分是工程,自研 harness 让他们能更好地控制推理需求的结构。
对用户来说,这意味着更便宜更快的任务执行,更少的报错和速率限制。对我们来说,同等算力下能服务更多用户。这是双赢的,也是第三方 harness 做不到的,它们没有推理端的控制权,做不了 Inference-Harness co-design。
在我们的规模上,这些效率收益积少成多。跟单纯依赖第三方 harness 相比,我们能实现高得多的 token 吞吐量。
回到全景图。Agent 对我们的帮助分两层:直接层面,帮研究员写更好的训练算法,帮推理团队写更好的 kernel;间接层面,自研 harness 让推理服务更高效,同时把真实用户行为变成训练信号。
这个闭环正在收紧。值得想一想,这个系统跑上六个月、一年之后会是什么样子。核心依然是模型,从训练到服务,一切围绕模型。模型依然是产品。但 harness 已经是不可或缺的一环。
我的结论是:AGI 可能不是某个特定的模型 checkpoint,而是整个闭环的递归自我改进系统。可以想象,有一天从训练到服务到数据收集再到训练,整个循环在没有人类参与的情况下运转。模型通过自己的 harness 闭合循环,持续改进自身。
对其他模型公司来说,这一年的实践至少指向一个方向:Agent 不是模型的附属品,是连接训练和服务、连接实验室和真实世界的那根轴。设计好这根轴,飞轮才转得起来。
文章来自于微信公众号 “Founder Park”,作者 “Founder Park”
【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。
项目地址:GitHub:https://github.com/camel-ai/owl
【开源免费】OpenManus 目前支持在你的电脑上完成很多任务,包括网页浏览,文件操作,写代码等。OpenManus 使用了传统的 ReAct 的模式,这样的优势是基于当前的状态进行决策,上下文和记忆方便管理,无需单独处理。需要注意,Manus 有使用 Plan 进行规划。
项目地址:https://github.com/mannaandpoem/OpenManus
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0