能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent
9936点击    2026-08-04 10:34

过去,LlamaFactory 让每个人都能微调大模型;现在,PenguinHarness 希望让每个人都能构建自进化 Agent。


PenguinHarness 是全球首个支持多 Agent 自进化的 Harness:


  • 0.2 元从零构建新的 Agent。耗时仅为 Codex 的一半,成本低至 Codex 的 1/200,结果更贴近可交付。
  • 不到一元钱,让 Agent 自己变强。无需手动微调,Agent 准确率从 50% 提高到 90%。
  • 1000 多种模型,成本更低,运行更快。支持多模态、轨迹观测、成本对比、多用户并发。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


  • 开源地址:https://github.com/Prism-Shadow/penguin-harness
  • 主页链接:https://penguin.ooo


让 Agent 自动构建 Agent


LlamaFactory 的作者郑耀威最近开源了一个新项目,名字叫做 PenguinHarness。这个「企鹅驾驭师」能帮你自动完成 Agent 的构建、评测和持续改进,真正从「手动调优 Agent」迈入「Agent 自我迭代」。


PenguinHarness 是一个原生支持自我进化的 Agent Harness,主打轻量、开源、易用。基于原创的 Agent 内核,无论是 GPT-5.6 还是 DeepSeek V4,这套框架都能稳稳驾驭。


项目的初衷与 2026 年讨论得热火朝天的 AI4AI,递归自我进化(RSI)等方向不谋而合。


Meta 前研究总监田渊栋创立的 Recursive 着力探索 AI 递归自我改进的潜力,其首篇博客已经证明出 Agent 可以训练模型、优化 GPU 算子。


MSRA 前副院长边江创立的 XYZ AI Lab,也成功探索出一条通过运作数百个 Agent 完成 Deep Research 模型后训练的路径。


而 PenguinHarness 则是立志做最好用的开源 Harness,让 Agent 自进化开箱即用,不再需要手动调优 Agent。


它的第一项能力 —— 让 Agent 自动构建另一个 Agent。我们用一个最经典的案例对比 PenguinHarness 和 OpenAI Codex 的实际表现:「让 AI 生成一个 RAG 应用,实现分块检索,流式返回通俗易懂的答案,并带上引用」。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


通过视频,我们可以清晰看出,PenguinHarness 不仅花费比 Codex 更少的时间和低于数十倍的成本,还产出了几乎能直接落地的 RAG Agent 应用。


左边回答语言通顺,有流式输出,还有来源引用。而 Codex 的结果中英混杂,缺少流式输出。


过去,开发这样一套 Agent 应用需要框架选型、模型部署、接入工具、编写提示词、反复测试修改,每个应用都几乎从零开始,花费一个团队几个星期的精力。


即使有了 Claude Code 这类开发工具,它们对现有的 Agent 框架也比较陌生,很难做到像开发前端网页那么容易。而 PenguinHarness 从诞生之日起,就为自己设计好了一切选项。


而对于 PenguinHarness,你只需要说清楚需求,它立即就能开干:生成脚手架、Prompt,安装和优化 Skill,并搭建前端,直到把一个完整能跑的 Agent 应用交付给你。而这套流程,只需要花费 0.2 元的 Token 和一杯咖啡的时间。


郑耀威也为我们揭开了 PenguinHarness 的背后原理:它将文件系统作为唯一真相来源,Agent 是文件,提示词是文件,对话历史也是文件。文件是人与 Agent 最自然的协作方式。


框架只负责把文件拼装成可运行的 Agent 对象,而构造一个新的 Agent 无外乎文件的复制粘贴。


在运行时,PenguinMessage 作为唯一的消息协议,就像网络数据报文一样,在模型、环境和用户之间交换,这种统一且轻量的接口让 PenguinHarness 可以轻松接入到任意代码中。


PenguinHarness 既是一个 Agent 框架,又是一个 Agent 实体,没有人比它更懂自己。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


本地可复现的 Agent 自进化闭环


让 Agent 构建 Agent 只是 PenguinHarness 的第一步,PenguinHarness 更长远的目标,是希望每个人都能在本地拥有自进化 Agent。


构建 Agent 是从 0 到 1,优化 Agent 是从 1 到 100,其中需要跨越许多挑战。


「Chaning agents is easy; improving them is hard.」


在一次关于自进化的讨论中,郑耀威曾提出这样的观点:Agent 本质上就是一堆代码和文件,修改它很容易,让他变好却很难。大模型本就已经是自带随机性的概率函数,Agent 则更是一个充满了不确定性的自主系统。要想做好 Agent 自进化,那么必须要有一个可靠的「尺子」,也就是评估系统。


ReAct 论文作者姚顺雨曾言,评估是大模型的下半场。对于 Agent 自进化,这句话同样成立,一套好的评估基准是自进化的根本。


为了探索准确的评估方式,郑耀威带领团队花费了半年多时间。最大的障碍是,现有的评估大多只有测试集,而没有训练集。如果在测试集上跑自进化,很难区分 Agent 到底是背会了答案,还是真正产生了进化。


为此,团队甚至亲手做了一套新的评估基准 ——GDPevo,专门用于测试 Agent 自进化能力,覆盖医疗、金融、法律等六大真实场景。通过划分训练 / 测试集,确保 Agent 进化时不会「偷看答案」。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


PenguinHarness 吸纳了 GDPevo 的核心思想,把 Agent 的评估和优化凝练为了开箱即用的 Skills。在调用 Skill 以后,PenguinHarness 就会启动多个智能体,配合完成 Agent 的调优流程,也就是「自进化」。


试想这样一个场景:做一个 Agent 帮你更准确的预测球赛、提出投资策略、处理电商售后,但是这个 Agent 一开始准确率并不高。过去,你需要通过手动调整提示词,搭建工作流来提高精度,而现在,PenguinHarness 可以自动帮你完成 Agent 调优。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


通过视频可以看出,PenguinHarness 完成了多次迭代,Agent 的分数从优化前的 53 分,提升到了优化后的 95 分。使用 DeepSeek V4 Flash 正式版,整个过程只花了 0.5 元的 Token。


这背后是一套多智能体的协作流程。PenguinHarness 首先生成一个负责出题的 Benchmark Builder,围绕目标能力生成一系列题目和答案对,通过反复测试来校准题目难度。


进入优化阶段后,三个承担不同角色职责的 Agents 会组成一个自进化闭环,反复进行下面四步过程:


1. 组织评测:Optimizer Agent 按照题目数量和运行次数,组织多个 Evaluator Agents 并行评测;


2. 独立打分:每个 Evaluator Agent 启动一个独立的被测 Agent 解答题目,并且根据只有 Evaluator 才能看到的 Rubrics 打分,将分数返回给 Optimizer Agent;


3. 分析优化:Optimizer Agent 汇总评测结果,通过查看和分析轨迹,定位失分原因,修改被测 Agent 的提示词、Skill 或者配置,生成候选的下一版被测 Agent;


4. 验证迭代:Evaluator Agent 对候选版本重新评测,Optimizer Agent 根据结果决定是否接受候选版本,再进入下一轮迭代。


整个过程如下图所示,在整个优化过程中,只有在候选版本取得严格更高的分数时才会被接受,如果得分持平或下降,Optimizer Agent 会回退到上一个版本。


从一次性交付走向持续进化,这就是 PenguinHarness 对下一代 Agent Harness 给出的回答。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


和自进化 Agent 之间的契约


为了让 Agent 自进化跑得更 “稳”,PenguinHarness 设计了一套框架必须遵守的 “契约”。


这份契约规定了 Agent 自进化的边界在哪里,我们在这里挑几个重点来讲。


1. 限定 Agent 的修改范围为提示词和 Skills,不能触及 Harness 内核。这是为了防止 Agent 在进化过程中产生安全风险,例如破坏了原有的权限审计规则。好的 Agent 建立在安全之上。


2.Agent 自进化要有快照和回滚能力,如果产生了负面作用,框架要有能力将 Agent 版本回退到之前的状态。


3. 目标 Agent 在进化过程中只能看到题目,不能看到 Rubrics。这是为了防止 Agent 走捷径,通过背会答案或者迎合打分器来取得更高分数,防止 Reward Hacking 现象。


4. 所有的优化流程都要形成文件记录,用户有权限去审计优化过程,提供自进化的可解释性。


这套契约也被 PenguinHarness 形式化为了一份 “CONTRACT.md” 文件,方便复制和分发。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


PenguinHarness 的其他有趣特性


团队在探索 Agent 自动构建范式的同时,也给 PenguinHarness 安装了一系列很有意思的能力。


首先,PenguinHarness 内置了 LlamaFactory、vLLM、Ollama 等与模型训练、部署相关的 Skills,你可以使用 PenguinHarness,用类似 Vibe Coding 的方法来尝试启动模型训练和部署。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


其次,PenguinHarness 集成了统一的模型网关,支持接入 1000 多种在线与本地模型,与 Kimi K3、Gemini 3.6、Ling 3.0 Flash 等最新的模型都完成了适配。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


此外,PenguinHarness 还为 DeepSeek 装上了眼睛。你可以配置一个带有视觉模态的代理模型,实现 DeepSeek 为主驾驶,视觉代理模型为副驾驶的开发模式,让 DeepSeek 也能 “看到” 自己生成的网页和 PPT,再基于视觉反馈进行调整。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


不仅如此,PenguinHarness 本身还支持细粒度的行为轨迹分析,通过观察时间线,分析 Agent 的性能卡点。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


此外,你也可以将 PenguinHarness 作为类似 Pi Agent 一样的空白 Agent 样板来使用,PenguinHarness 内置的 Agent 保持了极简的设计,将 Shell 作为通用接口,使用极少的工具完成任务,将 Subagent 等功能作为核心性能目标进行了优化,系统提示词也只有 Claude Code 的十分之一(1,300 vs 15,000)。


在严谨的评估基准上,PenguinHarness 配合 DeepSeek 模型做到了最好的表现,而成本只有其他产品的数十分之一。


能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent


PenguinHarness 的表现不仅停留在纸面上,在开发过程中,团队已经将 PenguinHarness 实际部署到了两个生产场景中。某家体检机构使用 PenguinHarness 生成了和医学专家能力类似的报告核查 Agent,过去一份需要 30 分钟才能核查的报告现在只需要几十秒。


某家制造企业将 PenguinHarness 构建出的多个 Agents 应用到了流水线作业巡检上,全天候盯着设备状态并自动恢复,产线停机时间减少 65%,产出提升了近 2 倍。


PenguinHarness 以 Apache 2.0 协议开源,支持 Linux、Mac、Windows 系统一键安装,既可以部署到本地机器,也可以放到服务器上远程通过浏览器访问,提供多用户隔离且支持团队协同使用,既可以作为 Agent 自动构建平台,也可以当做 Codex 的本地平替,以更低成本完成任务。


期待 PenguinHarness 开源项目可以得到更多关注,构建出各种有趣的 Agent 应用。PenguinHarness 将努力作为 Agent 生产引擎,让所有人都能享受到自进化 Agent 带来的生产力提升。


PenguinHarness 背后的团队


PenguinHarness 由 PrismShadow 团队开源,团队成立于 2025 年,专注于打造能在真实业务中持续学习的 Agent 基础平台,让企业知识、工作流程和业务反馈转化为可部署、可评测、可持续优化的 Agent。


PrismShadow 创始团队成员包括:


  • 郑耀威:LlamaFactory 开源框架作者,GitHub 7 万星标,专注于打造更易用的模型与 Agent 基础设施。
  • 钱步月:加州大学戴维斯分校博士,曾任 IBM TJ Waston 高级研究员,曾任复旦大学教授、博导。
  • 吴雪军:前百度 NLP 部门创始成员,曾任阿里巴巴高级总监和京东数科副总裁。
  • 胡俊豪:北京大学博士生,提出位置无关缓存,曾参与 MiMo V2 模型,Hy3 系列模型的研发。
  • 陈溪:美国纽约大学商学院教授,卡耐基梅隆大学博士,曾任亚马逊首席科学家。


从 LlamaFactory 到 PenguinHarness,团队始终坚持的使命是:将复杂的 AI 能力,变成真正易用、可靠且高效的大众化工具。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

5
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

6
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0