把Jev整合进 Harness,开源项目拿下黑客松总冠军!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
把Jev整合进 Harness,开源项目拿下黑客松总冠军!
9416点击    2026-10-06 16:54

在最近结束的进化酒馆黑客松深圳收官之战中,一个名叫 mu(μ)的项目脱颖而出。


它把 Jev 深度融合进 Harness,并拿下了全场冠军。


把Jev整合进 Harness,开源项目拿下黑客松总冠军!


把Jev整合进 Harness,开源项目拿下黑客松总冠军!


现在很多 Agent 都习惯把事情一股脑交给大模型。工具、日志、技能、上下文全部塞进去,模型一边干活,一边还要不断判断哪些信息有用、哪些任务完成了、哪些结果值得继续保留。


这些判断看起来不起眼,但一轮任务下来可能有几十甚至上百次。


全交给大模型,不仅慢,还浪费 Token。都靠固定规则,又很容易在复杂场景里失效。


mu 就是在这中间加了一层判定内核,把这些高频的小判断交给 Jev 等 Judge 处理,让主模型把精力放在真正需要推理的任务上。


最终,上下文更干净了,多 Agent 之间的信息传递也更高效。


mu目前已提供 Linux、Windows 和 macOS 桌面端,同时也支持命令行使用,既方便普通用户直接上手,也便于开发者接入自己的工作流。


01


把35个小判断交给判定内核


mu 建立在开源 Coding Agent pi 之上,主要改造的是模型外面的 Harness。


它一共设计了 35 个判定点,覆盖用户输入、工具调用、上下文管理、任务完成判断以及多 Agent 通信等环节。


比如用户发来一句话,Jev 可以判断这是新任务还是纠错。工具返回一大段日志后,可以判断哪些内容值得继续保留。模型说任务已经完成,也可以再检查一次是否真的满足要求。


这些问题并不难,但出现频率非常高。


因此,需要一个判定内核,让它快速完成是非、选择或打分判断,再由 Harness 根据结果决定下一步动作。


作者实测,Jev 在 HTTP/2 热连接下单次判断约 0.3 秒;16 个工具输出块合并成一次请求时,约 0.44 秒完成。


这样,主模型就不用把大量注意力花在这些琐碎决策上。


mu 也没有把所有判定都锁死在 Jev 上。不同判定点可以分别调用 Jev、本地判定模型 Laya 或普通 LLM,也可以组合使用。


把Jev整合进 Harness,开源项目拿下黑客松总冠军!


项目还提供了 shadow 模式。开启后,Judge 只记录判断结果,并不会真正改变 Agent 行为,方便开发者先观察效果,再决定是否启用。


02


上下文只留下真正需要的东西


Jev 在 mu 里一个很重要的用途,就是帮 Agent 管理上下文。


现在 Coding Agent 接入的 Skill、MCP 和工具越来越多,任务执行过程中还会不断产生日志、测试结果、网页内容和代码 Diff。


如果这些东西全部留在上下文里,很快就会越来越臃肿。


mu 的思路不是等上下文塞满以后再压缩,而是从一开始就控制什么东西能够进去。


当前任务用不到的 Skill,不进入 Prompt。暂时不需要的 MCP,也不会提前暴露给模型。


工具产生大量输出后,mu 会把内容切块,再判断哪些和当前任务有关。


有用的留下,不重要的归档,需要时再重新取回。


对于完全重复的日志,则可以直接折叠。


作者统计的 7 份真实失败测试日志共有约 14 万字符,通过无损折叠完全重复的内容,整体减少了 51%。这一步不调用任何模型。


把Jev整合进 Harness,开源项目拿下黑客松总冠军!


所以 mu 做的不是简单的“摘要压缩”。


它更像是在不断判断,这条信息现在还有没有必要让模型看到。


03


干活和汇报分开


mu 还做了一个看板功能。


把Jev整合进 Harness,开源项目拿下黑客松总冠军!


Agent 在执行复杂任务时,会产生大量日志、工具调用和中间状态,这些内容对模型有用,但用户往往只想知道现在做到哪了。


mu 因此把“干活”和“汇报”拆开。


主模型继续执行任务,Jev 负责判断当前有没有值得告诉用户的新进展。


如果有,再交给一个更擅长表达的模型整理成人能看懂的内容。


这些汇报只展示给用户,不会重新进入主模型的上下文。


这样既不会为了写汇报继续消耗上下文,也能让用户更容易看懂 Agent 到底在做什么。


04


Jev给多个Agent当“通信闸门”


mu 还支持多 Agent 协作,并把这套模式叫做 Hive,也就是蜂群。


一个复杂任务可以同时派出多个子 Agent 分头处理。但多 Agent 真正麻烦的地方,是信息怎么传。


如果所有发现都广播给所有 Agent,每个 Agent 很快就会被大量无关信息淹没。如果完全不交流,又容易重复工作。


mu 把 Jev 放到了通信链路中间。


一个子 Agent 得到新发现后,Jev 会先判断这条信息值不值得共享,再判断应该发给哪个 Agent。


如果后面出现了新证据,还会继续判断新结论是在支持、补充还是推翻之前的结果。


这样,多 Agent 之间不再是简单地“全部共享”,只把真正有价值的信息传给需要它的 Agent。


把Jev整合进 Harness,开源项目拿下黑客松总冠军!


05


总结


从上下文管理到多 Agent 通信,mu 做的其实是同一件事,只让智能体看到此刻真正需要的信息。


文章来自于微信公众号 “智猩猩AI”,作者 “智猩猩AI”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费)


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/(付费)

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0