目前,各种生成模型已经越来越强;但一旦任务从「一次出图」变成持续数小时、跨越多种媒介的完整项目,真正的瓶颈往往不再是模型会不会生成,而是它能否记住项目、理解素材之间的关系、沿着用户已经确认的方向继续工作,并在出错时只修该修的部分。
JarvisHub 给出的答案,是把可编辑画布同时变成用户工作区、Agent 的外部记忆、行动空间和共享项目状态。Agent 不再只从聊天记录里猜测上下文,而是直接「看」到画布上的提示词、参考图、候选版本、生成结果、依赖关系、失败记录和用户反馈,再据此规划、调用工具、写回结果。
一句话概括:JarvisHub 不是又一个单点生成工具,而是一套面向长程多模态创作的开源 Agent 运行底座。

真实创作很少是一条「输入提示词——得到成品」的直线。创作者通常要先收集参考、确定风格或角色、规划页面与镜头,再生成多个候选、比较版本、局部修改、吸收反馈,最后把散落的中间结果组装成交付物。提示词、草稿、失败尝试、版本分支和反馈并不是边角料,它们共同构成项目不断演化的状态。
当前常见方案包括:
商业产品已经显露出从「生成资产」转向「协助完成项目」的趋势,但闭源架构让研究者难以进一步观察:Agent 如何表示上下文、怎样选择工具、如何利用反馈、怎样修复失败,以及如何在长流程中维持一致性。JarvisHub 瞄准的,正是这个尚未被充分打开的中间层。
在 JarvisHub 中,画布不只是把素材摆出来看的 UI,而是人和 Agent 共用的项目对象。每张参考图、每段视频、每个网页预览、每一版幻灯片都可以拥有稳定地址,并通过「引用」「版本沿袭」「生成依赖」「分组」或「工作流延续」等关系连接起来。用户选择了哪个版本、否决了什么、某个结果由哪些素材产生,也都能留在同一张画布上。

图 1:JarvisHub 与 Prompt-to-Output、聊天式 Agent、节点式工作流的比较。核心差异在于统一且可持续更新的项目状态。
JarvisHub 将项目表示为一张「有类型的多模态资产图」。节点既保存图片、视频、音频、UI、文本等内容,也携带位置、可编辑输入、生成输出、来源信息、执行诊断和运行状态;节点之间的边则描述参考关系、版本关系、生成依赖、分组关系或流程延续。
可寻址:Agent 可以明确指向「第三版网页预览」或「已被用户选中的第二个镜头」,不必依赖模糊的对话指代。
可复用:参考素材、草稿、被否决的候选或中间结果,都能在后续生成与编辑步骤中再次成为输入。
可检查:用户和 Agent 可以追溯某个结果受到哪些材料影响、沿用了哪个版本,以及哪些下游内容会受一次修改波及。
JarvisHub 的核心由三层组成:Canvas State 保存素材、版本、依赖与用户选择;Protocol Bridge 负责权限、能力清单、动作校验和写入控制;Agent Runtime 负责观察画布、规划动作、编排工具,并把可验证的结果重新合并进画布。
其下方的轨迹记录、评估器、人类编辑与检查点,则为反馈、恢复和后续分析提供证据。

图 2:JarvisHub 核心架构。画布状态、协议桥与 Agent 运行时共同构成可检查、可控制、可恢复的创作循环。
长流程创作要可靠,关键不只是让 Agent 会调用更多工具,还要让每次修改显式、合法并可恢复。JarvisHub 为每一轮提供 Capability Manifest,列出当前可用的节点类型、变更操作、工具与资产句柄,限定本轮允许执行的动作。只有能被编码为受检工具调用、画布变更、评估请求、澄清请求或用户回复的行为,才会真正落到项目里。
这意味着,画布变化不再隐藏在模型内部:Agent 新建了什么、更新了什么、调用了哪个工具、得到什么观察、为何进入下一步,都能通过协议桥写入轨迹。权限与状态边界也因此更加清楚。
反馈可以来自用户与评估子 Agent。用户可以选择候选、否决版本、修改提示词、调整风格或指出局部缺陷;系统完成创作时,也可以调用子 Agent 检查一致性、缺失证据、视觉质量与任务约束。
反馈的作用不是给中间结果简单打分,而是决定下一次状态转移:沿用已接受节点继续、局部修复失败节点、向用户澄清,或在证据不足时停止。
每一轮从用户请求开始。运行时先读取共享画布,理解当前素材、依赖、版本和状态;随后在能力清单与执行授权范围内选择动作,调用相应能力并获得工具观察;协议桥验证后,将结果、状态与证据写回画布;用户再在同一画布中检查、选择、编辑或反馈,进入下一轮。

图 3:Agent 运行时循环。每次能力调用都经过协议检查,并以可观察结果回到共享画布。
Canvas Tools:读取、创建、更新、连接、分组、选择和分支节点,并维护资产句柄与运行状态。
Generation Tools:负责图像、视频、音频和组合媒体生成。
Native Tools:连接浏览器、文件、代码、搜索、文档和演示文稿等外部执行环境,并返回可检查的产物。
Recovery Tools:提供结构化反馈、验证、检查点和局部修复。
MCP Tools:让外部服务在同一套 Manifest 与 Grant 约束下接入。
工具决定「能做什么」,Skills、Memory 和 Subagents 则帮助运行时决定「怎样把事情做完」。
Skills 封装故事板、参考图引导生成、设计还原网页、视频提示词或演示文稿构建等可复用流程;Memory 保留用户偏好、既有选择与跨轮次知识;Subagents 在工作流可分支时并行处理相对独立的子任务,再由主 Agent 选择结果并合并回项目图。
JarvisHub 记录的不只是最终作品,还包括每轮用户请求、执行前画布、可用能力、授权范围、选定动作、工具观察、反馈、修复决策与更新后的画布。
由此,研究者可以看到 Agent 是否忽略参考、丢失用户已经接受的选择、覆盖有用版本,或在本应局部修复时错误地进行全局重生成。
对开放式创作任务而言,这一点尤其重要:多个最终结果都可能「看起来不错」,但过程可能脆弱、不可复现;反过来,一个暂时不完美的结果也可能保留高价值的中间素材和可恢复决策。评价对象因此从单个成品扩展为整条创作轨迹。
系统接到「制作一部关于牛仔机器人僵尸拾荒者的短剧」后,在画布中外化任务简报、故事规划、视觉参考、镜头候选、依赖关系和生成进度。
最终关键帧保持了反复出现的机器人牛仔、海边场景与叙事动作线索,展示了长流程中角色身份、风格与跨镜头连续性的管理方式。

图 4—5:叙事媒体案例的画布工作轨迹与最终关键帧。上方为可检查的项目过程,下方为生成结果。
网页任务要求创建一个轻盈、Awwwards 风格、带丰富动画的个人摄影网站。画布同时跟踪设计参考、布局草案、实现产物、页面预览与修订状态,让 Agent 不必在「视觉方向」和「代码进度」之间反复丢失上下文。
最终页面在排版、图片摆放、页面结构和整体视觉方向上保持一致。

图 6—7:交互式网页开发案例。画布记录设计与实现轨迹,并输出风格一致的摄影网站页面。
第三个任务是制作一份「斯坦福课程风格」的机器学习决策树 PPT。画布记录课程内容、生成图示、幻灯片草稿、依赖关系、PowerPoint 预览和修改进度。
最终结果在主题组织、图示风格、强调色与跨页布局上保持一致,说明系统能够把内容筛选、叙事编排、视觉合成和页面级检查串成长流程。

图 8—9:演示文稿生成案例。上方为画布中的内容与页面编排过程,下方为最终幻灯片样例。
JarvisHub 验证的是:开放目标可以被拆成可观察的项目状态,参考与候选可以被持续复用,工具执行能返回可检查证据,用户反馈能决定下一次局部更新,而最终作品与生产过程可以同时保留下来。
开放 Harness 为未来创作 Agent 研究提供了三条更具体的路径。
第一,可以构建 Project-State Benchmark:任务不只给一个提示词和目标答案,还提供初始画布、参考材料、可用工具、约束、反馈事件和预期检查点。
第二,可以把最终质量与过程指标结合起来,评估上下文保持、工具选择、依赖正确性、反馈遵循与修复成功率。
第三,每次运行都能沉淀结构化的状态、动作、观察、反馈与修复数据,为训练后续 Agent 形成数据飞轮。
生成式 AI 的下一阶段,是能否在一个不断变化的项目中持续工作:理解现有状态、接住用户选择、调度合适工具、保留过程证据,并在错误发生后恢复。JarvisHub 把这一问题落到一张人和 Agent 都能读写的画布上。
当提示词、参考、候选、版本、依赖、反馈和检查点都成为可寻址的项目对象,创作 Agent 才真正有机会从「一次性生成器」走向可协作、可观察、可纠偏的长期创作伙伴。
对于研究者而言,它也提供了一个开放入口:不只研究最终作品好不好,更研究 Agent 是如何一步步把作品做出来的。
从聊天框到共享画布,从单次调用到长程协作——JarvisHub 试图搭起的,正是多模态创作 Agent 走向真实生产所缺少的那层运行基础设施。
文章来自于微信公众号 “机器之心”,作者 “机器之心”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0