
这次,AI开始给自己写软件。
让AI定时干活不算新鲜事了。开源的OpenClaw带火的个人Agent,可以简单理解成一位常驻电脑或服务器的AI助手。
它接入聊天软件,记住用户交代过的事情,并按计划在后台工作;接着,又有团队开始让这类助手自己总结经验。
比如Nous Research推出的Hermes Agent,直接将自我改进写进产品核心。

它会在复杂任务结束后生成Skill,也会在使用过程中修改已有Skill,还能借助持久记忆找回过去解决问题的方法。
个人Agent已经开始积累经验,而Rome进入的,正是一个已经十分拥挤的市场。
Rome更值得注意的地方在于Agent学到一套方法后,还会将方法做成可以打开使用的应用。
Skill可以先理解成一份会更新的工作手册,里面记录任务该怎样完成,Rome继续做了一层,它生成的小工具拥有界面和独立数据,也能按照计划持续运行。

用户需要某项新能力时,可以让Rome创建应用并安装进个人环境,后续再根据使用结果继续修改。AI最终留下的不只有做事方法,还有一款能够长期使用的软件。
Rome核心参与者包括前Google和Meta工程师叶云帆,字节跳动 Web Infra前端负责人张磊,以及先后任职Dropbox与Anthropic的董张帆。
这几个人过去分别接触过多模态模型、开发工具和大规模数据系统,恰好覆盖了个人AI助手需要解决的主要问题。

官网将Rome称作Agentic OS,像一间专门给AI助手使用的工作室,聊天入口、个人资料和长期任务都留在里面。
同样的,已经验证有效的方法也会被保留下来,成为下一次工作的基础。每位用户拥有独立的Rome实例,它既能运行在个人电脑里,也能由官方提供专属的云端环境。

用户还能继续使用自己已有的模型订阅,不必完全依赖某一家模型服务。
Rome负责承接模型之外的Harness部分,让Agent知道去哪里读取信息,怎样调用工具,以及任务完成后该将结果保存在哪里。
此外,Rome也支持接入Telegram、Discord、微信和飞书等多个平台,日常消息可以直接成为任务入口。

Rome App承担了产品里的核心位置。每项操作会提前声明需要哪些输入,敏感动作要求用户确认。数据拥有固定结构,页面也会保留任务状态,Agent可以继续负责判断和生成,适合固定执行的流程则交给程序完成。
Skill适合记录方法,应用负责承接长期数据和用户操作。两者可以同时存在,Agent读取Skill完成判断,再调用应用里的具体功能。

假设用户想追踪任天堂游戏价格,应用会保存愿望单、历史价格和目标金额。应用每天检查商店价格,达到条件后再通过聊天软件发送通知。
用户第二天打开页面,仍然能看到之前加入的游戏和价格变化,这里不再依赖模型临时记住一段聊天记录,应用自身会管理数据,Agent负责查询、判断和后续行动。
Rome的应用商店目前收录了八十余款应用,既有代码和信息处理工具,也出现了面向个人生活的小型软件。

它们未必都代表成熟产品,至少说明Rome App承载的形态已经超出传统聊天插件。
如果商店里没有合适的应用,用户能直接请Rome创建一个。Agent会先理解任务应该保存哪些信息,再搭建操作界面和后台逻辑,应用安装完成便会立即参与工作。

叶云帆在发布Rome时提到,市面应用通常为大量用户设计,个人应用只需服务好一个人。传统软件必须照顾广泛人群,产品经理会筛掉过于细碎的要求。
某个人想要的功能如果只服务自己,很少有公司专门开发。生成代码的成本快速下降,小众需求有机会获得自己的界面和运行逻辑,Rome希望让Agent接手开发与维护,让个人软件的数量不再受制于开发团队的排期。

所谓Recursive Agent也能借助这个过程理解。
递归听起来像一个抽象的技术概念,落到使用里只是Agent会利用已有能力创造新的能力。第一次完成任务时,它可能依靠浏览器和几条操作说明。发现工作需要长期追踪后,它做出一个应用。
应用运行一段时间,新的反馈又促使Agent增加规则或者改动界面。每次修改都沿用已经完成的部分,个人环境随之变得更适合主人。

更有效的办法是修补Agent做事时依赖的方法和工具。用户反馈既会影响当前回复,也会改变应用和运行规则,让改动在后续工作里持续生效。
让Agent给自己开发应用听起来很轻松,背后却少不了一套完整的软件结构。
Rome App会通过配置文件声明自己的身份和能力,后台可加入具体操作、专属Agent、定时程序和事件触发机制。
除此之外,个人Agent一旦连接邮箱、聊天记录和浏览器,便利与风险会同时出现,Rome为敏感操作准备了确认环节。

Rome选择应用作为主要载体,这套产品思路也与三位核心参与者过去的经历颇为契合。
叶云帆更接近AI模型与个人Agent,张磊长期建设开发工具和前端生态,Zhangfan Dong熟悉大规模数据系统和模型服务。他们为大模型准备了一套完整环境,其中既要创建应用和保存数据,也要让任务持续运行。
叶云帆毕业于北京邮电大学,之后前往卡内基梅隆大学学习,并取得满分绩点。进入Google后,他参与了Google Assistant的Look and Talk功能。

用户面对Nest Hub Max时不必每次说出唤醒词,设备会结合视觉和声音判断用户是否正在与助手交流。
他后来也参与多模态模型训练和Gemini相关工作。加入Meta后,叶云帆继续参与生成式AI研发,工作涉及大模型后训练、多模态LLM、Llama和AI Studio等。
相关经历让他长期接触一个问题,模型能力很强,最终体验仍取决于上下文、工具和周围系统如何配合。

另一位核心参与者张磊同样毕业于北京邮电大学,之后进入阿里巴巴。加入字节跳动Web Infra时,基础设施小组只有三个人。
此后团队跟随业务扩大,逐渐承担起公司内部前端工具链和运行框架的建设。张磊担任字节跳动Web Infra前端负责人期间,带领团队打造了Rspack、Rsbuild和Modern.js,也深度参与LynxJS。

董张帆本科就读于上海交通大学,之后在加州大学欧文分校取得硕士学位。2018年进入Dropbox后,他先后担任软件工程师、高级软件工程师和技术负责人,工作横跨存储与机器学习。2024年10月进入Anthropic任职。
豪华履历容易带来关注,但产品仍要靠使用体验留下用户。Rome的难题不会因为团队来自几家大公司就自动消失。Agent生成的小应用得稳定运行,也要避免一次修改破坏原有功能。

应用接入的服务越多,权限控制和数据安全就越复杂。普通用户还需要足够简单的安装过程,否则个人Agent很容易再次成为少数开发者的玩具。
这个方向比笼统强调自我进化更具体,也更容易通过产品体验判断成败。每个工具服务的人很少,却会更贴近使用者的习惯。
AI助手正在努力学习用户,也开始保存自己做事的经验。一次任务完成后,Agent可以记录有效流程,制作应用,并在下一次工作时直接调用。

用户不断提出修改,个人环境也会随之调整,聊天记录总会被新消息盖过去,但一个持续运行的应用,能更长久地维系这段关系。
这或许是Rome想表达的操作系统含义。电脑里的桌面仍然照常运行,Rome给个人Agent准备了一个工作和生活的地方。
模型负责思考与生成,应用保存数据并执行固定流程,用户决定权限和方向。
当三部分逐渐配合起来,AI才有机会由随叫随到的临时帮手,变成一位熟悉个人习惯并持续完善工具的长期助手。
文章来自于“虾蛄AI”,作者“虾蛄内容部”。
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md