Meta首款编程Agent来了!背后模型能力直追Opus 5

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Meta首款编程Agent来了!背后模型能力直追Opus 5
5295点击    2026-08-06 16:05

终于,Meta 下场做 Coding Agent 了。


今日,Meta 正式发布 Muse Code 测试版。这是一款运行在终端中的 AI 编码 Agent,由最新的 Muse Spark 1.2 模型驱动。扎克伯格发文表示:「它可以在大型代码仓库中完成复杂软件工程任务,包括分析项目、规划修改、编写代码、运行工具以及验证结果。」


Meta首款编程Agent来了!背后模型能力直追Opus 5


这也意味着,Meta 与 OpenAI、Anthropic,终于又在编码 Agent 这一热门赛道「狭路相逢」了。


Meta首款编程Agent来了!背后模型能力直追Opus 5


而产品一经发布,便引起网友热议。一网友直接问起了当下讨论比较多的开源话题,问「Muse Code 是否会采用开源方式」?而扎克伯格也立即回应:「很快将会有更多关于这一话题的内容要分享」。


Meta首款编程Agent来了!背后模型能力直追Opus 5


目前,Muse Code 支持 macOS 和 Linux,通过一条终端命令即可安装。用户可以直接向它提出一个完整需求,例如修复跨越多个模块的 Bug、添加一项新功能,或者对大型项目进行重构。接到任务后,Muse Code 会先理解代码库,再制定计划、修改文件、运行测试,并根据结果继续调整。


Meta首款编程Agent来了!背后模型能力直追Opus 5


下面,我们来详细了解一下。


Muse Code:Meta 首个 AI 编程智能体


Muse Code 采用一个简单的智能体循环,并配合一组异步后台智能体,以增强主智能体的能力。


这些专用后台智能体会在整个会话期间持续运行,不会针对每项任务临时启动,从而减少重复的信息收集。它们可以自主执行后续步骤,并判断何时向主智能体反馈结果。


这种持续运行的机制能够降低延迟,也减少了主智能体在处理复杂、多步骤任务时对人工引导的依赖。


Meta首款编程Agent来了!背后模型能力直追Opus 5

demo 展示 


Muse Code 具有两大核心特征:


一是运行时设计。


Muse Code 使用本地事件日志,模型调用、工具运行、审批操作和代码修改都会被依次记录。作为唯一可信的数据源,这套日志机制让运行过程可以被精确重放,并能在重启后安全恢复。即使程序崩溃,智能体也能从中断的位置继续执行。


凭借这一能力,Muse Code 可以处理运行时间较长的任务,不会因中途故障导致整个流程偏离或中断。


二是内置技能。


Muse Code 默认提供多项技能。「/plan 」可以将任务拆解为一份需要审批后才能执行的计划;「/grill 」会对计划进行反复压力测试,直到方案足够可靠;「/goal 」则会围绕指定目标持续推进,直至任务成功完成。


Muse Spark 1.2:智能体背后更强的模型


Muse Spark 1.2 是在 Muse Spark 1.1 基础上推出的编程能力升级版本,重点提升代码生成、复杂问题调试、代码库理解,以及端到端开发流程中的表现。


在 Muse Spark 1.2 的训练中,Meta 显著增加了编程任务上的训练算力,同时扩展了训练环境的多样性。与此同时,模型在通用智能体等其他关键能力上仍保持了较强表现。


在评估智能体终端环境完成任务能力的 Terminal-Bench 2.1 上,Muse Spark 1.2 仅弱于 Opus 5(max)。


Meta首款编程Agent来了!背后模型能力直追Opus 5


 DeepSWE 1.1 上,Muse Spark 1.2 不敌 Opus 5(max)、GPT-5.6 Terra(max)。DeepSWE 定义了 113 项任务,覆盖 91 个代码仓库和五种编程语言,分别为 TypeScript、Go、Python、JavaScript 和 Rust。每项任务都配有人工编写的功能验证程序和回归测试。


Meta首款编程Agent来了!背后模型能力直追Opus 5


在来自 Meta 内部代码库的 Meta Internal Coding Bench 上,Muse Spark 1.2 也仅弱于 Opus 5(max)。该基准包含了 440 项任务。这些任务基于真实的内部拉取请求构建,涵盖漏洞修复、功能开发、代码重构、代码清理及其他软件工程工作。


Meta首款编程Agent来了!背后模型能力直追Opus 5


如此不俗的跑分成绩,得益于以下三项技术上的进步:


一是与 Muse Code 协同训练。


Muse Spark 1.2 与 Muse Code 采用协同训练,以确保两者配合使用时,能够充分发挥模型性能,并提供更好的编程体验。


训练过程中引入了基于拒绝采样的智能体运行轨迹,并围绕目标执行、上下文压缩和子智能体等环节优化训练方法。同时,团队还将 Muse Code 的工具集纳入训练,以提高模型与智能体运行框架的兼容性。


二是长时程任务能力。


Muse Spark 1.2 针对长时程编程任务进行了大规模训练,任务类型包括完整代码仓库生成、大型端到端项目和自动化研究。


模型会通过规划来安排任务顺序,通过目标条件约束保持执行方向,并借助上下文压缩保留持续推进任务所需的关键信息。


三是自我改进能力。


Meta 还使用 Muse Spark 1.1 生成高难度编程环境和指令遵循模板,再由模型评估候选方案对各项要求的满足程度,由此构建出一套可规模化扩展的 Muse Spark 1.2 训练数据。


这套自我改进机制帮助 Muse Spark 1.2 更准确地执行复杂指令,在指令遵循能力上超过了上一代模型。


价格方面,普通版输入 1.25 美元 / 百万 Token,缓存输入 0.15 美元,输出 4.25 美元;Contributor 版输入 0.10 美元 / 百万 Token,缓存输入 0.002 美元,输出 0.20 美元。


Meta首款编程Agent来了!背后模型能力直追Opus 5


参考链接:

https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2

https://x.com/finkd/status/2085080750034940201


文章来自于"机器之心",作者 "杜伟、Youli"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md