刚刚!Claude Fable 5,又拿第一了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚!Claude Fable 5,又拿第一了
8539点击    2026-08-04 12:24

Claude这次,真把AI编程榜单打出断层了!


就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。


紧追其后的GPT-5.6 Sol,分数只有它的三分之一!


排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。


刚刚!Claude Fable 5,又拿第一了


更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。


要知道,在开源世界里,Python语料大约是Ada的230倍。


但到了Fable 5这里,成绩居然只下降3个百分点。


刚刚!Claude Fable 5,又拿第一了


这就有意思了。


如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。


而现在的结果,却指向另一种可能——


最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。


卡死在100%通关线


100亿Token极限测试


具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。


在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。


接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。


最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。


并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。


只要漏掉一个边缘案例,整次运行仍然按失败计算。


刚刚!Claude Fable 5,又拿第一了


为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。


论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。


在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。


整个过程,更像一场持续数天的调试,而不是一次生成。


刚刚!Claude Fable 5,又拿第一了


gotree的例子最直观。


这个生物信息学工具原本有大约1.6万行Go代码和40多个命令。


Claude Opus 4.7花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%。


虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几个小时——


Epoch估计,如果不使用AI,人类工程师想要完成同一任务至少需要2到17周。


语料荒漠里,Fable 5只掉了3分


MirrorCode论文曾用StarCoder的公开训练混合作为参照。


其中Python约占8%,Ada只有0.034%,前者大约是后者的230倍。


刚刚!Claude Fable 5,又拿第一了


当然,我们无法知道闭源模型到底见过多少Ada代码。但拿公开生态作参照,Ada有多稀缺已经足够直观。


这门语言主要出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。


而Fable 5显然不是在把Go代码逐句翻译成Ada。


它更像是先摸清原程序究竟怎么工作,再换一门语言,把同样的行为重新造出来。


刚刚!Claude Fable 5,又拿第一了


相比之下,其他模型就没这么稳了。


GPT-5.6 Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5更是从17%掉到5%。语言一换,差距立刻被放大。


把整个项目交给AI


如今,Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码。


Anthropic则让16个Claude Agent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux 6.9内核的C编译器。


OpenAI披露的截至5月Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务;25.6%提交过超过八小时的任务。


人们交给AI的单位,正在从一段代码、一个bug,变成一个下午、一周,甚至整个项目。


MirrorCode的64%,正是对这种「项目级委托」的一次量化。


它说明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立做完一部分中大型软件。


对每一个正在把工作交给AI的人来说,变化已经近在眼前——


以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。


代码会越来越便宜。


而那些能把问题说清楚、把结果验明白的人,会越来越值钱。


参考资料:


https://epoch.ai/MirrorCode


文章来自于微信公众号 “新智元”,作者 “新智元”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md