Anthropic前脚刚发布了Fable 5.1(具体可见Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线),后脚第三方权威跑分和个人第一手实测已经出炉了!
Anthropic研究员就展示了用Fable 5.1写代码,直接生成设计视频:
看看这效果,谁不想急头白脸地用一顿……

话不多说了,咱们先上实测。
看实例之前,先来看ARC Prize的基准测试。
成绩很不错,ARC-AGI-2拿下90.0%,ARC-AGI-1干到97.5%。
成本也更低,ARC-AGI-2每任务$3.12,ARC-AGI-1每任务$1.40,比Fable 5直接砍了32%。

正经跑分之外,大量网友没忍住火速开玩,给大家看看网友们的作品——
最火的是一款马里奥风格的赛车游戏。
据说只有一句提示词——
「用CryptoNinja的MCP来制作一款马里奥卡丁车风格的游戏」
然后,嘎巴一声就做出来了,如下:

无独有偶,另一款“仅用一张截图”就做出来的赛车游戏,长这样:

对此,有热心网友发来「悲报」:
马里奥赛车完蛋了啊。
此外,还有网友同样用一条prompt做出了一款恐龙主题的生存游戏。
包含20多个小时的可玩内容,涉及烹饪、制作道具、狩猎和驯服恐龙等玩法,还支持多人联机。
我觉得有必要放视频给大家感受一下效果。

他只用几个小时就做出来了,最后和朋友骑在一条被驯化的恐龙身上击败了霸王龙boss。
宾夕法尼亚大学教授Mollick认为,尽管Fable 5.1在需要判断力和审美的长程工作中确实有实质进步,但说话依然“Claude味儿”十足。
在此前,有许多用户反映自己看不懂Claude说话,而这主要源于它一贯“术语生硬堆砌、文本高度压缩”的表达风格。
话虽如此,他还是用Fable 5.1兴高采烈地做了一款复古风游戏,玩家需要在游戏中驾驶一艘太空飞船:

更多的测试集中在跨模型任务上。
有网友用同一条提示词搭建了一个第一人称视角的3D海洋沙盒场景:

他自己感觉,Fable 5.1的水准已经相当细腻,堪比3A。
还有网友让Fable 5.1和Kimi K3做同一段视频:

Fable 5.1用时18分钟,成本12.60美元,Kimi K3用时10分钟,成本6.95美元。
有网友评论:虽然Fable更细节,但自己做的时候,肯定还是会用Kimi的,毕竟更有性价比。
大家觉得哪个效果更好呢?
除了网友实测,科技媒体Every对Fable 5.1进行了一次更为全面的深测,覆盖编程、写作和知识性工作等多个场景。
首先是大家比较关心的token效率,其用量仅有Opus 5的一半,且处理耗时还是Opus 5的60%。
团队表示,Fable 5.1才是真正的大众之选。
而在Coding与长任务方面,Fable 5.1保持了Fable 5的性能,但是更细节,更完美。
Every团队让模型一次性生成了一个斯坦福AI小镇式的模拟系统——
25 个有记忆、有日常行为的角色,互相聊天,还在镇上传播即将举办的市长选举的八卦。
搭完测试者都有点懵了:“说实话,我不确定模型还不能完成哪些事。”

深度用户、复合工程学之父Kieran也盖章认可:“现在我直接在会话里就能处理长时间任务,不用频繁切工具了。Fable 5虽然很棒,但用起来太麻烦。而这个版本适合所有人!”
写作和知识性工作是Every评测中表现分化最明显的部分。
团队测算,Fable 5.1在长篇文本写作、尤其是段落续写任务上的表现干翻了此前测试过的所有模型。
并且,AI味也淡了很多,词汇量少了很多——文字难度大概是初一学生水平,比Fable 5低两个年级。
说白了,就是不整那老些诘屈聱牙之作,开始说人话了。
在需要更多主观判断的任务中,比如制作幻灯片、撰写人物访谈稿,它的表现也优于GPT-5.6和Sol。
但强大如此,也不是没有短板滴~
在设计方面,Fable 5.1并没有太多长进,配色单一,且作品并不完善。
并且,当任务带有明确限制,比如字数、主题、引用时,Fable 5.1就听不进去话了。
比如,要求输出1000 字,模型交付了1288字;要求提炼3到6个主题,模型给出了8个;要求提取八到十二条引用,模型给出了43条,全对也就算了,其中27条还根本不存在。
Every团队称之为,“总是尽自己最大的努力,做最多的活”。
(其实这也是老毛病了……)
此外,Fable 5.1还有一个不知道算不算毛病的特点。
在开启最高效率模式时,模型会额外调用不必要的子代理协助工作,即便被要求停止,它仍会继续运行。
所以还是要提前设置好预算啊。
基于这些测试结果,Every团队给出了一个大致的使用边界:
如果你的任务是协同编程、需要实时调试,或者不希望在长时间任务上等待Fable 5响应,Fable 5.1是更合适的选择;
但如果任务对字数、数量等格式有硬性限制,需要引用内容一次性准确无误,又或者涉及复杂多工具调用且没有提前设定预算,建议优先考虑Opus 5或Sol。
此外还有一条信息有点意思。
有网友发现,Fable 5.1在请求删除权限时捏造了用户从未说过的授权话语。
它根本来不及等你,直接提前预判了用户的反应。

Fable 5.1:bro别整没用的,我猜你的下一句话是……
也不知道这究竟算进步呢,还是退步呢……
参考链接:
[1]https://x.com/arcprize/status/2094894027451539744
[2]https://every.to/vibe-check/fable-5-1-vibe-check
[3]https://x.com/aimlapi/status/2094879208304685524
[4]https://x.com/Hesamation/status/2094864251059867847
[5]https://x.com/alexalbert__/status/2094860187743986169
[6]https://x.com/emollick/status/2094860076028657926
[7]https://x.com/Rubzem/status/2094866225960493189
[8]https://x.com/Bhavani_00007/status/2094913661915779239
[9]https://x.com/TimJayas/status/2094900247000654222
文章来自于"量子位",作者 "程浅"。
【开源免费】ai-town是MIT授权的一个AI虚拟小镇,该项目可以让研发人员轻松构建和定制你自己的AI小镇版本,其中居住在小镇的AI角色可以进行交流和社交。该项目受到研究论文《生成代理:人类行为的交互模拟》的启发。
项目地址:https://github.com/a16z-infra/ai-town
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0