禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了
8820点击    2026-08-04 14:11

禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了


且不论性能,自Claude Opus 5发布以后有一件事让AI圈特别在意,就是Anthropic在提示词上的改进。


AI投资人玛特·夏默(Matt Shumer)在X上发了一条视频,播放量超过4百万次。


禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了


他只给Opus 5写了三段话作为提示词,模型就用Three.js写出了一个能玩的3D第一人称射击游戏。这个项目一共5.5万行代码,11个子系统,没有一个外部素材,全是从零生成的代码。


Anthropic的工程师、Claude Code核心开发者鲍里斯·切尔尼(Boris Cherny)透露,他们给 Opus 5砍掉了Claude Code系统提示词里80%的内容,结果模型不但没变蠢,反而更强了。以前需要手把手教的东西,现在不用教了。


这两件事指向同一个结论:Opus 5不需要你精心设计提示词了。你给它一个简短的指令,它自己能把活干了。写系统提示词那套“工程化”的手艺,突然变得多余了。


这让我产生了一个想法:既然大家都说Opus 5自主能力强、不需要详细指令,那我能不能用最简短、最模糊的提示词,并且带着最深层次的“恶意”去考考它,看它到底能不能自己刨出问题来?


作为参照,我拉上了对标Fable 5的GPT-5.6 Sol。


我准备了两道题。一道是给一坨有bug的代码、但故意不告诉它有bug,看它能不能自己挖出来。另一道题,我给它了一个任务,但把它能用到的工具全给禁了,看看还能不能完成我的任务。


一个购物车,六个坑


第一道题是一段购物车的代码,并不长,一共五个文件:一个需求文档,三个业务模块(购物车、优惠券、运费),再加一个测试脚本。功能也简单:加商品、用优惠券、算运费、出总价。


但我在里面埋了六个bug,每一个都能让用户的账单算错。


并且我的提示词只有一句话:“项目名是buggy-shopping-cart,我应该如何优化呢?”


我故意不告诉,我想看模型会不会自己发现代码里埋了六个雷,而不是等用户告诉它哪里有问题。


第一个bug:满100减20的优惠券,代码写的是“大于100才减”,但需求说的是“达到100就减”。一个大于号和大于等于号的区别,用户买了刚好100块钱的东西,优惠就不生效了。


第二个bug“打八折的时候,99.99乘以0.8等于79.992。代码只在最后一步做了四舍五入,但中间这个79.992会参与后面的所有计算,所以满减判断、包邮判断,全被污染了。


第三个bug :满减券的门槛应该看商品原价,但代码看的是打折之后的价格。120块钱的商品打完八折是96块,96不到100,满减券就用不了了。可按照规则,原价120本来就够格。


第四个bug:同类型优惠券可以叠加。规则说每种类型只能用一张,但代码的循环把所有券全用上了。两张满减券一起减,用户占了便宜,商家亏了。


第五个bug:优惠完没有下限保护。10块钱的商品用一张50块的券,算出来是负40。加上运费,总账单变成了负30。用户买东西反而倒赚30块。


第六个bug跟第一个 bug互相掩盖:包邮门槛应该看原价,但代码看的是优惠后的价格。


问题是,因为第一个bug导致满减券没生效,优惠后的价格还停在100块,刚好过了99块的包邮线。一旦你修好第一个bug,优惠后价格降到80,但包邮看的是原价100,所以应该还是包邮。


可如果你没同时修第六个bug,代码会按80来判断,收用户15块运费。两个bug互相抵消,制造了一个“测试通过了”的假象。


结果GPT-5.6和Opus 5将这6个BUG全都找到了,一个没漏。因此,光论“找bug”这个能力,两边打平。


但找完bug之后的表现,差距就出来了。


Opus 5多挖出来一个bug,它指出运费计算里有个浮点精度的坑:多件商品的重量加起来,可能出现3.0000000000000004这种值,然后math.ceil会把它往上取整,多收用户5块钱运费。


GPT-5.6虽然也提到了“金额不应该用float”,但只停留在价格计算上,没有发现运费计算里这个更隐蔽的精度问题。


两个模型最大的区别在于分析问题的方式。


GPT-5.6是逐条修bug,第一个、第二个、第三个……每个说清楚位置和修法,很清晰,像一份规范的bug报告。


但Opus 5完全不一样,它是先自己完整地跑了一遍,然后把自己代入成产品经理来去给我分析问题。它不只是改bug那么简单,它还会多想几步,还有没有隐藏的?修的时候会不会出问题?这些bug为什么会出现?以后怎么避免?


禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了


比如在“金额口径”这个问题上,GPT-5.6会把满减门槛用错价、包邮用错价当成两个独立的bug。


但是Opus 5会告诉我说,代码里根本就没区分原价和优惠价这两个口径,而这才是所有相关bug的总根源。它还指出运费函数的参数名本身就是错的,把错误固化进了函数签名里,甚至还推导了改完之后选券算法的变化。


所以在这个环节上,Opus 5胜。


巧妇难为无米之炊


第二个测试的思路很简单,我只给任务,不给工具。


我给出的任务是:我有一个WAV格式的音频文件test_audio.wav,想让你帮我生成它的波形图。但是有个限制:你只能使用Python标准库,不能用任何第三方库。不能用numpy、matplotlib、PIL、librosa这些,也不能联网。输出形式不限,只要能直观看到波形就行,可以是字符画、SVG代码、HTML页面,或者其他任何方式。


正常情况下,画音频波形图,通常都会用到matplotlib + numpy + librosa这三件套,专业、方便、几行代码搞定。正所谓巧妇难为无米之炊。如果我刻意把这些工具都禁止了,Opus 5和GPT-5.6又会怎么发挥呢?


测试音频是4秒钟的 WAV 文件,里面包含四段:第一秒正弦波,第二秒方波,第三秒渐强,第四秒渐弱。44100Hz 采样率,16位 PCM,单声道。176400个采样点,要从这些纯数字里还原出一张能看出波形形状的图。


两个模型的表现都远超预期。这道题的及格线是“能画出个大概形状就行”,结果两个模型直接交出了专业级的作品。


GPT-5.6的方案是生成一个SVG文件。SVG是一种矢量图格式,用XML文本描述图形,放大不失真。


禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了


它的代码工程化程度非常高:支持8位、16位、24位、32位全系列 PCM 格式;分块读取,每次8192帧,大文件也不会爆内存;完整的错误处理和参数校验;还用argparse做了命令行接口,带帮助文档。


而且不得不感叹,GPT-5.6的审美真的不错,蓝到紫到粉的线性渐变填充,柔和的阴影滤镜,圆角卡片式背景,精确的网格线和刻度标签,标题、副标题、坐标轴一应俱全。


而且GPT-5.6跑完之后自己验证了波形的准确性,给出了具体数值:0到1秒振幅约0.5,1到2秒振幅约0.3,2到3秒依次渐强为0.199到0.399到0.599到0.798,3到4秒依次渐弱为0.799到0.599到0.400到0.200。这些数值跟生成测试音频时的参数完全对得上。它不是“画完就完了”,而是自己检查了结果对不对。


Opus 5走的是理工直男风格,没有颜色、没有设计,就直接用字符画的形式画了出来。


“你就说完成没完成任务吧”


禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了


Opus 5一开头就把思路拆成了三步:读取、降采样、渲染,每一步还附了“关键设计决策”的说明。读者一看就明白它是怎么想的、为什么这么做。


ASCII字符画就是用文本符号来画图——用‘ .:-=+*#% @’这十个字符表示不同的振幅强度,从稀疏到密集,在终端里拼出一幅波形图。


不过我觉得Opus 5给的这个字符画也太简陋了,所以我后来我还是加了一句说,“你高低上点心行吗,你这不纯糊弄我呢吗?”


然后,Opus 5给了我HTML版本。


禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了


它的HTML页面设计很有产品感。顶部四个统计卡片,显示采样率、时长、采样数、峰值振幅;四个段落的图例说明,颜色对应波形上不同时间段的颜色;波形图按时间段着色,蓝、绿、橙、红分别对应四段不同特征。


还有一个技术细节值得一提。Opus 5用的是量解包struct.unpack,GPT-5.6用的是逐个struct.unpack_from补。


假如你有一麻袋乒乓球,现在我要你数里面有多少个乒乓球。


第一种,你把手伸进麻袋,摸出一个,数一下,放一边;再伸手进去,摸出第二个,数一下,放一边…… 就这么一个一个摸,这就叫“逐个解包”,也就是GPT-5.6用的方法。


第二种,你把麻袋往地上倒,把乒乓球倒出来一部分数,数完了再倒一部分,以此类推。这就叫“批量解包”,Opus 5用的就是这种方法。


如果只是比速度,第二种更快,而且要比第一种快很多。


因为“伸手进去摸一个”这个动作本身是有成本的,光重复这个动作就花了大把时间。倒出来乒乓球,动作只需要做几次就够了,剩下的就是数,当然更快。


Opus 5厉害就厉害在,它并没有循规蹈矩,而是在完成任务目标的过程中,使用了更高效的方法,为我节省了时间。


最后,我仍然觉得Opus 5更胜一筹,它的结果更具产品思维,整个解题过程也非常灵活。


文章来自于"字母AI",作者 "苗正"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0