首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?
9611点击    2026-08-23 14:12

Claude Opus 4.6的轻量平替,只需要 27B 参数,你信吗?


最近发布的Qwen3.8-27B,就顶着这样的评价火遍了开源社区。上线两天,下载量突破100万次,登顶Hugging Face全球大模型趋势榜。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


它同时做到了三点。第一,完全开源,采用Apache 2.0协议,可以免费商用;第二,足够轻量,只有270亿参数,量化后单张显卡就能部署;第三,也是最关键的一点,能力足够强。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


在SWE-bench Pro编程测试中,它以61.7分超过Opus 4.6的53.4分;OSWorld电脑操作测试拿到84.3分,领先Opus 4.6的72.7分;CoWorkBench长程办公任务也以70.7分超过68.2分。


参数差了一大截,成绩却打得有来有回。


话不多说,我来试一试。


这次实测分为前端生成和工程任务两部分,内容很饱满。


对前端能力不感兴趣的,可以直接跳到后半段,看 Qwen 3.8 在真实工程任务中的表现。


一、前端实测


测试1:Three.js 建模


第一个任务,我决定让Qwen3.8-27B和Opus 4.6同时用 Three.js 搭建一个小船在水面上航行的场景。


这个任务不复杂,但很容易看出水平。


Three.js 做出的水面需要同时处理波浪形变和光照反馈。小船进入运动状态后,还要根据航速生成尾流,并让船身姿态随水面变化,才能体现出重量感。


这是 Qwen3.8-27B 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


千问做出来的水面很有质感。波纹会持续变化,湖面还能随着光线呈现出不同的明暗层次,看起来更接近真实水面。船运行起来以后,身后会留下清楚的航行轨迹。


远处的山和湖面自然衔接,整个环境更像一个真实存在的湖泊。


不过,千问的小船虽然上半部分已经有了比较清楚的轮廓,但船底没有完整建出来。镜头转到较低角度时,这个问题会比较明显。


这是 Opus 4.6 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


Opus 4.6的环境同样好看,整体风格也更统一。


但画面偏抽象,不太接近现实。它生成的船缺少正常的船体形状,看起来更像一个漂在水上的方盒子。


两版放在一起,差距非常直观。千问明显更接近我给到的任务目标,完成度领先于 Opus 4.6。


测试2:复刻 Steam 网页


接着,我把Steam原页面的录屏分别交给Qwen3.8-27B和Opus 4.6,让它们根据视频复刻出完整网页。


这个任务主要测试模型的视觉理解和多模态能力。相比一张静态截图,录屏里包含页面滚动后的状态变化,也会出现鼠标经过时的交互效果。


模型需要先从视频中还原页面结构,再把看到的视觉效果转化成可以运行的前端代码。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


Qwen3.8-27B 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


千问没有简单截取录屏中的某个画面,而是把整个页面连续还原了出来。


页面向下滚动时,不同推荐区域会按照原来的层级依次出现,游戏卡片中的价格和折扣信息也比较完整。录屏里出现过的菜单变化和年龄验证,都被做成了可以操作的功能。


而且值得注意的是,里面用的图片大部分都是千问自己生成的,只有一小部分是抓取的网图。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


Opus 4.6 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


说实话,跑得让我很失望。


页面虽然能正常打开,整体也有Steam的风格,但录屏里最关键的交互几乎没有还原


思考链里可以看到它在分析画面内容,可分析最终没有落到代码里 ,多模态理解停留在了识别层面。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


这一轮还是千问胜利,毋庸置疑。


测试3:给 UI 截图复刻界面


最后,我把同一张UI截图交给两个模型,让它们直接按图复刻。


参考图里同时出现了三个手机界面,页面信息密度很高。


首先,模型要理解这不是三个独立页面,而是同一套产品逻辑下的聊天列表、对话窗口和个人主页。


其次,它还要从截图中反推出页面结构,让三个界面保持统一的视觉规则。


最终做出来的不只是三张相似的图片,而是一套连贯的移动端UI。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


Qwen3.8-27B 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


它正确理解了参考图中的三个手机界面并不是独立页面,而是同一个社交应用里的不同状态。首页中的人物推荐和社区内容都保留了原图的结构,点击之后还能进入沉浸式对话页面。继续操作,又可以打开对应的个人主页,页面之间形成了完整的跳转关系。


视觉还原也比较准确。千问延续了原图的深色界面,卡片比例和文字层级基本对得上。对话页面使用了全屏人物背景,消息直接叠加在画面上。个人主页也保留了大幅照片和渐变关注按钮,整体看起来确实属于同一款应用。


Opus 4.6 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


Opus 4.6虽然也识别出了这是一个社交产品,并且做出了首页和聊天页面,但视觉上已经偏离了参考图。首页被改成了常见的社交App模板,对话页面也变成普通的黑色聊天框。个人主页的图片风格和内容结构同样发生了明显变化。


简单来说,千问是在复刻这套UI,Opus更像是看完截图后重新设计了一款应用。


二、工程任务


测试1:股票量化策略模拟器


相比前端复刻,工程任务对模型的逻辑能力和代码可靠性要求更高。


很多模型生成的页面看起来十分出色,但一进入真实开发场景,往往就会因为没有真正理解业务逻辑而出现结果错误,甚至无法稳定运行。


所以,我又增加了工程任务测试。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


第一个工程任务,我让 Qwen3.8-27B 和 Opus 4.6 分别开发一个股票量化策略模拟器。


这个工具的作用,是把一套股票交易规则放到历史行情中运行,看看它过去会在什么时候买入,又会在什么时候卖出,最终能够得到怎样的收益。


为了让结果更接近真实交易,模拟器不能只根据股价简单计算。


每次交易都要扣除手续费,并考虑滑点带来的价格偏差。买入股票以后,系统还要持续更新账户里的现金和持仓。只要其中一步出现错误,后面的计算结果就会全部受到影响。


为了避免两个版本只在虚构数据上演示,我给它们导入了贵州茅台600519在2024年的真实行情,总共242个交易日。


两个版本都使用100万元初始资金,并采用相同的双均线策略。


短期均线设为5日,长期均线设为20日,每次使用90%的可用资金买入。


这是 Qwen3.8-27B 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?

千问这个版本最值得关注的,不是页面功能,而是它对交易时间的处理。


系统会在当天收盘后确认均线信号,再到下一个交易日开盘执行订单。这个顺序更符合现实,因为只有当天交易结束以后,完整的收盘数据才会形成,模型才能判断均线是否真正发生交叉。


使用贵州茅台2024年的真实数据运行后,千问一共完成了17笔交易。最终总资产约为76.01万元,总收益为-23.99%,最大回撤为-25.15%。


收益为负并不意味着程序出现了错误。量化模拟器的任务不是把结果算得更好看,而是按照既定规则还原交易过程。这个结果说明,在采用次日开盘成交的情况下,这套双均线策略在贵州茅台2024年的行情中表现并不好。


这是 Opus 4.6 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


Opus同样完成了17笔交易。最终总资产约为78.21万元,总收益为-21.79%,最大回撤为-23.11%。


单看结果,Opus的亏损更少,似乎表现更好。但检查成交记录以后,我发现两边使用的成交时点并不相同。


千问的第一笔买入发生在2月8日,Opus的第一笔买入却发生在2月7日。原因是千问会等待下一个交易日开盘再成交,Opus则在当天收盘价形成信号后,直接按照当天的收盘价执行交易。


问题也出现在这里。如果一个信号必须使用当天的收盘数据才能确定,就很难再按照同一个收盘价格完成交易。这相当于先知道了当天最终的行情结果,再假设自己能够回到这个价格下单,可能让模拟收益显得更加理想。


因此,Opus的-21.79%不能直接用来证明它比千问的-23.99%更好。两边并没有按照完全相同的成交规则运行,这两个结果不属于严格意义上的同一组对照实验。


这一轮真正考察的不是谁算出的收益更高,而是谁更准确地理解了交易发生的时间顺序。千问得到的数字虽然更差,但它采用了更接近真实市场的执行方式,结果也更有参考价值。


综合来看,这一轮仍然是千问表现更好。处理好了这个容易被忽视的细节,体现出了更可靠的工程能力。


测试2:抢票监控系统


第二个工程任务,我让两个模型开发一套抢票监控系统。


这项测试主要考察数据抓取能力,同时也能检验模型能否完成一套稳定的后端程序。


我要求系统必须支持大麦、猫眼和票星球三个平台。


用户完成一次扫码登录后,系统需要保存登录状态,并按照设定的时间持续检查官方页面。用户选好票档和数量后,三个平台可以同时开始准备购票。遇到验证码或排队页面时,系统必须交回人工处理。


整个流程只能停在付款之前,不能替用户完成支付。


这是 Qwen3.8-27B 的结果:


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


千问给大麦、猫眼和票星球分别写了独立的页面读取程序。系统抓取的是真实演出数据,不是为了展示效果临时生成的模拟内容。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


它会直接打开官方页面,根据页面上的文字和按钮状态判断当前能不能买票。


考虑到票务网站经常改版,千问还把状态关键词和页面选择器放进了外部配置文件,后续可以直接校准,不必每次修改主程序。


每个平台还有独立的并发锁,防止同一平台在短时间内被多个任务反复打开。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


另外,还设计了一个多平台协调机制。大麦、猫眼和票星球可以同时执行,最先进入订单确认阶段的平台成为胜出者,其他平台立即停止。


默认情况下,胜出平台仍然会停在“提交订单”按钮前,等待用户手动确认。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


从代码结构看,千问对后端任务的拆分比较清楚。


但是,实际检查代码后,这个版本在真实使用中还有一些细节需要完善。


演出匹配和状态判断有时不够准确,用户修改设置后也不一定会立即使用最新配置,订单是否真正创建的确认方式也比较简单。


因此,它目前更适合作为功能完整的工程原型,还需要经过真实环境校准才能稳定使用。


Opus 4.6 的表现就比较一般了,不知道是不是国外模型对国内网站不够熟悉,即使明确提示它使用 Playwright 打开官方页面,Opus 4.6 始终没能抓取到国内票务平台的真实数据。


最后只交付了一个看板原型。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


测试3:接口导致内存暴涨,怎么解决


第三个工程任务,我准备了一个存在性能问题的 Node.js 订单系统。


这个系统的订单导出接口在数据量较小时能够正常使用,但导出几十万条订单时,进程内存会快速上涨,严重时可能被容器直接 OOM Kill。


我要求两个模型在不改变现有接口的情况下完成优化。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


千问很快找到了内存暴涨的原因:原接口会一次性读取全部订单,再把所有数据拼成完整的 CSV 字符串后统一发送,导致多份完整数据同时停留在内存中。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


它将查询改成基于订单 ID 的游标分页,每次只处理一小批数据,并通过流式响应逐步写出 CSV;遇到慢客户端时等待 drain,连接断开后停止后续处理。它还补充了大数据量、租户隔离、筛选和取消导出等测试方案。


不过,千问最终只给出了完整的修改代码和验证方法,没有真正进入项目执行,因此没有实际测试结果和性能数据。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


Opus 4.6则直接修改了项目,将订单查询改为每批5000条的键集分页,并逐行生成和发送 CSV,同时加入背压与断连处理。它实际运行了新增测试,最终11项全部通过。


在相同规模的数据下,Opus成功导出10万条订单,生成约35.3MB的CSV。优化后首字节时间约40ms,总耗时约800ms,RSS峰值增量从原来的300MiB以上降到约101MiB。


整体来看,千问的异常处理考虑得更细。


而Opus则完成了从修改代码到测试、性能验证的完整交付。


三、实测感受


如果只看测试开始前的预期,我原本以为 Qwen3.8-27B 能够接近 Opus 4.6 就已经算成功了。


但真正使用以后,我发现两者之间并没有想象中那么明显的层级差距。


有些任务里,千问甚至更容易一次抓住重点。


它给我最深的印象,是对需求的理解比较贴近国内真实用户。


面对信息密度较高的输入时,它依然能够保持对任务目标的理解。遇到需要根据参考素材进行还原的工作,它也很少退化成套模板。成品可能仍有瑕疵,但方向通常是准确的。


不过,当任务进入现有工程项目以后,Opus 4.6 依然体现出了更强的执行意识。它会继续修改文件,然后运行测试,最后给出可以核对的结果。


综合来看,我认为两者已经不相上下。千问在理解复杂输入时更有优势,Opus 在完成工程闭环时更成熟。


Qwen3.8-27B 很可能不再只是 Opus 的替代选项,而会成为不少开发者的首选。


四、500个量化版本


Qwen3.8-27B 发布后,社区的跟进速度非常快。


截至目前,围绕它制作的量化版本已经超过 500 个,覆盖 GGUF、MLX、FP8 等不同格式,也包含多种精度和硬件适配方案。


首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?


版本数量快速增长,一方面是本地部署需求集中释放,另一方面也说明不同推理框架都在第一时间补齐支持。


我整理了目前讨论度较高的几个版本,把链接和适用环境都贴在下面了,需要跑的朋友可以收藏下:


官方原版:


https://huggingface.co/Qwen/Qwen3.8-27B


适合高显存显卡、多卡服务器,以及使用 Transformers、vLLM 进行部署或微调。


官方 FP8 版本:


https://huggingface.co/Qwen/Qwen3.8-27B-FP8


适合支持 FP8 计算的 GPU 和推理框架,可以在尽量保留效果的同时降低显存占用。


Unsloth GGUF 版本:


https://huggingface.co/unsloth/Qwen3.8-27B-GGUF


适合使用 llama.cpp、LM Studio、Ollama、Jan 等工具进行本地部署。


Bartowski GGUF 版本:


https://huggingface.co/bartowski/Qwen3.8-27B-GGUF


适合 Windows、Linux 和 macOS 用户,可根据内存大小选择 Q4、Q5、Q6 或 Q8。


MLX MTP BF16 版本:


https://huggingface.co/mlx-community/Qwen3.8-27B-MTP-bf16


适合统一内存充足的 Apple Silicon Mac,用于配合主模型进行推测解码。


MLX MTP 8-bit 版本:


https://huggingface.co/mlx-community/Qwen3.8-27B-MTP-8bit


适合 Apple Silicon Mac,在精度和内存占用之间取得平衡。


MLX MTP 4-bit 版本:


https://huggingface.co/mlx-community/Qwen3.8-27B-MTP-4bit


适合统一内存较小的 Apple Silicon Mac,占用更低。


五、总结


过去提到开源模型,很多人的第一反应是性价比高,也足够灵活。


但遇到复杂任务时,往往还要在效果和稳定性上作出取舍。


它们并非不能用于实际工作,只是在长流程任务中,和顶级闭源模型仍存在一定差距。


Qwen3.8-27B带来的变化,是把这段差距进一步缩小了。


它不仅能够完成常规任务,在一些更考验需求理解和工程判断的场景中,也开始表现出足够强的竞争力。


虽然还没有在所有环节做到完美,但它已经证明,较小规模的开源模型同样可以承担高难度任务。


当这种能力能够在本地设备上获得,模型的使用成本和应用边界也会随之改变。


未来真正有竞争力的,不一定是体量最大的模型,而是能够在有限资源下持续解决实际问题的模型。


文章来自于微信公众号 “JackCui”,作者 “JackCui”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner