刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5
8946点击    2026-08-14 04:59

刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5


阿里千问首次开源Max级别模型。


智东西8月13日报道,刚刚,阿里千问大模型团队开放Qwen3.8-2.4T-A95B模型权重


Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,于8月3日发布,拥有更多功能,例如视觉输入功能、无需思考即可使用、默认支持1百万上下文长度处理、内置官方工具等。


刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5


▲Qwen3.8-2.4T-A95B开源主页(图源:Hugging Face)


魔搭社区模型下载地址:


https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B


Hugging Face模型下载地址:


https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B


这也是阿里千问首次将Max级别的旗舰模型对外开放权重。根据魔搭社区的官方预告,更小杯Qwen3.8-27B已在路上


Qwen3.8-2.4T-A95B的模型总参数为2.4万亿,每个Token激活950亿参数,原生支持262144 Token上下文,可扩展至101万Token。该模型采用Qwen3.5的底层架构,在编程、办公、科研工作、长周期智能体任务上实现性能提升。


Qwen3.8-2.4T-A95B模型可以通过SGLang、vLLM和TokenSpeed推理引擎部署,正式部署时需要使用各框架针对Qwen3.8的最新Recipe,并根据权重精度、GPU型号与数量选择并行策略。


Qwen3.8模型默认以思考模式运行,在生成最终回答前,模型会先生成由<think>\n...</think>\n\n标记的思考内容。Qwen3.8-2.4T-A95B不支持关闭思考模式


与此同时,开源AI项目团队Unsloth AI靠动态1‑bit分层选择性量化技术,将Qwen3.8‑2.4T‑A95B原始4.9TB的模型体积压缩至397GB,存储空间缩减91%


借助Unsloth‑Desktop工具,设备内存+显存总量达到410GB以上即可本地运行该模型。


刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5


▲Unsloth AI压缩Qwen3.8-2.4T-A95B(图源:X)


预告Qwen3.8发布时,千问称该模型“可能是除了Fable 5外最强大的模型”。


基准测试结果显示,在论文复现基准PaperBench中,Qwen3.8-Max取得93.0分,高于GPT-5.6 Sol、Fable 5和Claude Opus 4.8。在评估电脑操作能力的OSWorld-Verified中,Qwen3.8-Max以86.1分位居参评模型首位;在参数化CAD基准中,其91.5分同样超过Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro。


不过,Qwen3.8-Max尚未在所有测试中取得领先。


在TerminalBench 2.1中,其成绩为86.6分,略低于GPT-5.6 Sol的88.8分;在SWE-bench Pro中,Qwen3.8-Max获得67.7分,落后于Fable 5的80.0分和Claude Opus 4.8的69.2分;在长视频基准VideoMME v2中,其68.3分也低于GPT-5.6 Sol的71.1分。


刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5


▲Qwen3.8-Max基准测试结果(图源:阿里)


Qwen3.8的重点是模型能否脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的任务做完。


千问团队让Qwen3.8-Max连续自主编程约16天、独立复现并改进一篇研究论文、参加真实算法竞赛,还让它在超过2000轮交互中经营一家虚拟电商企业。


在连续自主编程16天的任务中,Qwen3.8-Max自主构建了自进化Harness,并持续完成社区需求收集、issue派发、代码生成、验证与自我修复。


刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5


▲Qwen3.8-Max执行自主编程任务(图源:阿里)


API价格方面,Qwen3.8-Max国内每百万Tokens输入12元、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元。


刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5


▲API价格对比表(智东西制图)


结语:全球三大顶流模型齐更新!


均着重强化智能体能力


一夜之间,三家大模型顶流轮番炸场:先是马斯克甩出自家最强模型Grok 4.6,其中Grok 4.6 high在其披露的多项智能体编程和知识工作基准测试中综合性能与GPT-5.6 Sol Max、Claude Fable 5 Max相当;接着DeepSeek-V4-Pro正式版上线,综合性能接近、部分指标超越Claude Fable 5;最后是Qwen3.8开放权重。


可以看出,这三家公司都着重强化了模型多步骤长周期自主工作能力,开始比拼模型独立承接完整项目、自主闭环干活的智能体水平。


此外,阿里千问团队此次将2.4万亿参数顶级旗舰模型正式开放权重,也是中国开源大模型布局的关键落子。


文章来自于微信公众号 “智东西”,作者 “智东西”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md