少即是多,这次轮到大模型来证明

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
少即是多,这次轮到大模型来证明
9307点击    2026-07-29 14:03

每逢重要的新模型发布,我们编辑部通常比新闻本身更早进入工作状态:提前打开官网、直播和社交媒体,等结果陆续出来,大家一边热火朝天地开始写文章,一边梳理参数、榜单和演示案例,判断这一次技术究竟向前走了多远。


这套流程已经相当熟练,大模型行业似乎也形成了一种默认的审美:更多的参数,更长的上下文,更复杂的推理,以及越来越接近「全能」的能力清单。


但设计圈有一句经典名言:Less is More。它强调设计要保持克制,知道哪里应该保留,哪里可以舍弃。


模型或许也一样。看发布会久了,我们很容易把注意力全部放在能力上限上,仿佛我们每天上班遇到的最大困难,是办公室里缺少一位能够证明黎曼猜想的同事。


其实,大多数工作并不涉及人类文明的终极命运。它们只是数量很多、过程重复、要求明确,同时又有一套复杂的流程。这种时候我们需要的往往是一个反应够快、听得懂话、能够稳定使用的工具。


7 月 24 日,蚂蚁集团旗下百灵大模型发布的最新模型 Ling-3.0-flash,正是沿着这一思路设计的。它是一款面向 Agent 长程工作流的 Flash 模型,总参数量为 124B、激活参数量为 5.1B,强调快速响应、稳定调用工具,以及适合高频使用的可控成本。上下文方面,Ling-3.0-flash 原生支持 256K,可扩展至 1M,并能在长输入下保持较高召回率。


少即是多,这次轮到大模型来证明


官方给它的定位是「智以密胜」,相较于百灵上一代旗舰思考模型 Ring-2.6-1T 的总参数(约 1T、激活约 63B),Ling-3.0-flash 只用了旗舰约 1/8 的总参数、约 1/12 的激活参数,就在多数基准测试上实现了「对标甚至超越」旗舰。


因此,Ling-3.0-flash 要讲的其实并非「又一个小模型」的故事,而是一次思路上的切换:模型获取智能的方式,不再单纯追求规模堆砌,而是转向对每一寸算力的高效压榨


百灵把这种取向称为「智能密度」(IQ 除以显存成本)与「智效比」(IQ 除以计算成本),而 Ling-3.0-flash 在这两个指标上的表现非常亮眼。


少即是多,这次轮到大模型来证明


从产品定位上看,Ling-3.0-flash 并不试图取代那些参数量庞大的全能推理模型,而是想要承担更多「执行」工作:复杂模型先搜索信息、制定方案并拆解任务,Ling-3.0-flash 再按照方案调用工具、修改代码、处理数据,并根据运行结果不断检查和修正。


这样一来,需要深度思考的部分可以交给大模型,需要反复执行和试错的部分则由 Ling-3.0-flash 完成。在保证任务效果的同时,也减少了每一步都调用超大模型所带来的等待和成本。


这个定位踩在了一个正在成型的行业共识上。进入 2026 年,业界对 Agent 的讨论已经从「能不能自主完成任务」,转向「一套 Agent 系统里该由谁来干什么」。也就是说,一套行之有效的 Agent 系统中不仅需要能深思熟虑的大型推理模型,也需要能快速高效完成基本任务的相对轻量模型


一手实测

把「快」和「稳」放进真实工作流


那么,Ling-3.0-flash 的真实表现如何呢?目前,Ling-3.0-flash 正在开放限时免费 API 调用(截至北京时间 8 月 3 日 23:00),趁这个窗口,我们也来免费体验一番,用真实任务对其进行实测。


上手门槛比预想的低。我们选的测试工具是 OpenCode,下载打开后,Ling-3.0-flash 已经是默认的免费选项之一,不需要额外配置就能直接用。如果想接入 Claude Code 等其他工具,也可以在 OpenRouter 或百灵官方平台免费申领 API key 后自行配置。


少即是多,这次轮到大模型来证明


  • 官方体验平台:https://chat.ant-ling.com/chat
  • OpenRouter 体验地址:https://openrouter.ai/inclusionai/ling-3.0-flash:free


第一个任务,我们让它构建一个模拟太阳系。结果有点出乎意料:Ling-3.0-flash 不仅正确搭出了太阳与八大行星的相对关系,还主动用不同颜色和行星环在视觉上做了区分。不仅如此,Ling-3.0-flash 的完成速度也相当快,整个过程不过 3 分钟。


少即是多,这次轮到大模型来证明


第二个任务偏审美:我们让它做一个「Less is More」的包豪斯风格的「机器之心精选作品集」网站,全程不用任何图片素材。


少即是多,这次轮到大模型来证明


成品相当精准地还原了纯 CSS/SVG 的无图美学,三原色、几何构成、非对称网格的语言都在。这也算是对官方同类 demo 的一次侧面印证。在这类前端视觉任务上,它的表现确实撑得起「对标」二字。


视觉展示之外,我们更关心它能不能真正嵌进生产流程。于是我们把它接进了自己的工作流,指示它安装集成了机器之心自产全部行业数据的「机器之心数据 Skills」。


少即是多,这次轮到大模型来证明


很快,Ling-3.0-flash 把这 4 个 skill 配置进了 OpenCode。配好 API key 之后,只需在对话框里提问,它就能按 skill 里定义的方式查询机器之心的全部行业数据。


举个例子,我们让它检索数据库中所有蚂蚁百灵发布过的模型与技术文章,并据此总结蚂蚁百灵的技术演进路线。


基于数据库中的 24 篇相关文章,Ling-3.0-flash 相当利落地梳理出了蚂蚁百灵这些年从基础设施、到 MoE 架构突破、再到全模态与智能体能力集成的一条主线,条理清晰,足以当作快速了解这家团队的一份参考。


少即是多,这次轮到大模型来证明


这类「读一批结构化资料、抽取要点、组织成文」的活正是其擅长的信息聚合与结构化输出场景。


当然,我们也没只挑它擅长的来。我们尝试让它独立完成一个更复杂的工程:用 Vite + TypeScript + Three.js 加 cannon-es 物理引擎,做一个 3D 物理台球沙箱。这一次,它并没有完全跑通。


这个结果谈不上意外,反倒和 Ling-3.0-flash 自身的定位相互印证:它本就不是为「一句话端到端拿下复杂工程」而设计的全能架构师,而更适合在人把架构和路径规划清楚之后,作为执行节点分步落地。如果先由人或更大的规划模型搭好台球沙箱的模块骨架,再让它逐轮填充实现,大概率会是更顺手的协作方式。


综合几轮体验,我们的直观感受和官方口径大体吻合:在边界清晰、有明确验证信号的任务上,它响应快、执行稳,接入工作流的成本也低;而一旦任务滑向开放、松散、需要它自己从零扛起整体架构,它的短板就会显现。


这正是一个「执行模型」应有的样子:把它用在对的地方,性价比很高;用错地方,则可能会带来失望。


极致「压榨」背后

一套围绕效率重写的架构


Ling-3.0-flash 的能力,官方归因于两条线的共同作用:一是底层架构的系统性升级,二是面向生产力场景的 Agent 定向优化。


前者决定了「同样的参数能转化出多少能力」,后者决定了「这些能力能不能在真实任务里稳定交付」。


先看架构。原生混合线性注意力是这次升级的地基。 


少即是多,这次轮到大模型来证明


与上一代 Ling-2.6 先进行架构迁移、再继续训练不同,Ling-3.0 从预训练阶段便采用原生混合线性注意力架构,以 5:1 的比例交替堆叠 KDA 线性注意力层和 MLA 层,即每 6 层中包含 5 层 KDA 和 1 层 MLA。由于各组件从训练初期便在同一架构中共同优化,模型可以兼顾长上下文处理效率和整体能力。


这里的 KDA(Kimi Delta Attention)即 Moonshot(月之暗面)在 2025 年底 Kimi Linear 工作中提出的线性注意力机制,随后成为业界探索高效注意力的一个共同参照。


它的思路是在 Delta Rule 的状态更新里引入细粒度对角门控:让不同特征通道拥有各自独立的保留、衰减与写入控制,而不是用一个全局旋钮统一处理记忆的遗忘。


通俗地说,模型在读长文档、大型代码库时,能更精准地维护那些跨段落、跨步骤的关键信息,不至于把新旧信息混成一团。Ling-3.0 把上一代的 Lightning Attention 换成了 KDA,正是看中这一点。


MoE 稀疏度进一步压低是「智效比」的直接来源。这一取向的方法论依据来自百灵此前提出的效率杠杆(Efficiency Leverage)与 Ling Scaling Law:在达到同等性能的前提下,更低的专家激活比例能换来更高的算力效率。


少即是多,这次轮到大模型来证明

激活比例越低,效率杠杆(相对稠密模型节省的算力)越高,且随算力预算放大。图为 1e22 FLOPs 下的估计值。来源:蚂蚁百灵团队 Efficiency Leverage 论文,arXiv:2507.17702


据介绍,Ling-3.0 据此把每个 Token 的专家激活比例从前代的 1/32 进一步降到 1/64。也就是说,124B 的总参数里,每次推理只点亮很小一部分,以极低的计算消耗驱动模型能力实现跃迁。


原生混合线性注意力、KDA 与稀疏 MoE 三者叠加,构成了它敢在 124B(激活 5.1B)体量上「越级挑战」的架构底气。


不过,这条「线性注意力 + 极致稀疏」的路线能否在更大规模上继续保持质量,行业内仍有不同看法。Acing AI 的第三方分析指出,线性注意力混合架构在研究规模(数十亿参数)上的「质量对齐」,未必能平滑迁移到前沿规模,尤其是在长上下文多跳推理这类被标准测试集低估的任务上。


当然,Ling-3.0-flash 走的本来就不是「什么都懂一点」的路线,而是把有限资源集中用在 Agent 和核心推理上。但这也提醒我们,「小体量对标大旗舰」的成立范围,需要落到具体任务上去看,而非一概而论。


除了模型本身的架构升级,Ling-3.0-flash 还针对真实生产环境中的 Agent 任务,在训练、推理服务和多智能体协同等方面做了专门优化


按照官方说法,团队将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 1 万多个,并持续提高环境的多样性、质量和任务难度。强化学习阶段还引入了完整执行轨迹复盘步骤贡献评估,为长程任务提供更细粒度的步骤级训练信号。


这些训练主要提升模型在复杂约束下持续规划、调用工具、处理失败反馈和动态调整执行路径的能力。官方称,相比上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 的 Agent 能力有明显提升,部分指标达到更大参数规模模型的水平。


MiniAppBench 可以提供一个外部参照——这个基准要求模型仅凭一句用户需求生成完整可用的 APP。参与评测的 16 个主流模型平均通过率约为 17%,Ling-3.0-flash 的通过率达到 25.3%,与总参数规模约为其两倍的开源 SOTA 模型持平。


工程层面还有两处改动,针对的是「Agent 任务越长,服务越吃力」这个问题:


一是响应速度。Agent 任务的对话轮次越多、上下文越长,传统推理服务一旦本地缓存被挤出,或会话被调度至其他节点,就可能需要重新处理此前数万 Token 的上下文,导致首 Token 延迟快速上升。Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系,将缓存从「实例私有」升级为「集群共享」,使已有上下文能够跨层级存储、跨节点复用和按需恢复。


官方实测称,在长输入场景下,命中 L3 Cache 相比重新计算,可将 TTFT 降低 60%~80% 以上。


少即是多,这次轮到大模型来证明


对于 Coding Agent 和长文档问答等场景,这可以减少上下文重算并加快任务接续。


二是协同稳定性。面对复杂 Agent 任务,单一推理链路容易出现决策漂移、局部误判和容错能力不足等问题。为此,百灵升级了名为「Ling Multi-Agent」的多智能体协同架构。不同 Agent 可以围绕任务进行多层级分工,并通过交叉验证、信息补充、协同纠错和竞争式「赛马」,降低单一推理路径造成的偏差。


根据官方展示的实验结果,Ling Multi-Agent 在 BrowseComp 和 BrowseComp_zh 上的表现会随协同计算规模增加而提升。这表明,在复杂检索和深度研究任务中,能力扩展不仅取决于单个模型,也可以来自更有效的任务委派和结果校验。


少即是多,这次轮到大模型来证明


从这些改动来看,Ling-3.0-flash 的产品逻辑是自洽的:把「执行」这一环节的速度、稳定性和成本做到极致,再靠工程手段解决长程交互中的重算与漂移问题


相应地,这种取舍也带来了明确的边界。模型资源更多集中于智能体与核心推理,在广度知识储备和多语言稳定性方面仍有提升空间,长对话或高压交互下也可能出现中英文混杂。


对使用者而言,这意味着一些明确的「不适合」:极度冷门、需要庞大世界知识硬背的研究任务,缺少「可验证节点」的松散开放式需求,以及「一句话帮我做完整工程」的 One-shot 预期……这些场景更适合交给更大的推理模型,或由人先把架构和路径规划好,再让它分步执行。当前版本也不具备原生多模态能力,遇到需要理解截图或音频的任务,需要配合多模态模型使用。


当「智能」开始按密度计价


从 Ling-3.0-flash 身上,可以看到一个越来越明显的行业变化:Agent 落地进入深水区之后,衡量一个模型价值的坐标,正从「参数有多大、榜单有多高」,悄悄挪向「单位算力、单位成本能换来多少可靠的执行」。


这也是 2026 年不少企业在做的取舍:与其用一个昂贵的大模型端到端包揽一切,不如让大模型负责思考、让轻量执行模型负责高频落地,用动态路由把成本压下来。


在这个坐标系里,Ling-3.0-flash 给出了一个不错的答案,但它是否适用于更多任务和场景,还需要继续验证。接下来,模型之间比拼的可能不只是能力有多强,也包括能否用更少的资源,把能力用在真正需要的地方。


而对今天的开发者来说,选择这类模型时,标准其实很简单:先想清楚要让它做什么,再把任务边界和验收标准说明白,剩下的交给它快速执行。


官方表示,Ling-3.0-flash 模型权重将在免费体验期结束后正式开源。可以开始期待了……


文章来自于"机器之心",作者 "Panda、+0"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales