开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源
8878点击    2026-08-21 11:16

开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源


百灵为开发者提供了多个可继续训练的起点。


智东西8月20日报道,今日,蚂蚁百灵开源Ling-3.0-tiny-base和Ling-3.0-flash-base。除最终Base模型权重外,团队还同步开放了两款模型的预训练和中期训练权重,共计6个checkpoints


此前,Ling-3.0-flash于7月24日发布,8月7日开源;轻量级模型Ling-3.0-tiny则于8月11日开源。距离Tiny开源仅9天,蚂蚁百灵又进一步开放了两款模型未经后训练的Base版本。


Ling-3.0-tiny-base总参数量为7.9B、激活参数量为1.3B,适合代码领域训练、预算敏感的强化学习研究及模型行为研究等;Ling-3.0-flash-base总参数量为124B、激活参数量为5.1B,可用于代码、复杂推理、长上下文及专业领域模型的继续训练。


此次开放覆盖预训练、中期训练和WSM合并三个阶段,开发者可根据自身数据、任务和研究目标,选择不同的训练起点。


WSM(Warmup-Stable and Merge)是一种面向大模型预训练的学习率方案,它以多个checkpoints加权合并,代替传统的学习率衰减,使模型更适合持续预训练和动态扩展数据。


由于两款模型采用统一训练方案,开发者可以先在Ling-3.0-tiny-base上低成本验证训练策略,再将有效方法扩展至Ling-3.0-flash-base。


开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源


Ling-3.0-tiny-base开源地址:


Hugging Face:


https://huggingface.co/inclusionAI/Ling-3.0-tiny-base


https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30T


https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrain


ModelScope:


https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base


https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30T


https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-midtrain


开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源


Ling-3.0-flash-base开源地址:


Hugging Face:


https://huggingface.co/inclusionAI/Ling-3.0-flash-base


https://huggingface.co/inclusionAI/Ling-3.0-flash-base-30T


https://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrain


ModelScope:


https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base


https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30T


https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-midtrain


01.

开放6个checkpoints

可自行选择训练起点


8月以来,Ling-3.0-flash和Ling-3.0-tiny陆续开源。此后,有开发者在Ling-3.0-tiny的Hugging Face社区中提出,希望团队进一步开放Base模型。


他认为,Tiny的模型规模和稀疏架构对预算有限的研究者很有吸引力,适合开展强化学习rollout和面向具体场景的后训练;相比已经完成后训练的模型,社区更需要一个能够继续塑造的Base Model。


开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

▲开发者希望开源Base模型(图源:Hugging Face)


于是,百灵今天开源Ling-3.0-tiny-base和Ling-3.0-flash-base。


此次开放的6个checkpoints覆盖三个阶段:预训练checkpoint已完成大规模预训练,尚未进行中期训练、WSM合并和后训练;中期训练checkpoint已完成中期训练,尚未进行WSM合并和后训练;最终Base checkpoint则已基于中期训练checkpoint完成WSM合并,尚未进行后训练。


开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

▲本次开源的6个checkpoints(图源:百灵大模型)


这些checkpoints可用于持续预训练、领域监督微调、偏好优化、强化学习后训练、模型蒸馏,以及长上下文和MoE系统研究。


Ling-3.0系列在中期训练结束后,采用WSM方法,以checkpoint加权合并替代传统的学习率衰减。由于不再设置固定的学习率衰减阶段,模型更适合持续预训练和动态扩展数据。研究者还可以在训练结束后,离线探索不同的学习率“衰减曲线”。


Ling-3.0-tiny-base与Ling-3.0-flash-base采用统一的训练方案。开发者可以先在Ling-3.0-tiny-base上低成本验证训练策略,再将有效方法扩展到规模更大的Ling-3.0-flash-base。


02.

Tiny主打低成本后训练

Flash强化代码和长上下文


Ling-3.0-tiny-base总参数量为7.9B,激活参数1.3B。其总参数量约为前代Ling-2.5-mini-base的一半,但在多数评测中取得了更高成绩,代码能力尤为突出。


开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

▲Ling-3.0-tiny-base评测对比(图源:百灵大模型)


该模型适合开展代码领域的持续预训练、监督微调和后训练,用于预算敏感的强化学习Rollout与后训练研究,也可以用于高校教学、模型行为研究、MoE消融实验,还可针对具体行业和任务验证领域适配路线。


Ling-3.0-flash-base总参数量为124B,激活参数量为5.1B,具备更充足的参数容量与稀疏激活设计。模型在代码、复杂推理和长上下文方向表现突出。与总参数量约为其2至3倍的部分Base模型相比,其整体成绩仍具竞争力。


开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

▲Ling-3.0-flash-base评测对比(图源:百灵大模型)


该模型可以作为大型代码库、专业推理和长流程Agent的训练底座,也适合金融、医疗、科研和工业等领域的持续预训练与后训练。


不过百灵提醒,Base Model并非已经完成指令对齐的聊天模型,不建议未经后训练便直接将其部署为面向终端用户的聊天服务,也不建议未经额外对齐和评估便用于安全关键型应用。用于生产环境前,还需要完成针对具体任务的后训练、评估和验证。


03.

结语:从开放模型权重

到开放训练关键节点


相比只开放完成后训练的模型,此次蚂蚁百灵进一步开放了预训练、中期训练和WSM合并三个阶段的checkpoints,为开发者提供了多个可继续训练的起点。


Tiny和Flash模型采用统一训练方案,也为模型训练提供了一条从小规模验证到大规模扩展的路径。未来,这些基座模型能否在代码、专业领域及强化学习研究中衍生出更多模型,将成为此次开源价值的重要检验,也期待后续有更多大模型厂商开放基座模型,为开发者提供更具可塑性的训练底座。


文章来自于"智东西",作者 "杨京丽"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner