大模型微调(Supervised Fine-Tuning,SFT)是当前最主流的LLM落地方案。无论是医疗问答、代码生成,还是法律文书,上到千亿参数大模型、下到端侧小模型,几乎都在用SFT做领域适配。
但一个尴尬的事实是:大家都默认SFT“训练完就是学完了”。直到腾讯混元团队对Qwen、LLaMA、OLMo2等多个模型家族(1.8B–14B)和10个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本——模型在训练中见过,loss也降下去了,但回头重测就是答不对。平均比例高达15.3%。
这就是论文定义的不完全学习现象(Incomplete Learning Phenomenon,ILP)——SFT训练的系统性盲区。

发表:ACL 2026主会长文(Long Paper,Pages 30186–30213)
SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:
但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4等都有专门的数据质量研究),但SFT阶段几乎没人追问“模型到底学会了什么、没学会什么”。
这篇论文完成了四项工作:
ILP现象:训练loss收敛后仍有大量样本无法正确复现:

四步诊断框架一图胜千言:

整个框架分为四个阶段:
Detect(检测)→Attribute(归因)→Intervene(干预)→Verify(验证)
这是最复杂的一步。难点在于:怎么区分“大致理解”和“真正学会”?
SFT通常生成自由文本,这种形式的“答对”太模糊。论文的做法是:
MC转换(Multiple-Choice Conversion):
案例:原始数据是“What is the capital of France?→Paris”,转换成:
Q:What is the capital of France?
A. London B. Paris C. Berlin D. Madrid
pass@k指标(k=5):
这里k=5不是随便取的:温度变化可能带来回答的随机性,pass@5=给了5次机会,比top-1更公允。
三重验证(Triple Validation):
为避免误判,论文做了三层交叉验证:
检测流程图:

这是全文最核心的贡献。论文提出了一个2×2归因矩阵,纵轴是“基模型是否已掌握该知识”(预训练阶段),横轴是“SFT标签是否正确”(标注质量)。

两步快速定位:
最终锁定五大根因:

2×2归因矩阵:

关键发现:ILP与标注质量无关。即使SFT标签正确率超过98%,ILP仍然存在。说明这不是“数据错了”的问题,而是SFT训练机制本身的系统性不足。
另一个惊人发现:ILP与模型规模弱相关。从Qwen-1.8B换到Qwen-14B,ILP仅降低2.1个百分点。也就是说,更大规模的模型并不能显著解决“学不会”的问题——这指向SFT优化机制,而不是模型容量。
论文根据五种根因,设计了对症的五类干预:

最惊人的对比实验:
CPT(2倍训练量)→ILP降12.5%
加epochs(10倍训练量)→ILP仅降2%
这意味着:拼命加SFT训练轮次几乎没用,真正的瓶颈在于预训练阶段的知识储备。SFT本身存在物理上限,它只能“重新组织”已有知识,无法凭空创造新知识。
干预后重新走一遍检测流程,对比干预前后的ILP率:

数据集中ILP分布:


从1.8B到14B,参数量翻了近8倍,ILP仅降了2.1个百分点。ILP是SFT机制层面的问题,不是模型不够大。

10倍算力换来2%vs2倍算力换来12.5%。该把钱花在预训练,而不是无限堆SFT epoch。
将ILP样本中涉及的知识点在Dolma 5T语料库中检索:
消融与溯源结果:

模型家族对比:

腾讯混元大模型团队(Tencent Hunyuan Team)&新南威尔士大学(UNSW),14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。
该工作入选ACL 2026主会Long Paper,是SFT诊断方向第一篇系统性研究。
论文(arXiv):https://arxiv.org/abs/2604.10079
论文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/
代码(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn
文章来自于微信公众号 “量子位”,作者 “量子位”