蒸馏被妖魔化了,但过度的蒸馏也有代价
蒸馏被妖魔化了,但过度的蒸馏也有代价“蒸馏”一词再次成为舆论的关注焦点。这一次,站在聚光灯下的不是多次指控国产模型蒸馏的强硬派Anthropic,而是久未公开露面的张一鸣。张一鸣在最近的字节全员会上罕见发话:字节宁愿忍受模型的落后,也不希望依赖蒸馏实现短时的智能爬坡。
搜索
“蒸馏”一词再次成为舆论的关注焦点。这一次,站在聚光灯下的不是多次指控国产模型蒸馏的强硬派Anthropic,而是久未公开露面的张一鸣。张一鸣在最近的字节全员会上罕见发话:字节宁愿忍受模型的落后,也不希望依赖蒸馏实现短时的智能爬坡。
近日,来自 NatureSelect(自然选择)的研究团队 Team Echo 发布了首个情感大模型 Echo-N1,提出了一套全新的「情感模型训练方法」,成功将 RL 用在了不可验证的主观情感领域。仅 32B 参数的 Echo-N1,在多轮情感陪伴任务中胜率(Success Rate)达到 46.7%。作为对比,
首次实现“训练-推理不对称”,字节团队提出全新的语言模型训练方法:Post-Completion Learning (PCL)。 在训练时让模型对自己的输出结果进行反思和评估,推理时却仅输出答案,将反思能力完全内化。
是什么让纽约大学著名研究者谢赛宁三连呼喊「Representation matters」?他表示:「我们可能一直都在用错误的方法训练扩散模型。」即使对生成模型而言,表征也依然有用。基于此,他们提出了 REPA,即表征对齐技术,其能让「训练扩散 Transformer 变得比你想象的更简单。」
随着LLM不断迭代,偏好和评估数据中大量的人工标注逐渐成为模型扩展的显著障碍之一。Meta FAIR的团队最近提出了一种使用迭代式方法「自学成才」的评估模型训练方法,让70B参数的Llama-3-Instruct模型分数超过了Llama 3.1-405B。
本文研究发现大语言模型在持续预训练过程中出现目标领域性能先下降再上升的现象。
研究人员提出了一种新的大型语言模型训练方法,通过一次性预测多个未来tokens来提高样本效率和模型性能,在代码和自然语言生成任务上均表现出显著优势,且不会增加训练时间,推理速度还能提升至三倍。