摘要
本申请公开了语料生成方法、设备、介质及产品,属于数据处理技术领域。本申请语料生成方法能够基于原始语料确定第一目标数据和符合预设条件且与第一目标数据匹配的第二目标数据;基于任务信息和第一目标数据训练待训练语言模型,实现对待训练语言模型的微调,得到可用于大规模语料合成的第一语言模型;将第二目标数据输入第一语言模型进行高质量语料的深度合成,进而得到目标语料(即高质量语料),为大语言模型的预训练提供了更优质的语料基础。本申请能够有效去除原始文本中的噪声、格式等错误,并加入更多的背景、细节、逻辑、中间步骤和关联知识,使文本质量得到很大提高,有助于模型的学习。