摘要
本发明涉及语音处理技术领域,可应用于金融科技及医疗健康等业务场景中,公开了一种跨语言语音迁移合成方法、装置、设备及介质,包括:通过共享特征提取与语言特异性分离获得目标语言音素序列与声调标记,生成增强训练数据,采用分层自适应微调策略训练声学模型,融合推理用音素序列和声调标记生成表示序列,最终合成目标语言语音信号。本发明通过构建共享与分离并行的跨语言建模结构,有效提升了低资源语言中音素与声调建模的准确性,结合多阶段自适应微调与训练数据增强策略,使目标语言声学模型具备更强泛化能力和迁移效率,最终实现语音自然度与音色保真度的同步提升。