摘要
本发明公开了一种基于神经网络模型的语音克隆方法、装置、设备及介质。所述方法包括:将克隆参考语音进行音频信息提取,获取语音信号与背景噪声;将所述语音信号通过预设特征提取方式提取对应的语音特征,将所述背景噪声进行噪声提取,获取背景音特征;将所述语音特征以及所述背景音特征进行加权融合,获取目标融合特征;根据所述目标融合特征与预设待合成文本通过训练好的目标神经网络模型进行语音克隆,生成目标克隆语音。本发明可应用于金融保险与医疗健康等业务中的语音克隆中,可解决现有技术中无法进行高效地进行语音克隆的问题。