摘要
本发明涉及语音合成技术领域,可应用于金融科技和医疗健康领域,公开了一种语音合成方法、装置、设备及介质,包括:获取原始语音,并从所述原始语音中提取高维特征得到高维语音特征;将所述高维语言特征输入预训练的矢量量化器进行离散化得到多个离散Token;根据与所述原始语音相对应的文本信息和多个所述离散Token通过TTS生成器生成预测Token序列,其中,所述TTS生成器是采用样本集对大语言模型进行训练和验证得到的;将所述预测Token序列输入语音解码器进行语音合成得到目标语音。提高了合成语音的质量和准确度。