摘要
本申请实施例提供一种基于AI语音克隆与口型同步的视频生成方法及系统,所述方法可以在获取输入视频和输入文本后,先使用语音合成模型将输入视频的声纹特征与输入文本融合,以生成自然语音;再使用唇形位移模型解析输入视频的唇部关键点,以及按照唇部关键点,根据自然语音匹配唇形变化数据;再根据输入视频和唇形变化数据生成输出视频。所述方法可以将语音合成模型的音素时长预测与唇形位移模型通过时序卷积耦合,使输出视频的口型与语音内容匹配,并采用通过重绘唇部区域实现轻量化视频修复,还支持动态响应用户实时修改的输入文本,提高响应效率。