摘要
本申请实施例提供了一种视频生成方法和视频生成装置、电子设备、存储介质,涉及人工智能领域,应用于金融科技和医疗领域。该方法包括:获取视频生成场景对应的目标图像和视频配置数据,并对目标图像进行深度估计得到目标深度图;根据目标深度图和目标图像提取多尺度深度特征;根据视频配置数据和目标图像进行视频时序预测,得到时序预测特征;获取预设动态记忆库,预设动态记忆库包含与视频生成场景匹配的场景代表特征;根据场景代表特征、多尺度深度特征和时序预测特征进行特征融合,得到目标融合特征;对目标融合特征进行解码得到多个预测视频帧,并根据多个预测视频帧生成目标合成视频。本申请实施例能够提高生成视频的连贯性和自然度。