摘要
本发明涉及一种基于滑动窗口的长视频生成方法,包括以下步骤:通过视频样本采集、视频结构标准化、帧级切分以及滑动窗口样本构建,完成数据收集;训练以得到视频生成模型,将视频样本中的长视频拆成窗口,每个窗口包含和上一个窗口重叠的内容;在训练时,每个窗口的视频帧输入模型,模型训练学习实现根据已有帧预测接下来的帧;根据视频生成模型,推理生成视频。本发明通过将整段视频分解为多个具有重叠区域的子窗口,并利用前一窗口的末尾内容作为当前窗口生成的历史上下文提示,实现长视频连续生成过程中上下文信息的有效传递与风格一致性控制。