摘要
本申请提供了一种基于模块化网络的动态视角视频生成方法和装置,涉及人工智能技术领域,旨在生成了与用户指令相匹配的多场景的动态视角长视频。所述方法包括:通过大语言模型将用户指令解析为多个场景,每个场景包括场景描述和场景转换指令,所述场景转换指令表征场景间的转换方式;根据所述场景转换指令选择模块化场景转换器,所述模块化场景转换器用于使生成的视频具有场景转换指令对应的转换方式;将控制图像和所述场景描述作为控制信息,通过基视频生成器和所述模块化场景转换器依次生成各个场景的视频,所述控制图像为上一场景的视频的最后一帧图像;将各个场景的视频进行拼接,得到与所述用户指令相匹配的多场景动态视角视频。