摘要
本发明公开了一种基于预训练模型的视频问答系统及方法,系统包括:数据集处理模块、空间特征融合模块、语义增强模块、时序增强模块和视频问答模块;数据集处理模块用于获取数据集中的文本形式的问题,并将问题对应的视频进行视频帧提取,得到若干输入图像;空间特征融合模块用于提取输入图像的全局视觉特征和局部视觉特征,并通过注意力机制进行融合,得到融合视觉特征;语义增强模块用于提取文本形式的问题的文本特征,并基于文本特征和融合视觉特征得到增强文本特征;时序增强模块基于融合视觉特征得到增强视觉特征,并基于增强视觉特征预测后一帧的视觉特征;视频问答模块用于基于增强文本特征和视觉特征输出相关答案,完成视频问答。