摘要
本申请实施例提供了一种视频内容描述法和装置、电子设备及存储介质,属于视频处理技术领域,适用于金融科技领域和医疗领域。该方法包括:获取目标视频数据;对所述目标视频数据进行多模态数据提取,得到多模态数据流;对所述多模态数据流进行脉冲神经编码,得到时空特征图;对所述时空特征图进行层次时序变换,得到语义单元及梅尔频率倒谱系数;对所述语义单元及所述梅尔频率倒谱系数进行跨模态特征整合,得到跨模态上下文表示;对所述跨模态上下文表示进行文本解码,得到目标自然语言信息。本申请实施例能够提高视频内容描述的精准度。