摘要
本发明涉及金融、医疗健康及人工智能技术领域,提供一种多模态视频特征解耦提取方法、装置、设备及介质,基于信息瓶颈损失、生成器损失、反事实损失及时序一致性损失训练因果生成对抗网络得到因果生成对抗特征提取器,并将初始视频特征、初始音频特征、初始文本特征、内容隐变量及上下文隐变量输入至因果生成对抗特征提取器生成解耦特征,能够将因果干预机制嵌入对抗网络的对抗训练过程,并通过双潜在空间架构直接建模以显式拆分内容与上下文的独立生成路径,避免辅助网络引入的偏差,时序一致性损失与信息瓶颈约束的联合优化策略还能确保动态场景下解耦特征的稳定性,从而生成解耦更彻底的解耦特征。