摘要
本发明公开了一种多模态大模型自适应视频帧压缩方法及系统,涉及多模态视频分析领域,方法包括:S1,获取用户文本指令和原始视频的采样视频帧;S2,将用户文本指令通过层级思维链推理转化为时空语义指令;S3,提取采样视频帧的视觉特征,通过时空语义指令为视觉特征进行重要性打分,得到语义权重矩阵;S4,基于语义权重矩阵,动态调整每帧的视觉特征数量与空间分辨率,基于新空间分辨率调整自适应池化参数并进行自适应加权池化,得到压缩精炼后的特征。本发明通过将用户文本指令解耦为时间、空间与上下文三维指令,生成动态语义权重矩阵,降低视觉‑文本语义对齐误差;基于权重矩阵自适应调整令牌密度,压缩合并冗余区域,降低计算复杂度。