一种多模态大模型自适应视频帧压缩方法及系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种多模态大模型自适应视频帧压缩方法及系统
申请号:CN202511016440
申请日期:2025-07-23
公开号:CN120751130A
公开日期:2025-10-03
类型:发明专利
摘要
本发明公开了一种多模态大模型自适应视频帧压缩方法及系统,涉及多模态视频分析领域,方法包括:S1,获取用户文本指令和原始视频的采样视频帧;S2,将用户文本指令通过层级思维链推理转化为时空语义指令;S3,提取采样视频帧的视觉特征,通过时空语义指令为视觉特征进行重要性打分,得到语义权重矩阵;S4,基于语义权重矩阵,动态调整每帧的视觉特征数量与空间分辨率,基于新空间分辨率调整自适应池化参数并进行自适应加权池化,得到压缩精炼后的特征。本发明通过将用户文本指令解耦为时间、空间与上下文三维指令,生成动态语义权重矩阵,降低视觉‑文本语义对齐误差;基于权重矩阵自适应调整令牌密度,压缩合并冗余区域,降低计算复杂度。
技术关键词
视频帧压缩方法 预训练模型 跨模态 指令 文本编码器 矩阵 视觉特征提取 分辨率 多模态 层级 语义向量 实体 动态 参数 关键帧