一种基于视觉语言知识引入的零样本多模态第一视角行为识别方法

申请号：CN202411024976

申请日期：2024-07-29

公开号：CN119203019B

公开日期：2025-10-17

类型：发明专利

摘要

该发明公开了一种基于视觉语言知识引入的零样本多模态第一视角行为识别方法，属于多模态行为识别领域。本发明首先将视觉模态输入预训练的CLIP视觉编码器提取视觉特征，将经过STFT变换的加速度计模态、陀螺仪模态频谱图提取对应的特征，文本通过预训练的CLIP文本编码器提取到文本特征。然后将视觉特征传入到适配器模块，将零样本知识与新的自适应特征知识进行动态结合，得到最终的视觉特征。加速度计模态、陀螺仪模态通过惯性传感器融合模块得到最终的惯性传感器特征。最后将文本、视觉、惯性传感器特征一同输入多模态融合模块，充分考虑不同模态间对齐的问题，有效地提升模态融合的效果。该方法在零样本多模态第一视角行为识别任务上表现令人满意。

技术关键词

视觉特征多模态惯性传感器数据识别方法适配器可穿戴智能眼镜视角文本编码器陀螺仪样本模块残差系数视频拼接方法矩阵

系统为您推荐了相关专利信息

煤矿井下用三维点云数据采集设备的光照智能识别方法

智能识别方法三维点云数据煤矿井下采集设备特征提取单元

基于大模型与界面联合驱动的终端控制系统及控制方法

终端控制系统界面多模态交互指令大语言模型

一种具有鲁棒性的多模态联邦学习方法

联邦学习方法数据多层感知机多模态加权特征

一种基于AI大模型的医疗数据清洗方法

医疗数据清洗方法标识特征临床决策支持生命体征监测术语标准化

一种多模态医疗信息融合方法

信息融合方法协同学习方法文本数据提取表达式融合特征