摘要
本发明公开了一种基于状态空间模型的单流RGB‑D目标跟踪方法,属于计算机视觉技术领域,将RGB模态图像和深度(Depth)模态图像数据以Token形式进行整合,通过Mamba单流主干网络进行特征提取与第一阶段融合,之后通过多模态Mix Mamba深层融合模块(3M模块)进行第二阶段融合,提升跨模态特征的表达能力和跟踪效率,再利用跟踪头输出预测结果。通过上述方式,本发明通过Token级融合、Mamba单流主干网络与创新的3M模块,成功解决了传统RGB‑D目标跟踪方法中存在的参数量大、融合低效及噪声放大等问题,显著提升了跟踪器的效率与鲁棒性。