摘要
本发明公开了基于大语言模型先验的多模态融合图像翻译方法及系统,该方法包括:获取配准后的红外‑可见光融合图像以及对应的语义掩码和文本描述并进行数据预处理,得到融合图像特征、语义掩码视觉特征与文本语义特征序列;基于文本‑视觉状态空间块与三维选择性扫描块,构建多模态融合图像模态翻译模型;基于多模态融合图像模态翻译模型对融合图像特征、语义掩码视觉特征与文本语义特征序列进行图像翻译处理,得到翻译后的具有可见光分布特性的目标图像。本发明能够通过文本、掩码和图像之间的交互捕捉长期依赖关系,提升多模态融合图像翻译的精度。本发明作为基于大语言模型先验的多模态融合图像翻译方法及系统,可广泛应用于图像处理技术领域。