摘要
本发明提供一种基于二阶段语义矫正的图像字幕算法,包括一阶段解码和二阶段解码;所述一阶段解码负责生成出稿字幕,依赖视觉编码器和初稿解码器,结合区域、网格和语义特征,生产对图像内容的初步描述;所述视觉编码器负责将输入图像转化为高维特征向量,采用基于概念语义提取和几何特征融合的方法,通过整合结构化语义信息与几何特征,增强图像的语义深度和表达能力;所述初稿解码器在所述视觉编码器提取的特征基础上,结合当前已生成的词序列,逐步生成字幕草稿;所述二阶段解码包括审议解码器,所述审议解码器是对初稿字幕进行修正和优化。