摘要
本发明公开了一种基于图文多模态融合的双语机器翻译方法,属于机器翻译技术领域。该方法首先获取原始数据集,然后对原始数据集进行预处理;再以Transformer网络作为基础模型构建双语翻译模型,在Transformer网络的编码器端引入视觉特征提取模块、文本特征提取模块、以及特征对齐与融合模块;最后利用双语翻译模型输出翻译结果。本发明在传统双语翻译模型的基础上,增加了视觉处理模块、文本特征提取模块、特征注意力计算与排序模块以及特征对齐与融合模块,通过局部视觉特征与局部文本特征的对齐融合,在不引入图像冗余信息的前提下提高了翻译的精准度,实现了高效、准确的双语机器翻译。