摘要
本说明书实施例提供一种基于多个文档图像的视觉问答方法和装置,利用LVLM执行,LVLM包括,多模态编码模型和LLM。方法包括:通过多模态编码模型获取多个文档图像分别对应的各个图像表征以及问题文本对应的文本表征;将各个图像表征和文本表征输入文本监督评分器,得到多个文档图像对问题文本的各个相关性分数;从多个文档图像中选择出属于第一类别的若干个文档图像;第一类别落入按相关性分数划分的多个区间中的相关性分数最高区间;对于任一第一类别的文档图像,将其输入分辨率增强器,得到分辨率提升后的文档图像的图像表征;将各个图像表征和文本表征输入LLM,得到针对多个文档图像和问题文本的答复文本。