摘要
本公开提供了一种多模态文档理解方法及装置、电子设备,涉及文档理解技术领域。该方法包括:从文档图像中提取初始特征图,并对初始特征图进行下采样,得到视觉数据单元;从初始特征图中提取文本区域的特征,基于Q‑Former结构模型对文本区域的特征和文档的文本数据单元进行处理,得到查询向量,查询向量用于从文本区域的特征和文本数据单元中提取与当前任务最相关的特征;将视觉数据单元、文本数据单元以及查询向量输入大语言模型进行处理,对文档进行理解。本公开解决了现有的多模态大语言模型文档理解技术存在视觉感知能力弱以及计算资源要求高的技术问题。