摘要
本发明涉及文本图像处理技术领域,尤其涉及一种文本到图像的检索模型训练方法及检索方法,该方法包括:获取N个文本‑图像的样本对;对样本对进行特征提取处理,得到样本对的精炼局部特征和全局特征;基于样本对的精炼局部特征和全局特征,对N个样本对进行分类处理,得到不同样本集和样本的预测标签,并从N个样本对中得到困难负样本和困难正样本。在预热训练阶段,通过总双向KL散度损失函数,对所有样本的预测标签进行损失处理。接着,在常规训练阶段,通过总损失函数,困难正样本和困难负样本,得到文本到图像的检索模型。该方法能高效区分出含有噪声的图像和真实的困难图像,提高文本到图像的检索模型的鲁棒性、准确度和精度。