一种文本到图像的检索模型训练方法及检索方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种文本到图像的检索模型训练方法及检索方法
申请号:CN202510965706
申请日期:2025-07-14
公开号:CN120929707A
公开日期:2025-11-11
类型:发明专利
摘要
本发明涉及文本图像处理技术领域,尤其涉及一种文本到图像的检索模型训练方法及检索方法,该方法包括:获取N个文本‑图像的样本对;对样本对进行特征提取处理,得到样本对的精炼局部特征和全局特征;基于样本对的精炼局部特征和全局特征,对N个样本对进行分类处理,得到不同样本集和样本的预测标签,并从N个样本对中得到困难负样本和困难正样本。在预热训练阶段,通过总双向KL散度损失函数,对所有样本的预测标签进行损失处理。接着,在常规训练阶段,通过总损失函数,困难正样本和困难负样本,得到文本到图像的检索模型。该方法能高效区分出含有噪声的图像和真实的困难图像,提高文本到图像的检索模型的鲁棒性、准确度和精度。
技术关键词
噪声样本 模型训练方法 标签 文本图像处理技术 检索方法 序列 矩阵 模糊C均值聚类 令牌 阶段 文本编码器 图像编码器 度量 鲁棒性 注意力