使用扩散模型监督视觉语言模型训练的方法
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
使用扩散模型监督视觉语言模型训练的方法
申请号:
CN202511094970
申请日期:
2025-08-06
公开号:
CN120580446B
公开日期:
2025-11-21
类型:
发明专利
摘要
本发明公开了一种利用扩散模型监督视觉语言模型训练的方法。该方法输入图像与文本,通过视觉编码器提取多层次图像特征,并结合连接器输出的文本特征,作为条件信息输入至扩散模型中。核心为提出一种混合专家交叉注意力机制:分别对低、中、高层图像特征及文本特征构建独立注意力分支,并通过门控路由机制动态融合这些特征。融合特征用于指导图像逐步重建,输出最终图像结果。通过与原始图像对比的感知损失反向优化视觉编码器和连接器,从而增强视觉语言模型的感知能力与语义表达能力。
技术关键词
交叉注意力机制
线性变换矩阵
视觉
适配器
Softmax函数
多层次监督
文本
输出特征
感知特征
噪声分量
语义
图像重建
分支
融合特征
层级
网络