基于自适应交叉注意力融合的文本到图像生成方法及生成系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于自适应交叉注意力融合的文本到图像生成方法及生成系统
申请号:CN202511062258
申请日期:2025-07-31
公开号:CN120953412A
公开日期:2025-11-14
类型:发明专利
摘要
本申请属于跨模态生成技术领域,尤其涉及一种基于自适应交叉注意力融合的文本到图像生成方法及生成系统。该方法包括:获取条件输入信息,条件输入信息用于指示生成目标图像的文本描述信息、物体布局信息及文本视觉信息;基于条件输入信息,生成文本描述潜变量和图像视觉潜变量;基于图像视觉潜变量,确定文本视觉特征张量和初始图像特征张量;基于文本描述潜变量、图像视觉潜变量、文本视觉特征张量及初始图像特征张量,确定目标特征张量;基于目标特征张量,生成目标图像。本申请提供的技术方案,将文本生成与物体布局控制进行协同处理,确保了生成的目标图像中物体与文本描述之间的一致性,提高了目标图像的生成效果及生成效率。
技术关键词
视觉特征 变量 注意力 融合特征 文本编码器 图像生成方法 特征值 物体 布局 多模态 网络单元 跨模态 输入模块 解码器 图像生成系统