摘要
本发明涉及图像生成技术领域,应用于金融与医疗的图像生成场景,公开了文本到图像生成方法、装置、计算机设备及存储介质。该方法包括:接收输入文本并生成文本语义向量;初始化向量后得到初始潜变量;将文本语义向量和初始潜变量输入U‑Net网络并启动迭代去噪处理;在每次迭代去噪处理的过程中,当计算至U‑Net网络交叉注意力模块时,引入值域调节机制对交叉注意力模块的输出值域进行调制以提升文本引导图像生成过程中的语义一致性,及引入语义过滤机制以提升文本引导图像生成过程中的结构稳定性,从而提高金融与医疗场景的图像生成结果。