摘要
本公开关于一种文本生成图像的方法、装置、服务器及存储介质,所述方法包括:将用于生成图像的提示文本输入大语言模型进行处理,得到所述大语言模型中的每一个Transformer模块的输出结果;所述大语言模型为仅使用解码器结构的大语言模型,每一个Transformer模块采用的注意力机制为双向注意力机制,各个Transformer模块串联连接;通过聚合模块对各个Transformer模块的输出结果进行聚合,得到聚合结果;将所述聚合结果输入图像生成模型,得到所述提示文本对应的生成图像。本方法可提高图像生成模型的生成图像与输入的提示文本的一致性。