摘要
一种以交互驱动的多对象内容可控图像生成方法,包括以下步骤:步骤1):获取图像数据以及其对应对象实例的分割与类别标签;步骤2):获取每一个对象实例的图像,并进行处理,得到分割后的对象图像;步骤3),提取每张对象图像的类别、深度、细节特征得到多尺度表征嵌入;步骤4),使用Transformer结构对象交互逻辑关系提取模块获取不同对象间的交互逻辑关系;步骤5),使用隐藏张量空间至文本模态空间多模态映射模块构建提示词控制Token,再结合所得对象类别标签构建提示词文本;步骤6),进行多步加噪与去噪,最终使用变分自编码器还原图像,最终得到对应的内容可控图像。本发明可以进行多对象控制生成且关注多对象间逻辑交互的特点。