
给图像生成模型一张人物参考图,它大概率能抓住身份特征。
再给一张背景图,它也许还能把人放进去。
但如果一次给它5张、6张甚至7张不同类型的参考图:一个人物、一张背景、一种姿势、一种光照、一个风格,还要求它把这些信息组合成一张自然、统一、符合指令的新图呢?
问题就开始出现了。
模型可能记住了人物,却忘了姿势;套上了背景,却丢了风格;光照、构图、主体关系更容易互相“打架”。
这其实是当前图像生成走向专业应用时绕不开的问题。真实的设计工作很少只靠一句prompt或一张参考图完成。广告视觉、IP形象延展、海报设计、视频关键帧生成,往往都需要同时参考人物、场景、姿态、风格、光影等多种视觉条件。
也就是说,图像生成模型不只要“看懂一张图”,还要学会在多张参考图之间做协调。
针对这一问题,研究团队提出了DyRef,一个面向复杂多参考图像生成的动态优化框架。该工作已被ECCV 2026接收,并被选中为Oral Presentation。
论文提出的核心观察很直接:当前主流开源图像生成模型,在少量参考图场景下表现尚可;但随着参考图数量增加、参考类型组合变复杂,生成质量会明显下降。

多参考图像生成听起来像是把多张图片一起塞给模型。
但真正难的地方在于,每张参考图承担的角色并不一样。
有的图提供主体身份,比如“这个人是谁”;有的图提供背景,比如“场景在哪里”;有的图提供姿势,比如“人物怎么站”;有的图提供光照,比如“整体明暗关系如何”;还有的图提供风格,比如“画面应该像水彩、电影海报还是复古摄影”。
对人类设计师来说,这是很自然的工作流:从不同素材里抽取不同视觉要素,再组合成新的画面。
但对生成模型来说,这是一场“多约束协同考试”。
如果模型只是粗略地把所有参考图混在一起,很容易出现信息冲突:主体身份被风格覆盖,姿势对齐失败,背景和人物比例不协调,或者干脆只听prompt、忽略部分参考图。
这也是DyRef想解决的问题:让开源图像生成模型在面对更复杂的参考图组合时,性能不至于随着条件变多而迅速下降。

团队首先发现,现有多参考图像生成benchmark还不够“难”。
很多评测只关注单主体、多主体,或者少量参考类型组合。它们能够测试模型是否能保留人物身份,却不一定能测试模型能否同时处理主体、背景、姿势、风格、光照等多种视觉约束。
于是,团队构建了OmniRef-Bench。这个benchmark包含395个专家标注样本,覆盖5类参考图类型:主体、背景、风格、光照、姿势。每个样本包含2到7张参考图,并覆盖10种不同参考类型组合,最多同时出现4类参考信息。

更重要的是,OmniRef-Bench不是只依靠单一评估方式给生成结果打一个笼统分数。团队从客观量化指标和闭源模型打分两方面进行分析。
对于不同参考类型,它设计了更细粒度的评估维度。例如,主体要看身份一致性,背景要看场景匹配,风格要看视觉风格迁移,光照要看明暗关系,姿势要看动作是否对齐。
这让模型很难靠“画得好看”蒙混过关。
因为在复杂多参考任务里,画面好看只是第一步。更关键的是:该保留的参考信息有没有都保住。
为了解决这一问题,团队提出了DyRef。
DyRef的训练分为两步:
这里最关键的是,DyRef并不是把所有训练样本一视同仁。
复杂多参考任务里,不同样本难度差异很大。两张参考图的简单编辑,和七张参考图的混合约束,显然不是同一类题。
因此,DyRef设计了动态奖励优化机制:训练时更关注模型当前还做不好的复杂样本(DAR),同时把生成结果之间的优劣差距拉开(DRS),让模型更明确地知道哪些结果值得学习。
简单说,DyRef想做的不是让模型“多看几张图”,而是让模型真正学会:哪些参考信息该保留,哪些视觉条件该组合,以及当多种条件冲突时该如何协调。

在OmniRef-Bench上,DyRef显著提升了开源模型表现。在OmniRef-Bench的MLLM Evaluation平均分上,Qwen-Image-Edit-2511从4.97提升到8.38,明显缩小了与Nano Banana Pro的差距,并超过Seedream4.5的8.13。
尤其是在参考图数量更多、参考类型更复杂的任务中,DyRef有效缓解了原始模型性能下降的问题。
同时,在其他多参考图片生成测评基准MultiBanana和OmniContext上,DyRef相比于基线方法也同样取得提升。



一个自然的问题是:模型专门练复杂多参考,会不会把原本的单图编辑能力练坏?
实验结果显示,DyRef没有出现这个问题。
在单图编辑测评基准ImgEdit和DreamBench++上,DyRef训练后的模型同样取得了提升。
也就是说,DyRef不仅增强了复杂多参考生成能力,也在一定程度上提升了模型对视觉条件和用户指令的整体理解能力。

论文标题:《Scaling Multi-Reference Image Generation with Dynamic Reward Optimization》
论文链接:https://arxiv.org/pdf/2606.26947
代码链接:https://github.com/Weistrass/DyRef
文章来自于"量子位",作者 "DyRef团队"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0