视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」
8130点击    2026-07-21 16:55

在多模态大模型(MLLM)时代,让模型看懂一张图早已不是难事,但要让它真正想清楚一张图,做多步的空间感知、几何分析与逻辑推断,却依然存在困难。


为了解决这种「看得到却想不对」的现象,研究界给推理链里塞进了视觉信息:一种是显式生成中间图像(如 Anole、ThinkMorph),效果理想,但算力开销高;另一种是隐式隐空间推理(如 Mirage、LVR),试图直接在特征空间里「一步」定位出目标区域,结果常常精度崩塌、注意力关注在无关的背景上。


针对这一挑战,腾讯内容服务部 BAC 提出了一个名为 ProLaViT(Progressive Latent Visual Thought) 的全新框架。它的核心思想是:别急着下结论,先在连续隐空间里像人一样「步步推导」。 即让模型遵循 「定位 → 聚焦 → 分离」(Locate → Focus → Isolate) 的因果链,逐步收紧视觉注意力,最终精准锁定目标。


该论文已被 ECCV 2026 接收。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


  • 论文地址:https://arxiv.org/abs/2607.02907
  • Github 地址:https://github.com/TencentBAC/ProLaViT
  • 项目主页:https://tencentbac.github.io/ProLaViT/
  • Huggingface 地址:https://huggingface.co/collections/TencentBAC/prolavit


现有路线的问题:


显式生成太贵、隐式推理太飘


如下图所示,把视觉信息引入推理链的现有路线各有硬伤:


1. 纯文本 CoT:模态鸿沟。 让模型把推理一步步写成文字。问题在于,文本本质上是抽象的,天然丢失细粒度的空间关系。于是模型把「电视下方的家具」脑补成了「木地板」,逻辑通顺,结果却是错的。


2. 一步隐空间预测:精度崩塌。 想跳过文本,直接在隐空间里一次性指出目标区域。但单步预测往往超出了模型的表征容量,结果就是注意力跑偏,脆弱的表征最终导致错误答案。


ProLaViT 的答卷很干脆:既不画像素,也不瞎猜,而是在「结构化隐空间」里做渐进式推导。 把一道复杂的视觉题拆成一条隐式思维链,让每一步只往前走一小步。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


不请「外援」:


模型自己的眼睛,就是最好的老师


训练多步隐空间模型有个绕不开的难题:中间步骤没有现成的「标准答案」图像。 以往的方法只能去请外援,例如 SAM、DINO、DepthAnything 这些外部视觉专家来当老师。然而,这样做往往带来域偏移和工程复杂度的问题。


ProLaViT 的做法是:内生自蒸馏(Endogenous Self-Distillation)。 不请外人,直接拿 MLLM 预训练视觉编码器当老师。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


上述方案具体怎么做?关键在于一条可编程合成流水线(Programmatic Synthesis Pipeline)


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


  • 对每个训练样本,用代码自动生成 K 张辅助图像,分别对应推理链的每一步(比如 crop (I, bbox)、segment (I, target))。这些图由几何变换算法生成,精度由代码保证,零人工标注
  • 冻结的视觉编码器 V 从每张辅助图里抽取「教师特征」,梯度不回传,编码器始终冻结。
  • 再用一次跨模态注意力,把 LLM 生成的隐式思维对齐到教师特征上,最小化蒸馏损失:


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


这么一来,模型在训练时就把渐进式视觉证据内化进了自己的隐空间,推理时完全不需要任何外部工具。


两套「思维套路」:


空间题靠定位,逻辑题靠思辨


ProLaViT 把推理拆成一条隐式思维链,并针对不同任务设计了两种范式。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


套路一:由粗到细因果链(Coarse-to-Fine Causal Chain)。 面向视觉搜索、目标定位等空间任务,走 「定位 → 聚焦 → 分离」 的路子,注意力一步步聚焦:


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


套路二:辩证推理链(Dialectical Reasoning Chain)。 面向拼图复原这类逻辑任务,走 「假设 → 批判 → 验证」(Hypothesize → Critique → Verify) 的反事实思辨路线:


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


每一步都由 LLM 嵌入空间里的一组可学习 token 表示。


防止「思路打结」:


距离加权多样性损失


多步隐空间推理有个常见问题,即隐空间坍缩(Latent Collapse):后续步骤的表征越来越相似,隐式思维链发生退化。


作者借鉴度量学习,提出距离加权多样性损失(Distance-Weighted Diversity Loss)。先用一个带间隔的形式,允许隐式思维链的 hidden state 合理相似、只惩罚过度坍缩:


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


除此之外,更关键的洞见是:因果距离越远的两步,越应该彼此不同。 于是给每对步骤加上一个距离权重:


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


其中 是因果距离,为最小权重,为可学习的陡度参数。最终损失:


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


这样既尊重了推理链的层级结构,相邻步保留适度相似以延续语境,远端步被强制拉开,又有效防住了表征坍缩。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


整体训练目标把语言建模与隐空间监督合在一起:,并配以四阶段训练(隐锚初始化 → 内生知识蒸馏 → 结构化链演化 → 全局能力整合),让渐进式思维稳定涌现。


跑分见真章:


准、稳,还看得见「想法」


作者基于 Qwen2.5-VL-7B-Instruct 实现 ProLaViT,在 MMVP、VisPuzzle、VStar、ChartQA、BLINK、CV-Bench 等一系列的视觉推理基准上做了广泛测试。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


1. 准。 ProLaViT(完整版,带距离加权多样性损失)拿下了 75.11% 的最高平均准确率,全面超越基线。相比「一步隐空间预测」,在 VisPuzzle(+2.25%)和 BLINK-Jigsaw(+10.00%)这类复杂任务上提升尤为显著。


2. 稳。 ProLaViT 靠内生自蒸馏保持域一致性,在 ChartQA 上稳稳拿下 78.99%。在最考验逻辑验证的 BLINK-Jigsaw 上,更是相比基座模型暴涨 +16.67%,验证了「假设 → 批判 → 验证」辩证范式的有效性。


3. 可解释。 作者把各推理步 token 表征的余弦相似度画成热力图:


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」



视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


消融实验


渐进式分解不可或缺。 把所有视觉线索压进单个隐状态的「一步预测」存在明显瓶颈;换成 ProLaViT 的多步推导后,ChartQA +15.97%、BLINK-Jigsaw +10.00%,平均 +7.45%。复杂视觉推理确实会压垮单一隐状态,而结构化链能把认知负担分摊开。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


内生 vs. 外生蒸馏。 把原生视觉编码器换成外部专家:DINOv2(判别式)尚能打,但在 VStar 等细粒度感知上落后;SDXL-VAE(生成式)在 VisPuzzle 上灾难性失败。作者推测原因是 VAE 隐空间为像素重建而生,几何与空间逻辑被压成了噪声。原生编码器提供的才是天然对齐的监督信号。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


推理步顺序至关重要。 把四步顺序随机打乱后,平均 下降 6.24%,VisPuzzle(-6.25%)和 CV-Bench(-8.52%)。没先建立全局上下文就直接做细粒度分割,违背了信息的自然流向,即渐进式因果结构是有效视觉推理的根本前提。


视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」


展望


ProLaViT 提出了一种「结构化隐空间渐进推导」的视觉推理新范式。它打破了「显式生成太贵、隐式推理太飘」的两难,用内生自蒸馏让模型从可编程合成数据中内化算法级精度、摆脱对外部视觉专家的依赖,再用距离加权多样性损失缓解隐空间坍缩,让每一步思维都独特而递进。


这项工作不仅在视觉搜索、拼图复原等重感知基准上取得了有竞争力的结果,更重要的是,它把推理从离散的文本空间搬进了连续的结构化隐空间,为弥合困扰传统思维链的模态鸿沟提供了一条兼顾准确率、可解释性与效率的可行路径。面向未来,把这种结构化隐式推导拓展到视频时序推理、引入更复杂的几何变换,将为更通用、更可解释的多模态智能铺平道路。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT