CVPR 2026 | Latent Implicit Visual Reasoning 潜在隐式视觉推理
1.论文信息
- 论文题目:Latent Implicit Visual Reasoning
- 论文作者:Kelvin Li,Chuyi Shang,Leonid Karlinsky,Rogerio Feris,Trevor Darrell,Roei Herzig
- 发表单位:加州大学伯克利分校、Xero、麻省理工学院IBM-沃森人工智能实验室
- 发表会议:CVPR 2026

图1:该任务要求模型选出与参考图像视觉相似度最高的候选图片。传统多模态大模型仅能输出文本,无法完整捕捉视觉信息,还容易产生语义歧义。采用显式监督的方法虽能训练模型输出中间推理过程,但当推理步骤本身难以界定,这类方法就会失效。
本文提出的方案可让模型隐式学习有效的特征表达。对隐标记的注意力图进行可视化后可以发现:模型能够自主挖掘与任务相关的底层视觉结构,而这类视觉结构,人工很难设计出对应的监督信号。
2.论文主要贡献
- 提出了LIVR通用隐式视觉推理框架
- 验证了“潜在token+注意力瓶颈”组合的有效性
- 实验与性能贡献:单任务微调和多任务联合训练的实验效果均优于SFT(有监督微调)
3.论文创新点
-
范式创新:无显式监督的隐式视觉推理范式
不引入额外标注,让模型依靠任务损失自主学习适用于视觉推理的中间表征 -
核心架构创新:可学习潜在token+视觉瓶颈注意力机制
引入专属潜在 Token:在输入序列后追加一组独立可学习的隐式 Token,扩充模型视觉表征空间;模型仅使用该类 Token 编码视觉信息
视觉瓶颈约束:定制注意力掩码,强制图像视觉信息只能通过潜在 Token 传递至答案端,阻断视觉信息直接流向提示词与答案,倒逼隐式 Token 主动压缩、提取关键视觉特征,弱化多模态模型天生的文本偏置 -
训练策略创新:两阶段递进式策略
4.研究方法
4.1 背景知识:传统多模态大模型架构
4.1.1 标准LMM基础结构
由三部分串联构成
- 视觉编码器(Visual Encoder):将输入图像转化为图像特征Token
- 投影层(Projector):对齐视觉特征与大语言模型的嵌入空间维度
- 语言解码器(Language Model Decoder):接收图像特征与文本提示,生成文本答案。
给定文本提示 Q Q Q与图像输入 I I I,模型前向计算公式如下:
R = M ( p ( v ( I ) ) , l ( Q ) ) R=M(p(v(I)), l(Q)) R=M(p(v(I)),l(Q))
其中: v ( ⋅ ) v(\cdot) v(⋅)为视觉编码器, p ( ⋅ ) p(\cdot) p(⋅)为投影层, l ( ⋅ ) l(\cdot) l(⋅)为文本编码器, M ( ⋅ ) M(\cdot) M(⋅)为语言模型, R R R为模型最终输出文本答案。
4.1.2 视觉问答任务范式
本文所有实验均基于视觉问答(VQA),分为两类形式:
- 开放式:模型自由生成答案
任务:目标计数,用准确率评估; - 选择题:用Top-1准确率评估。
传统LMM的缺陷:图像特征仅在输入阶段完成一次映射,后续全程在文本空间推理,丢失了大量细粒度视觉信息,难以处理拼图、语义匹配、空间定位等强视觉任务。
4.2 核心模块一:潜在Token(Latent Tokens)
经典常规方案(LLaVA 系列为代表)
标准流程:
- 图片经过ViT视觉编码器 → 得到一堆图像Patch特征向量(比如N个图像token);
- 直接把这一整串图像特征,原样拼在用户文本Query的最前面;
- 最终送入LLM的完整序列:
[图像Patch Token1, Patch Token2...]+[文字Question Token序列]。
痛点(研究背景)
- 输入总长度不固定:图片分辨率一变,Patch数量N就变,输入序列长度跟着动;
- 图像Token是纯粹只读特征,没有可学习嵌入参数,没法自适应微调适配LLM。
序列结构:[用户原始文字Q] + [固定K个专属占位Token L]
- 词表里提前新增K个独立虚拟Token,输入文本后面永远固定接上这K个位置,输入序列总长度永久固定不变;
- 视觉编码器提取的图像特征,灌入后面这K个预留好的空位里,位置永远在文本指令之后;
- 这K个占位Token自带独立可学习Embedding,和LLM一起端到端训练,主动适配视觉特征;
- 解码阶段直接屏蔽Token
Token设计规则
- 扩充词表:新增专属虚拟Token
- 原有大模型词表 V V V:存所有汉字、标点、英文、符号对应的数字Token ID
- 额外凭空新加 K K K个独一无二的特殊Token: l 1 , l 2 . . . l K l_1,l_2...l_K l1,l2...lK,集合记作 L L L
- 新总词表 = 旧词表 ∪ 新增的视觉占位Token
- 这些Token在文本里不会出现,模型内部专用
-
输入拼接:文本后面固定接上占位
用户输入文字提问 Q Q Q(比如“描述这张图片里的猫”),模型不会直接只喂文本,而是强行拼接:
Q ′ = Q + L Q' = Q + L Q′=Q+L
输入序列结构变成:人类文字指令 + K个固定隐形占位Token。
预留这 K K K个空位,后续图像编码器提取出来的图像特征,灌入到这一串占位Token对应的向量位置里,相当于给图像特征提前占好了“座位” -
参数设置:随机初始化、同步训练、禁止输出
这 K K K个Token的Embedding嵌入向量不用预训练权重
训练全程:这组嵌入权重和LLM主干模型一起反向传播、同步更新优化;
核心约束:解码生成回复时,模型不会把这几个占位Token翻译成文字吐出来;它们只停留在Transformer内部做自注意力特征交互,专职承载、编码图像视觉信息。 -
独立性约束:每个占位Token互不共享权重
K K K个Token各自拥有独立的可学习嵌入参数,不共用权重。
好处:每个Token可以分工编码图像里不同局部区域、不同粒度视觉信息,表征上限更高,表达图像细节能力更强。
->为模型开辟独立于文本空间的视觉计算区域,摆脱文本表达能力的限制,弥补传统模型“文本主导推理”的短板。
4.3 核心模块二:视觉瓶颈约束(Visual Bottlenecking)
单纯增加潜在Token无法保证其被用于视觉推理,通过修改注意力掩码(Attention Mask) 构建强制约束,迫使视觉信息只能通过潜在Token传递
注意力掩码约束规则
设置双重限制,彻底阻断图像特征向答案Token的直接传递:
- 答案Token禁止直接关注原始图像Token;
- 文本提示Token禁止直接关注原始图像Token。
在该约束下,图像特征只能先被潜在Token编码,潜在Token成为视觉信息流转的唯一通道,即“视觉瓶颈”。
图像 Token → 只能传给潜在 Token → 文本提示 Token + 答案 Token
->强制潜在Token学习有效视觉表征,避免新增Token被模型忽略;
弱化模型原生的语言偏见,倒逼模型依赖视觉特征完成推理;
4.4 两阶段训练策略
兼顾“让潜在Token学会编码视觉信息”与“模型灵活融合多类特征”,设计两阶段递进训练方案,两个阶段损失函数统一,仅注意力掩码规则不同。
视觉瓶颈掩码规则(关键约束)
启用完整视觉瓶颈约束(答案、提示均无法直接访问图像Token),
Transformer自注意力里,每个Token能看到哪些位置的内容,是靠注意力掩码控制的:
- 你的输入序列结构:
文本提示Q+K个隐式视觉占位Token(图像Token)+待生成答案x - 掩码强行做了隔离:
- 用户写的文字提示(Q里的各个文本Token)不能直接看见、不能直接读取后面那堆视觉占位Token;
- 模型往后逐字生成答案x的时候,答案里每一个输出Token,也不能直接跳过去读取视觉占位Token。
文字提示没法直连图像特征,答案也没法直连图像特征;
文字 ↔ 图像特征 ↔ 答案 之间的信息流通,只能靠模型主干的多层Transformer逐层传递,视觉占位Token变成了唯一必经的信息窄通道(瓶颈)。
强制所有图像信息必须全部压缩、编码进这组隐式Token里
损失函数 NLL 负对数似然
公式:
L = − 1 ∣ x ∣ ∑ i = 1 ∣ x ∣ log P ( x i ∣ x < i ) L = -\frac{1}{|x|}\sum_{i=1}^{|x|} \log P\left(x_i \mid x_{<i}\right) L=−∣x∣1i=1∑∣x∣logP(xi∣x<i)
- x x x:模型最终输出的完整回答文本序列;
- ∣ x ∣ |x| ∣x∣:回答一共拆成了多少个文本Token;
- P ( x i ∣ x < i ) P(x_i | x_{<i}) P(xi∣x<i):前面已经生成了第1~ i − 1 i-1 i−1个字,模型预测下一个字正好是 x i x_i xi的概率;
- 整体:对每一个输出字的预测概率取对数、求和,加负号再做平均,就是标准大模型文本生成损失。
仅在答案Token上计算,不监督潜在Token,强制它只能存图像特征
完整流程
- 输入拼好:
文字提问+K个新增专属占位Token;可学习潜在token - 图像特征灌入这K个占位Token,但靠掩码锁住:提问文字、后续答案都不能直接偷看这些图像Token;视觉瓶颈注意力机制
- 训练时只给最终输出的答案文字算NLL损失(2和3 两阶段递进式策略)
- 反向传播梯度回流时,只能倒逼这K个占位Token老老实实存储、编码全部图像视觉信息,再通过Transformer层间传递,间接给到答案侧用来生成回复(解决痛点:对视觉特征理解和视觉推理能力弱)
5.实验分析
5.1 实验基础设置
5.1.1 任务与数据集
- 计数任务(Counting):基于PixMo-Count数据集,开放式生成答案;
- 拼图任务(Jigsaw)、目标定位(Local.):基于COCO数据集;
- 视觉匹配(Vis. Corr.):基于HPatches数据集;
- 艺术风格分类(Art Style):基于ArtBench10数据集;
- 语义匹配(Sem. Corr.):基于SPair-71k数据集;
- 功能匹配(Func. Corr.):基于FunKPoint数据集;
- 相对反射率(Rel. Refl.):基于MID数据集;
- 视觉相似度(Vis. Sim.):基于DreamSim数据集。
所有数据集仅构建问答对样本
5.1.2 基础模型与对比基线
- 主干模型:Qwen2.5-VL-3B-Instruct、Qwen3-VL-4B-Instruct、LLaVA-OneVision-1.5-4B-Instruct;
- 对比基线
- Zero-shot:无微调;
- Direct SFT:标准有监督微调(核心基线,无额外视觉监督);
- 前沿方法基线:基于隐式Token的视觉推理方法。
5.2 单任务微调

- 整体性能:LIVR平均准确率均显著超越Direct SFT:
- Qwen2.5-VL-3B:平均提升6.24%,9项任务全部上涨;
- Qwen3-VL-4B:平均提升3.43%;
- LLaVA-OneVision-1.5-4B:平均提升5.60%;
- 在拼图、功能匹配等复杂抽象视觉任务上提升最突出:拼图任务提升12%,功能匹配任务最高提升13.02%;这类任务传统显式监督方法效果差
LIVR对复杂、难标注的视觉任务适配性最强
5.3 多任务微调

-
主干模型:选用综合性能最强的Qwen3-VL-4B-Instruct;
-
任务组合:选取6项任务(计数、定位、视觉匹配、语义匹配、功能匹配、相对反射率),每任务1000条样本,总计6000条混合训练集;
-
对比基线:LIVR在6项任务上全部超越Direct SFT,整体平均准确率提升2.77%;
LIVR天然适配多任务指令微调场景,是轻量化、通用型的视觉推理增强方案。
5.4 与主流方法对比

- 任务:SAT Val:空间方位推理验证集,三维空间位置判断类任务;
BLINK-3:精细视觉空间关系基准;
RoboSpatial:机器人场景空间理解任务。
数值越高,代表模型空间推理能力越强。 - 基线方法:
+SFT direct:仅做监督微调,直接输出答案;
+Vanilla GRPO:在 SFT 基础上增加强化学习 GRPO 优化;
Text-CoT:文本形式思维链推理,依靠文字分步推导空间关系;
ViGoRL-3B:前沿视觉强化学习基线模型。

- 评测数据集
MMVP:多模态视觉感知综合评测集,覆盖视觉识别、细节理解、多图对比等通用视觉任务;
V*:视觉细粒度推理基准,侧重图像细节逻辑判断;
BLINK-5:高阶精细空间关系推理数据集,数值越高代表空间定位、相对位置判断能力越强。 - 对比基线
PAPO、Vision-R1:两类经典视觉强化学习优化方案;
PixelReasoner:像素级视觉推理模型,聚焦图像像素层面特征挖掘;
LVR-7B:本文 LIVR 方法的前置对照模型,同架构未加入瓶颈注意力掩码改进。
5.5 消融实验
5.5.1 模块有效性消融(核心组件验证)

设置多组对照,拆分“潜在Token”与“视觉瓶颈”两大核心模块:
- 仅添加潜在Token(无视觉瓶颈):性能与Direct SFT基本持平,证明单纯增加参数无法提升效果,必须配合瓶颈约束;
- 仅视觉瓶颈(无潜在Token):性能小幅提升,但远低于完整LIVR,证明原有文本Token难以承担复杂视觉表征任务;
- 重复图像Token(对照组):翻倍图像输入Token,模拟“增加视觉参数”,性能无提升;
- 结论:潜在Token + 视觉瓶颈两个模块缺一不可,是LIVR性能提升的核心来源。
5.5.2 注意力掩码策略消融

测试3种掩码规则,验证本文默认掩码的合理性:
- 仅屏蔽答案直接Token访问图像:视觉信息可通过提示Token泄露,瓶颈失效,性能大幅下降;
- 完整掩码(同时屏蔽答案+提示词访问图像):性能最优;
- 额外限制潜在Token访问:约束过强,潜在Token无法理解任务指令,性能下降;
- 结论:本文设计的双重掩码规则是最优约束方案。
5.5.3 两阶段训练轮次配比消融

固定总轮次为10,调整阶段1/阶段2轮次组合:
- 纯阶段2(0+10):等同于仅加Token,性能差;
- 高比例阶段1(8+2):潜在Token训练充分,但融合训练不足,性能下降;
- 最优配比(4+6):兼顾视觉表征学习与特征融合,准确率最高;
- 结论:4:6的轮次分配为最佳平衡。
5.5.4 潜在Token数量 K K K消融

测试 K = 4 、 8 、 16 、 32 K=4、8、16、32 K=4、8、16、32四种取值:
- K = 4 / 8 K=4/8 K=4/8:参数量不足,视觉表征能力弱;
- K = 16 K=16 K=16:表达能力与训练难度平衡,性能峰值;
- K = 32 K=32 K=32:Token数量过多,注意力分散,模型难以有效利用,性能回落;
- 结论:默认 K = 16 K=16 K=16为最优超参数。
6.个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)