CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion
文章目录
CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion
论文题目:CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion
论文链接:https://arxiv.org/pdf/2601.08619
代码链接:https://github.com/Sevryy/CtrlFuse
发表年份:AAAI 2026
引言
本文的核心出发点是弥补现有红外与可见光图像融合方法在语义可控性和下游任务适配性上的不足,构建一个能通过交互引导实现动态语义感知的融合框架。
- 可见光图像提供丰富纹理和色彩,但弱光下性能衰减;红外图像通过热成像弥补弱光缺陷,却缺乏目标纹理信息。
- 现有方法存在两大核心局限:
- 传统方法聚焦像素级融合质量(如清晰度、一致性),忽视融合结果对下游视觉任务(如语义分割、目标检测)的适配性;
- 近年的任务驱动方法虽将融合网络与下游任务(检测 / 分割)联合优化,但仅能隐式学习固定语义类别,无法根据实际需求动态关注特定目标,缺乏交互可控性。
- 现实场景(如搜救、无人车导航)需要融合模型能针对性增强指定目标(如车辆、行人)的语义信息,而现有方法难以满足这种动态调整需求。
核心创新点
- 提出掩码提示引导的交互式可控融合框架,突破传统融合的固定语义约束,实现按需求动态聚焦目标的可控融合。
- 设计参考提示编码器(RPE),结合模态特征与掩码提示,为SAM生成适配红外/可见光的高质量动态语义提示向量。
- 设计提示语义融合模块(PSFM),实现语义提示与多模态特征的显式融合,针对红外、可见光做模态专属的目标区域特征增强。
- 构建融合-分割并行分支的协同优化机制,端到端联合优化融合损失与分割损失,实现融合质量和下游分割任务性能的相互增强。
- 首次将SAM的语义感知能力与掩码提示结合,建立低阶图像融合与高阶场景理解的动态交互,提升融合模型的实际场景适配性。
方法


Reference Prompt Encoder
F t = AveragePool ( P r o m p t m ⋅ F i r ) (1) F_t = \text{AveragePool}(Prompt_m \cdot F_{ir}) \tag{1} Ft=AveragePool(Promptm⋅Fir)(1)
先把掩码提示 P r o m p t m Prompt_m Promptm 和红外特征 F i r F_{ir} Fir 做逐元素相乘(Hadamard product),只保留掩码区域的特征;再对结果做平均池化,得到目标区域的整体特征表示 F t F_t Ft。
F s u p p = Conv ( Concat ( F i r , F t ) ) (2) F_{supp} = \text{Conv}(\text{Concat}(F_{ir}, F_t)) \tag{2} Fsupp=Conv(Concat(Fir,Ft))(2)
把红外特征 F i r F_{ir} Fir 和目标特征 F t F_t Ft 拼接,再经过卷积层,得到支持特征 F s u p p F_{supp} Fsupp。这一步将目标局部信息融入全局红外特征,形成 “支持特征”,用于后续注意力计算。
F q r y = Conv ( Concat ( F r e f , F t ) ) (3) F_{qry} = \text{Conv}(\text{Concat}(F_{ref}, F_t)) \tag{3} Fqry=Conv(Concat(Fref,Ft))(3)
把参考特征 F r e f F_{ref} Fref(红外 + 可见光拼接特征)和目标特征 F t F_t Ft 拼接,再经过卷积层,得到查询特征 F q r y F_{qry} Fqry。这一步将目标局部信息融入全局参考特征,形成 “查询特征”,用于后续注意力计算。
Q ′ = SelfAttn 1 ( CrossAttn 1 ( Q , F s u p p ) ) (4) Q' = \text{SelfAttn}_1(\text{CrossAttn}_1(Q, F_{supp})) \tag{4} Q′=SelfAttn1(CrossAttn1(Q,Fsupp))(4)
先用可学习查询 Q Q Q 对支持特征 F s u p p F_{supp} Fsupp 做交叉注意力,再对结果做自注意力,得到增强后的查询 Q ′ Q' Q′。这一步让查询 Q Q Q 从支持特征中提取目标相关信息,并进一步提炼内部关联。
P ′ = SelfAttn 2 ( CrossAttn 2 ( Q ′ , F q r y ) ) (5) P' = \text{SelfAttn}_2(\text{CrossAttn}_2(Q', F_{qry})) \tag{5} P′=SelfAttn2(CrossAttn2(Q′,Fqry))(5)
用增强后的查询 Q ′ Q' Q′ 对查询特征 F q r y F_{qry} Fqry 做交叉注意力,再对结果做自注意力,得到中间提示 P ′ P' P′。这一步让提示同时结合局部目标信息和全局参考信息,形成更完整的语义提示。
Prompt-Semantic Fusion Module
F s e q = Flatten ( Down ( F ) ) (6) F_{seq} = \text{Flatten}(\text{Down}(F)) \tag{6} Fseq=Flatten(Down(F))(6)
先对原始特征 F F F 做下采样(Downsample),再将其展平(Flatten)为序列格式 F s e q F_{seq} Fseq,降低计算量,并将特征转换为适合注意力机制的序列形式。
F p = M ⋅ ( U p ( V i e w ( CrossAttn ( F s e q , P ) ) ) ) (7) F^p = M \cdot \big(U_p(View(\text{CrossAttn}(F_{seq}, P)))\big) \tag{7} Fp=M⋅(Up(View(CrossAttn(Fseq,P))))(7)
- 用序列特征 F s e q F_{seq} Fseq 对提示 P P P 做交叉注意力,得到关注后的特征;
- 经过 view 变换恢复空间维度,再上采样(Upsample)到原始分辨率;
- 最后与 SAM 输出的掩码 M M M 逐元素相乘,得到增强后的目标特征 F p F^p Fp。
目的: 让图像特征在提示和掩码的引导下,只增强指定目标区域的信息
实验

将CtrlFuse和其他 8 种最新融合算法,在 3 个不同数据集上比效果CtrlFuse,结果证明它在绝大多数指标上都达到最优或接近最优,说明它的融合效果比现有方法更清晰、更准确、信息保留更完整。
MSE:误差 PSNR:清晰度 Q_abf:融合质量 N_abf:信息损失
SSIM:结构保留 SCD:对比度

在 MSRS 数据集上,对红外图像、可见光图像,以及各种融合方法得到的融合图像,做 ** 语义分割性能(mIoU)** 的定量对比

展示不同多模态融合方法在无人机车辆检测任务上的性能表现,CtrlFuse(Ours) 在 car、truck、bus 以及综合 All 指标上都取得了最佳性能,在 freight car 上也取得了第二好的成绩,说明该方法在无人机车辆检测任务上具有显著优势。

在 MSRS 数据集上,对 CtrlFuse 方法进行消融研究,评估不同模块移除后的性能变化。MSE:均方误差
PSNR:峰值信噪比
Q a b f Q_abf Qabf:融合质量指标
N a b f N_abf Nabf:归一化融合指标
S S I M SSIM SSIM:结构相似性
S C D SCD SCD:融合对比度
w/o Prompt:移除提示模块
w/o Seg:移除语义分割模块
w/o Vis:移除可见光模态
w/o Ir:移除红外模态
Exchange SQ:交换空间注意力与查询模块
CtrlFuse(Ours):完整方法


有无掩码提示(Mask Prompt)的消融实验视觉对比图,展示提示模块对分割结果的影响。

有无掩码提示的消融实验在目标检测任务上的可视化对比图,展示对检测精度的提升。

参考融合图像与最终融合图像的消融对比图,验证掩码提示对优化融合结果的作用。

通过掩码提示进行可控融合(CtrlFuse),可以显著提升下游语义分割模型的性能,使其能够更准确地识别和分割出关键目标,而传统的融合方法(如 SeAFusion)则容易导致下游任务出现漏检。

不同图像融合方法在两个数据集上的定性对比结果

使用 CtrlFuse 方法进行图像融合,能够为下游语义分割任务提供更高质量的输入,从而显著提升分割模型的性能,无论是在重新训练还是零样本的场景下,都优于单模态输入和其他先进融合方法。
局限性与不足
- 提示依赖强:需要人工提供掩码提示,无法自动生成或理解自然语言指令,自动化程度受限。
- 场景泛化有限:实验集中于道路车辆场景,对极端天气、复杂背景或其他模态的融合效果未充分验证。
- 依赖预训练模型:性能高度依赖 SAM 的预训练权重,级联结构导致优化和调试复杂。
- 损失函数需调参:融合与下游任务的损失权重需根据场景调整,缺乏统一最优配置。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)