01 论文信息

  • 论文题目: Beyond Strict Pairing: Arbitrarily Paired Training for
    High-Performance Infrared and Visible Image Fusion
  • 论文作者: Yanglin Deng, Tianyang Xu, Chunyang Cheng, Hui Li, Xiao-jun Wu, Josef Kittler
  • 发表单位: 江南大学人工智能与计算机学院,萨里大学视觉、语音与信号处理中心
  • 发表会议\期刊: CVPR 2026
  • 代码链接: https://github.com/yanglinDeng/IVIF_unpair

02 论文主要贡献

1.针对红外可见光图像融合任务,提出两种全新训练范式,打破对严格配对输入数据的依赖;
2.深入分析三种训练范式(SPTP/UPTP/APTP)的数据关联与训练要求;
3.全面论证新范式的优势:降低数据采集成本、扩充有效训练集、提升模型鲁棒性;
4.实验证明非配对、任意配对训练范式有效可行,所提方法性能优于现有主流算法,同时具备高效率与强泛化能力。


03 方法

3.1 损失函数设计

W(a;a,b)=aa+bW(a;a,b) = \frac{a}{a+b}W(a;a,b)=a+ba
输入 a,ba,ba,b:红外、可见光对应分支的特征量

{Pir=W(Iir;Iir,Ivis)Pvis=W(Ivis;Iir,Ivis){Gir=W(∇Iir;∇Iir,∇Ivis)Gvis=W(∇Ivis;∇Iir,∇Ivis)\begin{cases} P_{ir} = W(I_{ir};I_{ir},I_{vis}) \\ P_{vis} = W(I_{vis};I_{ir},I_{vis}) \end{cases} \quad \begin{cases} G_{ir} = W(\nabla I_{ir};\nabla I_{ir},\nabla I_{vis}) \\ G_{vis} = W(\nabla I_{vis};\nabla I_{ir},\nabla I_{vis}) \end{cases}{Pir=W(Iir;Iir,Ivis)Pvis=W(Ivis;Iir,Ivis){Gir=W(Iir;Iir,Ivis)Gvis=W(Ivis;Iir,Ivis)
Pir,PvisP_{ir},P_{vis}Pir,Pvis为双模态亮度自适应权重。
Gir,GvisG_{ir},G_{vis}Gir,Gvis 为梯度域自适应权重。

{Sir=W(SSIM(Iir,O);SSIM(Iir,O),SSIM(Ivis,O))Svis=W(SSIM(Ivis,O);SSIM(Iir,O),SSIM(Ivis,O))\begin{cases} S_{ir} = W\big(SSIM(I_{ir},O); SSIM(I_{ir},O), SSIM(I_{vis},O)\big) \\ S_{vis} = W\big(SSIM(I_{vis},O); SSIM(I_{ir},O), SSIM(I_{vis},O)\big) \end{cases}{Sir=W(SSIM(Iir,O);SSIM(Iir,O),SSIM(Ivis,O))Svis=W(SSIM(Ivis,O);SSIM(Iir,O),SSIM(Ivis,O))
O:网络输出融合图像;SSIM(X,O)SSIM(X,O)SSIM(X,O) 为源图与融合图的结构相似度;Sir,SvisS_{ir},S_{vis}Sir,Svis为结构保真权重。

Lint=1HW∥O−(Pir⋅Iir+Pvis⋅Ivis)∥1\mathcal{L}_{int} = \frac{1}{HW} \left\| O - \left(P_{ir} \cdot I_{ir} + P_{vis} \cdot I_{vis}\right) \right\|_1Lint=HW1O(PirIir+PvisIvis)1

Lgrad=1HW∥∇O−(Gir⋅∇Iir+Gvis⋅∇Ivis)∥1\mathcal{L}_{grad} = \frac{1}{HW} \left\| \nabla O - \left(G_{ir} \cdot \nabla I_{ir} + G_{vis} \cdot \nabla I_{vis}\right) \right\|_1Lgrad=HW1O(GirIir+GvisIvis)1

Lssim=∥1−(Sir⋅SSIM(Iir,O)+Svis⋅SSIM(Ivis,O))∥1\mathcal{L}_{ssim} = \left\| 1 - \left(S_{ir} \cdot SSIM(I_{ir},O) + S_{vis} \cdot SSIM(I_{vis},O)\right) \right\|_1Lssim=1(SirSSIM(Iir,O)+SvisSSIM(Ivis,O))1

CNN / Transformer
LC=LT=Lint+αLgrad+βLssim\mathcal{L}_C = \mathcal{L}_T = \mathcal{L}_{int} + \alpha \mathcal{L}_{grad} + \beta \mathcal{L}_{ssim}LC=LT=Lint+αLgrad+βLssim
GAN 生成器还要结合对抗损失
LG=Lint+αLgrad+βLssim−λLadv\mathcal{L}_G = \mathcal{L}_{int} + \alpha \mathcal{L}_{grad} + \beta \mathcal{L}_{ssim} - \lambda \mathcal{L}_{adv}LG=Lint+αLgrad+βLssimλLadv

3.2 传统严格配对红外可见光融合范式

Xir⊆RH×W×C, Xvis⊆RH×W×C, O⊆RH×W×CX^{ir} \subseteq \mathbb{R}^{H \times W \times C},\ X^{vis} \subseteq \mathbb{R}^{H \times W \times C},\ O \subseteq \mathbb{R}^{H \times W \times C}XirRH×W×C, XvisRH×W×C, ORH×W×C

将各损失项视为独立概率分布,联合概率可等价为融合任务的优化目标(以 CNN 模型为例),⋅\cdot 是简写,p代表给定红外、可见光原图,输出融合图 O 在某维度符合预期的概率,arg⁡max⁡θ\arg\max_{\theta}argmaxθ表示遍历所有网络参数找到能使后面括号内整体数值最大的那一组参数:
arg⁡max⁡θ(log⁡pint(O∣⋅)+log⁡pgrad(O∣⋅)+log⁡pssim(O∣⋅))∝arg⁡max⁡θlog⁡p(O∣Xir,Xvis;θ)\arg\max_{\theta} \big(\log p_{int}(O|\cdot) + \log p_{grad}(O|\cdot) + \log p_{ssim}(O|\cdot)\big) \propto \arg\max_{\theta} \log p(O|X^{ir},X^{vis};\theta)argmaxθ(logpint(O)+logpgrad(O)+logpssim(O))argmaxθlogp(OXir,Xvis;θ)

最大化联合对数概率等价于最小化总损失:
arg⁡max⁡θlog⁡p(O∣⋅)  ⟺  arg⁡min⁡θ(αLint+βLgrad+Lssim)\arg\max_{\theta} \log p(O|\cdot) \iff \arg\min_{\theta} \big(\alpha \mathcal{L}_{int} + \beta \mathcal{L}_{grad} + \mathcal{L}_{ssim}\big)argmaxθlogp(O)argminθ(αLint+βLgrad+Lssim)

结合贝叶斯定理,可将优化目标拆解为似然项(融合图能还原源图像的概率)与先验项(融合图符合自然图像分布的概率):
arg⁡max⁡θ(log⁡p(Xir,Xvis∣O;θ)+log⁡p(O;θ))\arg\max_{\theta} \big(\log p(X^{ir},X^{vis}|O;\theta) + \log p(O;\theta)\big)argmaxθ(logp(Xir,XvisO;θ)+logp(O;θ))

p代表给定融合像素,对应红外、可见光像素出现的概率。逐元素形式如下:
arg⁡max⁡θ∑i=j=1N(log⁡p(xiir,xjvis∣oij;θ)+log⁡p(oij;θ))\arg\max_{\theta} \sum_{i=j=1}^{N} \Big( \log p(x_i^{ir},x_j^{vis}|o_{ij};\theta) + \log p(o_{ij};\theta) \Big)argmaxθi=j=1N(logp(xiir,xjvisoij;θ)+logp(oij;θ))
式中xiir∈Xir, xjvis∈Xvis, oij∈Ox_i^{ir} \in X^{ir},\ x_j^{vis} \in X^{vis},\ o_{ij} \in OxiirXir, xjvisXvis, oijO

3.3 任意配对红外可见光融合范式推导

非配对下红外、可见光像素相互独立,联合分布拆解为两个单模态分布乘积:p(xiir,xjvis)=p(xiir)⋅p(xjvis)p \big(x_i^{ir}, x_j^{vis}\big) = p \big(x_i^{ir}\big) \cdot p \big(x_j^{vis}\big)p(xiir,xjvis)=p(xiir)p(xjvis)

基于逐像素贝叶斯目标式,代入独立分布假设改写得到任意配对优化目标式 ,oij′o'_{ij}oij:任意配对模式下,融合图像在像素坐标(i,j)(i,j)(i,j)处的输出像素:
arg⁡max⁡θ∑∀i,jN(log⁡p(xiir∣oij′;θ)+log⁡p(xjvis∣oij′;θ)+log⁡p(oij′;θ))∝arg⁡max⁡θ∑∀i,jNlog⁡p(oij′∣xiir,xjvis;θ)\arg\max_{\theta} \sum_{\forall i,j}^{N} \Big( \log p\big(x_i^{ir} | o'_{ij};\theta\big) + \log p\big(x_j^{vis} | o'_{ij};\theta\big) + \log p\big(o'_{ij};\theta\big) \Big) \propto \arg\max_{\theta} \sum_{\forall i,j}^{N} \log p\big(o'_{ij} | x_i^{ir},x_j^{vis};\theta\big)argmaxθi,jN(logp(xiiroij;θ)+logp(xjvisoij;θ)+logp(oij;θ))argmaxθi,jNlogp(oijxiir,xjvis;θ)

DAPTP=DSPTP∪DUPTP,{DSPTP={(xi,xj)∣i=j}DUPTP={(xi,xj)∣i≠j}\mathcal{D}_{APTP} = \mathcal{D}_{SPTP} \cup \mathcal{D}_{UPTP},\quad \begin{cases} \mathcal{D}_{SPTP} = \{(x_i,x_j) \mid i = j\} \\ \mathcal{D}_{UPTP} = \{(x_i,x_j) \mid i \neq j\} \end{cases}DAPTP=DSPTPDUPTP,{DSPTP={(xi,xj)i=j}DUPTP={(xi,xj)i=j}
任意配对全集,传统范式严格对齐配对,本文非配对子集

3.4 任意配对训练范式详解

3.4.1 工作机制

图像融合模型的参数更新完全依赖自定义监督信号。传统严格配对范式的损失值,由时空完全一致的图像像素计算得到;而本文任意配对范式解除了时空拍摄条件一致的约束,依靠像素级监督,即可利用任意跨模态图像构建监督信号。
只要损失函数与训练策略不强制要求双模态图像内容一致(严格配对)或内容完全无关(非配对),任意配对数据就不会影响模型学习融合能力。损失函数仅依靠像素组合完成计算,不同配对形式(对齐 / 非对齐)会为损失计算提供不同的数据关系,均可为模型提供有效的像素级监督。

3.4.2 核心优势

从理论上证明:规模为N的基础配对数据集,通过全组合配对可将有效训练样本扩充至N2N^2N2组,严格配对与非配对样本比例为1:(N−1)1:(N-1)1:(N1)。该范式具备三大核心优势:
小数据集扩容:即便初始训练数据量极少,也能通过自由配对实现样本数量指数级扩充;
丰富特征关联:大幅增加数据集内部的跨模态关联特征,提升模型鲁棒性;
降低采集成本:尤其适用于复杂场景、稀有场景的数据采集工作。


04 实验分析

4.1 实验设置

实验数据集:MSRS、M3FD、LLVIP、RoadScene、TNO;
评价指标:采用无参考指标信息熵(EN),以及全参考指标互信息(MI)、视觉信息保真度(VIFF)、(Q^{AB/F})、结构相似性(SSIM),从融合图像本身、融合图与源图的差异两个维度综合评估图像质量;
实验环境:Linux 服务器,NVIDIA RTX 3090 GPU;
超参数:统一设置α\alphaα=1,β\betaβ=0.2,λ\lambdaλ=0.01。

4.2 非配对、任意配对范式可行性验证

在这里插入图片描述
在这里插入图片描述
实验结果表明:在五项评价指标上,两种训练范式的模型性能几乎持平;基于 Transformer 的非配对模型,性能甚至小幅超越严格配对模型。可视化结果也证明:非配对模型输出图像能够保留更丰富的模态专属细节,画面清晰度与严格配对模型相当。

4.3 与现有主流算法(SOTA)对比

为充分验证所提训练范式与损失函数的优越性,本文选取 MSRS、M3FD 共 150 组图像作为基础数据,通过任意配对扩充至 15000 组训练三组基线模型,并与近年顶级会议 / 期刊的主流融合算法,在 LLVIP、MSRS、RoadScene、TNO 四大数据集上进行对比。

在这里插入图片描述

量化结果表明:本文三类基线模型在所有测试集上的各项指标均全面领先现有 SOTA 方法;在未见数据集上的优异表现,充分证明模型具备极强的泛化能力,同时也验证了损失函数设计的有效性。


05 个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐