SPGFusion:基于预训练视觉模型的语义先验引导红外与可见光图像融合

SPGFusion: Semantic Prior Guided Infrared and visible image fusion via pretrained vision models

作者: Huiqin Zhang, Shihan Yao, Jiayi Ma, Junjun Jiang, Yanduo Zhang, Huabing Zhou
发表期刊: Information Fusion
论文地址: https://www.sciencedirect.com/science/article/pii/S1566253525005068

摘要 图像融合将同一场景的多幅图像整合成一幅增强图像,提升视觉清晰度并支持高层视觉任务。现有的红外-可见光图像融合方法虽然增加了语义细节,但严重依赖标注数据,限制了灵活性,且无法捕获不同模态下不同物体的独特特征——这些特征对人类感知至关重要。这些局限性阻碍了有效的自适应融合。为此,我们提出SPGFusion:一种无需人工标注的语义先验引导的红外与可见光图像融合方法。SPGFusion利用CLIP的全局语义对齐能力,将视觉特征与人类自然语言知识相关联,从而全面理解图像的全局语义结构。同时,DINO聚合语义相似特征的能力捕获了细粒度的局部语义细节。全局与局部语义先验的互补组合使模型能够对源图像实现全面、细致且无标签的语义理解,有效克服了现有方法遇到的标注依赖问题。这些先验通过一个专门设计的语义自适应融合网络来引导融合过程,实现自适应的、语义感知的融合,突出模态特有特征。最后,视觉特征解码器合成融合图像,捕获来自每个源图像的关键语义细节。通过利用鲁棒的无标签语义先验,SPGFusion获得了对红外与可见光源图像更深层次的理解,从而能够自适应地融合跨模态的基本特征。在公开数据集上的广泛评估表明,SPGFusion在视觉质量和语义准确性方面均优于当前最先进的方法。源代码可在 https://github.com/Huiqin-Zhang/SPGFusion 获取。

1.引言

由于理论与技术上的局限,可见光图像和红外图像均无法单独全面描述成像场景[1–3]。可见光图像能捕获丰富的纹理细节,但对光照变化敏感;红外图像能提供不受光照影响的热信息,却缺乏足够的纹理。图像融合旨在自适应地整合这两种模态的互补特征,融合语义信息以增强人类感知并支持高层视觉任务。通过结合可见光与红外图像各自的优势,融合过程可生成信息更丰富的图像,从而提升人与机器对场景的理解。该方法已被广泛应用于目标跟踪[4–6]、目标检测[7,8]和安全监控[9]等领域。然而,实现真正能够捕获高层语义信息的自适应融合仍具挑战。
在这里插入图片描述

近年来,图像融合研究聚焦于增强高层语义表示。现有的语义驱动方法[13,14]通过与高层任务联合训练来丰富语义信息。但这类方法依赖用于语义分割和目标检测的标注数据,需要对目标区域进行人工标注[15]。该标注过程劳动密集、耗时且容易出现质量不一致问题[16]。此外,联合训练策略的设计欠优,以及两个子网络难以同步收敛至各自最优状态,限制了模型的性能与灵活性[17–19],从而阻碍了面向不同语义目标的自适应融合。如图1(a)所示,TarDAL[10]方法使用仅关注红外热目标的检测标签进行训练,对于标注范围之外的语义对象(如文字和摩托车),其融合性能明显下降。尽管SegMiF[11]和MRFS[12]所使用的分割标签覆盖了更广泛的目标类别,但不可控的标注质量仍会阻碍自适应语义融合,产生不够直观的融合结果。相比之下,我们的自适应融合利用了对源图像语义比人工标注更深入的理解,模拟人类对关键细节的关注方式。模型根据目标特性动态调整特征侧重——例如,增强摩托车车轮的红外辐射模式,同时保留摩托车车身的可见光纹理细节,突显可见光光谱中的文字信息,并对行人实现热特征与颜色纹理的协同整合。因此,如图1(b)所示,本方法能够生成更清晰且语义一致性更强的融合图像。实现这种自适应、语义感知的融合,需要对源图像具有深刻的理解。

为实现该层次的自适应融合,我们利用具有强大语义理解能力的大规模预训练视觉模型(PVMs)。预训练视觉模型的出现已为多个计算机视觉领域带来变革[20–22]。具体而言,CLIP[23]将视觉特征与人类自然语言知识对齐,增强了全局语义理解,从而改进了目标检测[24]和语义分割[25]等任务。同时,DINO[26]擅长聚合语义相似的特征,能够提取细粒度的局部特征,这对无监督目标发现[27,28]至关重要。认识到这些互补的优势,我们提出利用CLIP进行宏观层面的理解,并利用DINO捕获精细纹理,从而构建全局与局部语义先验来引导融合过程。借助这些先验,我们的模型能够自适应地提取不同图像模态间具有语义意义的特征。

为此,我们提出SPGFusion,一种新颖的语义先验引导的红外与可见光图像融合方法。SPGFusion巧妙地将图像融合技术与两个前沿视觉组件相结合——利用CLIP的跨模态语义对齐能力和DINO的细粒度自监督特征聚类特性——创造性地构建复合语义先验,同时捕获全局语义布局与局部判别性纹理。在该复合语义先验的引导下,融合网络能够在保持局部细节纹理的同时,增强目标的显著性,从而提升融合图像的语义完整性。这一方法为解决当前融合研究在无标签条件下缺乏鲁棒语义引导的难题提供了新的方案。此外,我们精心设计了语义自适应融合网络,融合了通用语义自适应融合(CSAF)模块和深层语义自适应融合(PSAF)模块。CSAF利用空间调制实现自适应多模态融合,而PSAF引入跨模态注意力以实现更深层次的语义集成。得益于这种协同整合,这些模块协同运作,能够针对不同语义对象动态调整模态特有信息,实现精确且上下文感知的融合。该方法减少了对人工标签的依赖,并增强了多模态信息的自适应整合能力。

总体而言,本文的贡献可总结如下:
• 我们提出SPGFusion,一种新颖的图像融合方法,创新性地将CLIP和DINO等预训练视觉模型(PVMs)引入图像融合领域,引入了鲁棒的无标签语义先验。这一整合使SPGFusion克服了传统融合方法依赖人工标签、难以对具有多样语义特性的对象进行自适应融合的局限。
• 为有效利用这些新颖的复合语义先验,我们设计了语义自适应融合网络,包含通用语义自适应融合(CSAF)和深层语义自适应融合(PSAF)模块。这些模块利用空间调制和跨模态注意力,动态调整模态特有信息,实现上下文感知的语义自适应融合,突显每种模态的独有特征。
• 全面的实验表明,SPGFusion在视觉质量和高层视觉任务有效性方面,均显著超越最先进的融合算法,同时显著降低了对人工标注的依赖。

2.相关工作

2.1. 基于深度学习的融合方法

近年来,基于深度学习的图像融合方法因神经网络强大的能力而受到极大关注[29]。早期的融合策略主要使用卷积神经网络。例如,DenseFuse [30]采用密集连接的卷积结构,通过数据驱动的加权机制来平衡纹理与热信息。随后,生成对抗网络(GAN)被引入以应对图像融合任务中真值缺失的问题。FusionGAN [31]首次采用基于GAN的方法,使用单一判别器促使生成器保留可见光图像的纹理细节。在此基础上,GIDGAN [32]、SDDGAN [33]和IDFFN [34]等方法采用双判别器来缓解模态不平衡。近期,基于Transformer的解决方案也得到了探索。ITFuse [35]融合了交替式特征交互与重建模块,结合残差和跨模态注意力,交替捕获并融合显著信息。特别针对配准误差场景,C2RF [36]通过共性挖掘和对比学习桥接配准与融合;将未对齐的输出视为硬负样本,联合优化形变场与聚合特征,显著减少了鬼影伪影。此外,EAT [37]将Transformer-对抗范式扩展到多曝光图像融合,生成色彩保真的结果。同时,可解释的融合网络如CAMF [38]利用类激活映射学习通道级重要性权重,选择性地保留显著目标和纹理,同时提供清晰的事后可解释性。最近,基于扩散模型的方法也取得了显著进展。DIFF-IF [39]利用条件扩散模型与融合知识先验,在多模态数据上取得了令人瞩目的成果。
尽管上述图像融合方法在提升视觉质量和客观指标方面取得了显著进步,但在适应下游任务和提取关键语义信息方面仍面临挑战。为提高融合结果的适用性并弥合语义鸿沟,面向任务的红外-可见光图像融合范式应运而生。语义驱动方法[10–12,14,40]通过将融合网络与分割或检测网络级联来整合语义信息,从而提升下游性能。然而,即使是这些面向任务的IVIF方法,通常也需要特定的架构或训练策略[17];这限制了其在不同应用中的灵活性和泛化能力,且它们仍难以保留更丰富的语义线索。

2.2. 基于预训练视觉模型的图像融合

得益于大规模数据集[41]和精心设计的预训练策略[42],预训练视觉模型(PVMs)在分类[43]、视觉-语言任务[44]和生成任务[45]等领域展现出巨大潜力。这一进展为图像融合研究开辟了新途径。为在融合领域充分发挥PVM的能力,已有若干研究开始探索基于PVM的框架。例如,Text-IF [21]针对多种退化条件下的红外与可见光图像融合,利用CLIP [23]提取与场景或退化类型相关的文本特征,再与图像特征结合以增强显著细节并抑制噪声。类似地,FILM [46]提出了一种由BLIP [47]的深层文本语义引导的通用融合框架,以促进多源图像融合。此外,SAGE [48]利用来自SAM [49]的分割和检测先验,将更精细的空间布局和目标信息融入多模态图像融合,进一步丰富了融合结果的语义表现力。
然而,尽管上述方法展示了有前景的融合效果,仍存在若干挑战。Text-IF和FILM均仅专注于利用视觉-语言模型提供的深层文本语义来引导融合过程,却忽视了PVM中固有的视觉特征的关键作用,这些特征编码了丰富的语义线索和类人的图像内容感知。这些视觉表示对于实现自适应、语义感知的融合至关重要。此外,虽然SAGE强调使用视觉先验,但它仍缺乏灵活有效的自适应融合机制来动态利用这些先验以选择最优融合策略。为解决这些局限性,我们旨在将CLIP和DINO独特的语义提取优势融入图像融合。具体而言,CLIP通过在海量视觉-语言对上进行的对比学习训练,擅长提取文本和全局图像特征,实现了鲁棒的语义对齐。同样,DINO通过无监督的教师-学生框架训练,无需标注数据集,能够捕获细粒度纹理并展现出强大的局部空间语义。其保留细节特征的能力使其非常适合需要精细空间理解的任务。通过结合CLIP的全局语义理解与DINO的局部细节捕获,我们从高层语义视角引导模型学习自适应融合策略。

3.本文方法

3.1. 整体框架

在这里插入图片描述

我们的SPGFusion整体框架如图2所示。它包含三个主要部分:语义先验生成、语义自适应融合网络和视觉特征解码器。首先,在语义先验生成阶段,SPGFusion利用预训练的CLIP和DINO特征提取器处理红外与可见光图像,获得两组语义特征。基于DINO提取的特征块之间的相似性,计算亲和力图,并随后用于对CLIP特征进行相关性池化,生成融合了全局与局部线索的语义先验。这些先验随后用于语义自适应融合网络,其中通用语义自适应融合(CSAF)模块和深层语义自适应融合(PSAF)模块引导融合过程,自适应地调制来自红外和可见光输入的模态特有特征。这种自适应融合增强了融合图像的语义连贯性和细节保持。最后,视觉特征解码器将融合特征重建为最终输出图像。后续小节将对每个组成部分进行详细讨论。

3.2. SPGFusion模型

语义先验生成。该部分负责从配对的可见光与红外图像生成语义先验。具体而言,我们利用参数冻结的预训练视觉模型CLIP和DINO,分别从可见光和红外输入中提取视觉特征。该过程如下:
{Fvic,Firc}={θc(Ivi),θc(Iir)},(1) \{F^{\mathrm{c}}_{\mathrm{vi}}, F^{\mathrm{c}}_{\mathrm{ir}}\} = \{\theta_{\mathrm{c}}(I_{\mathrm{vi}}), \theta_{\mathrm{c}}(I_{\mathrm{ir}})\}, \tag{1} {Fvic,Firc}={θc(Ivi),θc(Iir)},(1)

{Fvid,Fird}={θd(Ivi),θd(Iir)},(2) \{F^{\mathrm{d}}_{\mathrm{vi}}, F^{\mathrm{d}}_{\mathrm{ir}}\} = \{\theta_{\mathrm{d}}(I_{\mathrm{vi}}), \theta_{\mathrm{d}}(I_{\mathrm{ir}})\}, \tag{2} {Fvid,Fird}={θd(Ivi),θd(Iir)},(2)

其中 θc\theta_{\mathrm{c}}θcθd\theta_{\mathrm{d}}θd 分别表示CLIP和DINO的图像编码器。可见光图像和红外图像分别用 IviI_{\mathrm{vi}}IviIirI_{\mathrm{ir}}Iir 表示。特征 FvicF^{\mathrm{c}}_{\mathrm{vi}}FvicFircF^{\mathrm{c}}_{\mathrm{ir}}Firc 从CLIP最后一个注意力层的值嵌入中提取,选自查询、键、值三种嵌入,并移除CLS token。同样地,FvidF^{\mathrm{d}}_{\mathrm{vi}}FvidFirdF^{\mathrm{d}}_{\mathrm{ir}}Fird 从DINO最后一个注意力层的值嵌入中获得,同样丢弃CLS token。所有提取的语义特征具有统一的维度 768×H/16×W/16768 \times H/16 \times W/16768×H/16×W/16,其中 HHHWWW 表示输入图像的空间尺寸。然后,我们提出通过相关性池化将来自CLIP和DINO的语义特征相结合。为便于后续描述与公式表达,我们将来自CLIP的可见光与红外特征统称为 FcF^{\mathrm{c}}Fc(包含 FvicF^{\mathrm{c}}_{\mathrm{vi}}FvicFircF^{\mathrm{c}}_{\mathrm{ir}}Firc),将来自DINO的特征统称为 FdF^{\mathrm{d}}Fd(包含 FvidF^{\mathrm{d}}_{\mathrm{vi}}FvidFirdF^{\mathrm{d}}_{\mathrm{ir}}Fird)。
在这里插入图片描述

为结合DINO特征 FdF^{\mathrm{d}}Fd 与CLIP特征 FcF^{\mathrm{c}}Fc 的能力,受文献[22]启发,我们首先计算 FdF^{\mathrm{d}}Fd 中每对块之间的余弦相似度,生成亲和力图 ξ\xiξ,用于量化局部区域之间的语义一致性。在该亲和力图的引导下,我们对 FcF^{\mathrm{c}}Fc 特征跨空间块进行概念感知的线性组合。这种相关性池化策略起到投票机制的作用,强制语义相似块之间的特征一致性,同时抑制噪声响应,从而生成融合了全局上下文与局部空间感知的新颖语义特征 FcdF^{\mathrm{cd}}Fcd。相关性池化操作的形式化定义为:

Fcd=∑i,jξi,j⋅Fi,jc∑i,jξi,j+ε,(3) F^{\mathrm{cd}} = \frac{\sum_{i,j} \xi_{i,j} \cdot F^{\mathrm{c}}_{i,j}}{\sum_{i,j} \xi_{i,j} + \varepsilon}, \tag{3} Fcd=i,jξi,j+εi,jξi,jFi,jc,(3)

其中 Fi,jcF^{\mathrm{c}}_{i,j}Fi,jc 表示 FvicF^{\mathrm{c}}_{\mathrm{vi}}FvicFircF^{\mathrm{c}}_{\mathrm{ir}}Firc 在空间位置 (i,j)(i,j)(i,j) 的值,ξi,j\xi_{i,j}ξi,j 表示 FvidF^{\mathrm{d}}_{\mathrm{vi}}FvidFirdF^{\mathrm{d}}_{\mathrm{ir}}Fird 在同一位置的亲和力权重。该权重反映了由 (i,j)(i,j)(i,j) 索引的块之间的语义相似程度。ε\varepsilonε 是一个防止除零的小常数。为直观展示语义先验的生成过程,我们在源图像(Iir/IviI_{\mathrm{ir}}/I_{\mathrm{vi}}Iir/Ivi)中选择空间种子位置(以红点标注),然后计算块相似度以生成三种亲和力图:基于CLIP的(Firc/FvicF^{\mathrm{c}}_{\mathrm{ir}} / F^{\mathrm{c}}_{\mathrm{vi}}Firc/Fvic)、基于DINO的(Fird/FvidF^{\mathrm{d}}_{\mathrm{ir}} / F^{\mathrm{d}}_{\mathrm{vi}}Fird/Fvid),以及它们的相关性池化融合特征(Fircd/FvicdF^{\mathrm{cd}}_{\mathrm{ir}} / F^{\mathrm{cd}}_{\mathrm{vi}}Fircd/Fvicd)。如图3所示,CLIP特征对整体语义对象(如人和树叶)呈现类别级响应,产生分布松散但目标覆盖完整的激活区域。相反,DINO特征将注意力集中在语义实体的对象边界和关节点,展示出更密集的局部激活。相关性池化融合特征实现了全局类别语义与局部细节的互补融合,有效结合了CLIP的全局语义对齐能力与DINO的细粒度判别能力。因此,它们为后续融合步骤建立了模态自适应基础,引导模型在无需显式标签的情况下,有选择地强调融合图像中的纹理细节和热强度信息。

语义自适应融合网络。在此部分,成对的可见光与红外图像被送入图像编码器。我们采用基于Transformer [50]的模块作为基础特征提取器。特征提取过程可表述如下:

{Fvi1,Fir1}={Tvi1(Ivi),Tir1(Iir)},(4) \{F^{1}_{\mathrm{vi}}, F^{1}_{\mathrm{ir}}\} = \{T^{1}_{\mathrm{vi}}(I_{\mathrm{vi}}), T^{1}_{\mathrm{ir}}(I_{\mathrm{ir}})\}, \tag{4} {Fvi1,Fir1}={Tvi1(Ivi),Tir1(Iir)},(4)

{Fvii,Firi}={Tvii(Fvii−1),Tiri(Firi−1)},(5) \{F^{i}_{\mathrm{vi}}, F^{i}_{\mathrm{ir}}\} = \{T^{i}_{\mathrm{vi}}(F^{i-1}_{\mathrm{vi}}), T^{i}_{\mathrm{ir}}(F^{i-1}_{\mathrm{ir}})\}, \tag{5} {Fvii,Firi}={Tvii(Fvii1),Tiri(Firi1)},(5)

其中 i=2,3,4i = 2, 3, 4i=2,3,4TviiT^{i}_{\mathrm{vi}}TviiTiriT^{i}_{\mathrm{ir}}Tiri 分别表示可见光与红外图像的特征提取器。对于 i=1,2,3i = 1, 2, 3i=1,2,3FviiF^{i}_{\mathrm{vi}}FviiFiriF^{i}_{\mathrm{ir}}Firi 通过CSAF模块直接融合。然而,对于 i=4i = 4i=4,融合通过我们提出的PSAF模块进行,该模块在CSAF模块之前施加交叉注意力,在其之后施加自注意力,如图2(2)所示。

考虑到深层特征封装了丰富的上下文语义信息[45],PSAF引入交叉注意力,通过交换两种模态的查询 QQQ 来增强模态间的交互。这促进了空间交互,并最大限度地利用多模态环境中的互补属性:

{Qvi,Kvi,Vvi}=Projvi(GN(Fvii)),(6) \{Q_{\mathrm{vi}}, K_{\mathrm{vi}}, V_{\mathrm{vi}}\} = \mathrm{Proj}_{\mathrm{vi}}(\mathrm{GN}(F^{i}_{\mathrm{vi}})), \tag{6} {Qvi,Kvi,Vvi}=Projvi(GN(Fvii)),(6)

{Qir,Kir,Vir}=Projir(GN(Firi)),(7) \{Q_{\mathrm{ir}}, K_{\mathrm{ir}}, V_{\mathrm{ir}}\} = \mathrm{Proj}_{\mathrm{ir}}(\mathrm{GN}(F^{i}_{\mathrm{ir}})), \tag{7} {Qir,Kir,Vir}=Projir(GN(Firi)),(7)

Fvii′=CrossAttn(Qir,Kvi,Vvi),(8) F^{i'}_{\mathrm{vi}} = \mathrm{CrossAttn}(Q_{\mathrm{ir}}, K_{\mathrm{vi}}, V_{\mathrm{vi}}), \tag{8} Fvii=CrossAttn(Qir,Kvi,Vvi),(8)

Firi′=CrossAttn(Qvi,Kir,Vir),(9) F^{i'}_{\mathrm{ir}} = \mathrm{CrossAttn}(Q_{\mathrm{vi}}, K_{\mathrm{ir}}, V_{\mathrm{ir}}), \tag{9} Firi=CrossAttn(Qvi,Kir,Vir),(9)

其中 GN(⋅)\mathrm{GN}(\cdot)GN() 表示组归一化,Proj(⋅)\mathrm{Proj}(\cdot)Proj() 表示将输入特征变换至适合注意力计算的嵌入空间的投影操作,CrossAttn(⋅)\mathrm{CrossAttn}(\cdot)CrossAttn() 表示交叉注意力机制,可实现不同输入源之间的特征交互与选择性强调。

接下来,在CSAF模块中,输入特征图 Fvii′F^{i'}_{\mathrm{vi}}FviiFiri′F^{i'}_{\mathrm{ir}}Firi 首先经过非参数的实例归一化(IN),以消除模态特有的幅度差异,并为语义调制建立共同的统计空间。受空间自适应归一化[5]启发,预训练模型产生的语义先验 FvicdF^{\mathrm{cd}}_{\mathrm{vi}}FvicdFircdF^{\mathrm{cd}}_{\mathrm{ir}}Fircd 首先通过双线性插值上采样,以匹配骨干特征图的空间分辨率,从而在每个像素与其对齐的先验向量之间建立一一对应关系。然后,如公式(10)和(11)所示,两个语义先验依次通过两个卷积,产生空间通道缩放因子 γ\gammaγ 和平移偏置 β\betaβγ\gammaγ 张量在空间位置和通道上动态调整特征幅度,较大值增强语义关键区域,同时抑制较不重要的区域,有效充当自适应融合权重。同时,β\betaβ 提供像素级偏置校准,以细化细粒度语义细节。这些空间自适应参数增强了低对比度红外目标的边缘纹理,并同时衰减可见光分支中的高频噪声,使显著目标得以凸显。最后,如公式(12)所示,归一化后的特征图首先利用这些调制张量进行逐像素仿射变换,自适应地放大关键信息(如热显著目标和纹理细节),同时衰减较不相关的成分。然后,这些变换后的特征图沿通道维度拼接,并通过卷积层产生融合特征 FiF_{i}Fi。最后,FiF_{i}Fi 通过Proj变换投影得到查询、键和值矩阵,随后进行自注意力操作,得到精炼的输出特征 Fi′F_{i}'Fi。整个过程可表述如下:

{γvi,γir}=Convγ(Conv({Fvicd,Fircd})),(10) \{\gamma_{\mathrm{vi}}, \gamma_{\mathrm{ir}}\} = \mathrm{Conv}_{\gamma}(\mathrm{Conv}(\{F^{\mathrm{cd}}_{\mathrm{vi}}, F^{\mathrm{cd}}_{\mathrm{ir}}\})), \tag{10} {γvi,γir}=Convγ(Conv({Fvicd,Fircd})),(10)

{βvi,βir}=Convβ(Conv({Fvicd,Fircd})),(11) \{\beta_{\mathrm{vi}}, \beta_{\mathrm{ir}}\} = \mathrm{Conv}_{\beta}(\mathrm{Conv}(\{F^{\mathrm{cd}}_{\mathrm{vi}}, F^{\mathrm{cd}}_{\mathrm{ir}}\})), \tag{11} {βvi,βir}=Convβ(Conv({Fvicd,Fircd})),(11)

Fi=Conv(C(γvi⊗IN(Fvii′)⊕βvi, γir⊗IN(Firi′)⊕βir)),(12) F_{i} = \mathrm{Conv}\bigl(\mathcal{C}(\gamma_{\mathrm{vi}} \otimes \mathrm{IN}(F^{i'}_{\mathrm{vi}}) \oplus \beta_{\mathrm{vi}}, \, \gamma_{\mathrm{ir}} \otimes \mathrm{IN}(F^{i'}_{\mathrm{ir}}) \oplus \beta_{\mathrm{ir}})\bigr), \tag{12} Fi=Conv(C(γviIN(Fvii)βvi,γirIN(Firi)βir)),(12)

{Qi,Ki,Vi}=Proj(Fi),(13) \{Q_{i}, K_{i}, V_{i}\} = \mathrm{Proj}(F_{i}), \tag{13} {Qi,Ki,Vi}=Proj(Fi),(13)

Fi′=SelfAttn(Qi,Ki,Vi),(14) F_{i}' = \mathrm{SelfAttn}(Q_{i}, K_{i}, V_{i}), \tag{14} Fi=SelfAttn(Qi,Ki,Vi),(14)

其中 C(⋅)\mathcal{C}(\cdot)C() 表示通道维度上的拼接操作。值得注意的是,当 FviiF^{i}_{\mathrm{vi}}FviiFiriF^{i}_{\mathrm{ir}}Firi 通过CSAF模块直接融合时(i=1,2,3i = 1, 2, 3i=1,2,3),输入为 FviiF^{i}_{\mathrm{vi}}FviiFiriF^{i}_{\mathrm{ir}}Firi,产生输出 FiF^{i}Fi,如图2(3)所示。

随后,来自PSAF的输出 Fi′F_{i}'Fi 由一个基于Transformer模块的特征解码器处理。所得特征再与上一层CSAF输出的特征图 Fi−1F_{i-1}Fi1 拼接,之后进行卷积。此操作序列重复多次,最终整合出融合视觉特征 FfuF_{\mathrm{fu}}Ffu。即:

Ffu={Conv(C(Tf(Fi′),Fi−1))}r,(15) F_{\mathrm{fu}} = \{\mathrm{Conv}(\mathcal{C}(T_{\mathrm{f}}(F_{i }'), F_{i-1}))\}_{r}, \tag{15} Ffu={Conv(C(Tf(Fi),Fi1))}r,(15)

其中 TfT_{\mathrm{f}}Tf 表示特征解码器。C(⋅)\mathcal{C}(\cdot)C() 表示沿通道维度的拼接。{⋅}r\{\cdot\}_{r}{}r 表示多级重复。需注意,为对应特征提取器执行的下采样,由 TfT_{\mathrm{f}}Tf 处理的特征需要进行上采样。

视觉特征解码器。最后,融合视觉特征经过Restormer [51]解码器,产生融合图像,记为 IfI_{f}If,即SPGFusion的最终输出。

3.3. 损失函数

在我们提出的SPGFusion框架中,采用源可见光图像 IviI_{\mathrm{vi}}Ivi、红外图像 IirI_{\mathrm{ir}}Iir 和生成的融合图像 IfI_{f}If 作为融合损失函数 Lf\mathcal{L}_{f}Lf 的输入。该损失函数由多个部分组成:结构相似性(SSIM)损失[52]、最大梯度损失、强度损失和颜色一致性损失[21]。各损失项详述如下。

结构相似性损失。我们使用结构相似性损失评估融合图像与原始源图像之间的相似性,确保融合图像保持输入图像的结构完整性。其表达式为:

Ls=(1−SSIM(If,Ivi))+(1−SSIM(If,Iir)),(16) \mathcal{L}_{s} = (1 - \mathrm{SSIM}(I_{f}, I_{\mathrm{vi}})) + (1 - \mathrm{SSIM}(I_{f}, I_{\mathrm{ir}})), \tag{16} Ls=(1SSIM(If,Ivi))+(1SSIM(If,Iir)),(16)

颜色损失。颜色损失确保融合图像与源可见光图像保持颜色信息一致性。这对保持融合图像色彩呈现的自然度和准确性至关重要,尤其是在处理色彩丰富的场景时。其表达式为:

Lc=1HW∥TCbCr(If)−TCbCr(Ivi)∥1,(17) \mathcal{L}_{c} = \frac{1}{HW} \left\| \mathcal{T}_{\mathrm{CbCr}}(I_{f}) - \mathcal{T}_{\mathrm{CbCr}}(I_{\mathrm{vi}}) \right\|_{1}, \tag{17} Lc=HW1TCbCr(If)TCbCr(Ivi)1,(17)

其中 TCbCr\mathcal{T}_{\mathrm{CbCr}}TCbCr 表示从RGB到CbCr的转换函数。所提出的颜色损失仅约束可见光图像的Cb和Cr分量,而通过不受约束的亮度(Y)通道保留红外强度信息。尽管以往融合研究因红外图像缺乏色度信息而很少采用颜色损失,但近期工作[21]表明,此类损失不仅能保持红外的亮度贡献,还能有效抑制红外在可见光谱中引起的色彩干扰。该损失最终在保持热信息保真度的同时,从色彩角度增强视觉感知。

强度损失。该损失衡量融合图像与源图像之间的像素级差异。因此,我们将强度损失定义为:

Li=1HW∥If−max⁡(Ivi,Iir)∥1,(18) \mathcal{L}_{i} = \frac{1}{HW} \left\| I_{f} - \max(I_{\mathrm{vi}}, I_{\mathrm{ir}}) \right\|_{1}, \tag{18} Li=HW1Ifmax(Ivi,Iir)1,(18)

梯度损失。梯度损失旨在通过保留两幅源图像的最大边缘,确保融合图像包含丰富的纹理信息。其表达式为:

Lg=1HW∥∇If−max⁡(∇Ivi,∇Iir)∥1,(19) \mathcal{L}_{g} = \frac{1}{HW} \left\| \nabla I_{f} - \max(\nabla I_{\mathrm{vi}}, \nabla I_{\mathrm{ir}}) \right\|_{1}, \tag{19} Lg=HW1Ifmax(Ivi,Iir)1,(19)

总损失。总损失函数为上述各项损失的加权和,公式如下:

Lf=αs⋅Ls+αc⋅Lc+αi⋅Li+αg⋅Lg,(20) \mathcal{L}_{f} = \alpha_{s} \cdot \mathcal{L}_{s} + \alpha_{c} \cdot \mathcal{L}_{c} + \alpha_{i} \cdot \mathcal{L}_{i} + \alpha_{g} \cdot \mathcal{L}_{g}, \tag{20} Lf=αsLs+αcLc+αiLi+αgLg,(20)

其中 αs\alpha_{s}αsαc\alpha_{c}αcαi\alpha_{i}αiαg\alpha_{g}αg 是控制融合损失函数各组成部分权衡的超参数。

4.实验验证

本节首先概述实现细节及相关配置。接着,从定性和定量两个角度比较不同算法在多个数据集上的融合性能。随后,给出任务驱动的评估,以评价不同融合方法在支持高层视觉任务方面的有效性。在这些评估之后,我们通过将方法应用于多聚焦图像融合场景来考察其泛化能力。最后,我们进行一系列消融实验,分析各组件的贡献。

4.1. 配置与实现细节

数据集。为验证泛化性,我们在广泛使用的可见光与红外图像融合公开数据集上对SPGFusion的融合性能进行了全面评估,包括M3FD [10](包含四种不同场景:白天、阴天、夜间以及存在遮挡、烟雾和强光照的挑战性条件)、MSRS [53](聚焦复杂城市场景)、LLVIP [54](主要为低照度道路环境)和FMB [11](包含14种语义对象且光照条件多样)。此外,我们利用MSRS和FMB数据集评估了SPGFusion在语义分割任务上的表现,并在LLVIP数据集上测试了SPGFusion在目标检测任务中的能力。这些数据集中用于测试的图像对数量分别为300、361、300和280。此外,MSRS数据集包含1083对图像用于模型训练。最后,为深入探究SPGFusion在红外-可见光融合之外的泛化能力,我们在包含120幅图像的MFI-WHU [55]多聚焦数据集上进行了评估,以探索其处理多聚焦图像融合任务的潜力。

实现细节。本文提出的SPGFusion使用PyTorch框架训练120个epoch。我们为两种输入图像采用结构相同的四级编码器,每级包含两个Transformer块[50],注意力头数逐级递增(1/2/4/8)。解码器由两个Restormer [51]块组成,用于重建最终融合图像。控制各项损失权衡的超参数根据经验设置为 αs=1\alpha_{s} = 1αs=1αc=12\alpha_{c} = 12αc=12αi=4\alpha_{i} = 4αi=4αg=10\alpha_{g} = 10αg=10。初始学习率设为0.0001,批大小为4,采用AdamW [56]优化器。源图像被裁剪为 224×224224 \times 224224×224。CLIP和DINO均采用冻结的ViT-B/16模型,在训练和推理过程中均使用丢弃CLS token后最后一个注意力层的值嵌入。这些模型分别按照OpenCLIP [57]和DINO [26]的方法进行预训练。所有实验均在配备80 GB显存的NVIDIA A800 PCIe GPU上完成,训练时的GPU显存占用约达22.9 GB。

评价指标。为定量评估融合性能,采用了六种统计评价指标,包括熵(EN)[1]、空间频率(SF)[58]、平均梯度(AG)[59]、标准差(SD)[60]、视觉信息保真度(VIF)[61]和相关系数(CC)[62]。这些指标的数值越高,表示融合性能越好。

当前最优对比方法。我们将本方法的性能与若干当前最优方法进行了比较。在图像融合和高层任务实验中,对比方法包括TarDAL [10]、DATFuse [63]、SegMiF [11]、CDDFuse [64]、PSFusion [40]、SHIP [65]、DIFF-IF [39]、MRFS [12]、FILM [46]、Text-IF [21]、SAGE [66]和LFDTFuse [67]。值得注意的是,由于FILM在LLVIP和FMB上缺乏文本数据集,以及出于布局一致性考虑,在FILM无法直接比较的实验中,选择PSFusion作为替代基线。多聚焦融合的比较涉及U2Fusion [68]、YDTR [69]和SwinFusion [70]。

4.2. 融合对比

4.2.1. 定性对比

在这里插入图片描述
在这里插入图片描述

在M3FD、FMB、LLVIP和MSRS数据集上的可视化结果分别如图4至图7所示。如图4所示,由于可见光图像过曝,DATFuse、SHIP、DIFF-IF和MRFS无法准确呈现某些元素(如绿色框内的相机),导致关键信息丢失。其他方法虽能显示相机,但不可避免地削弱了对比度和纹理细节(如红色框内的车牌),TarDAL和SegMiF尤为明显。相比之下,我们的方法能够在相机和车牌等不同语义区域动态平衡来自红外与可见光图像的互补信息,提供更全面的场景表示。类似地,在充满烟雾的环境中,大多数融合算法可以保留显著的红外目标,但无法清晰描绘隐藏在烟雾后的背景建筑。如图5所示,TarDAL利用检测任务的标注监督突出行人热特征,却忽略了背景区域(如建筑物)这类缺乏标注的部分。我们的融合结果不仅保留了行人的红外特征,还准确捕获了建筑的纹理细节。这一优势主要源于大规模视觉模型生成的全局与局部语义先验,并通过语义自适应融合网络集成到融合过程中。因此,即使在无标签条件下,模型也能实现对多模态源图像的全面语义理解,从而自适应地融合来自两种模态的最关键特征。

此外,LLVIP和MSRS上的可视化结果进一步验证了本方法在融合性能上的优越性。如图6所示,我们的SPGFusion在夜间条件下有效结合了可见光纹理细节与红外热信号。例如,行人的面部特征(绿色框)和地面纹理(红色框)展现出显著的清晰度和更高的像素强度,揭示了更复杂的细节。在图7中,只有本方法能够同时保留红色框内行人的热辐射及其手提包的可见光颜色,展示了自适应局部语义整合能力。同时,SPGFusion还高保真地重建了绿色框内交通标志的细节,反映出在全局尺度上对多模态语义特征的深度理解与精确融合。大量定性对比与分析共同表明,SPGFusion能够根据不同语义区域自适应地融合红外与可见光图像的特征信息,超越了单一规则融合方法的局限。尤其是,本方法有效应对了过曝、雾天和夜间等挑战性场景。

4.2.2. 定量对比

在四个数据集上使用六种指标进行测试的定量结果报告于图8至图11。在M3FD、LLVIP和FMB数据集上,本方法在所有六项指标上均表现优异,尤其在SF、AG、SD和VIF上具有显著优势。在MSRS数据集上,本方法同样在六项指标中的五项取得最优。SD指标的出色结果反映出我们的融合结果具有高对比度,因而视觉效果良好。SF和AG指标的突出表现表明融合结果包含丰富的纹理细节。此外,EN和VIF的良好结果表明融合图像信息量充足,保持了源图像的结构完整性,并且更符合人类视觉系统。CC指标的最佳结果意味着我们的融合图像与源图像具有最高的相关性。从指标角度看,本方法在多个指标上的优势证明了其在图像融合方面的综合性能。从数据集角度看,本方法在多个数据集上的优越性展示了其跨场景类型和数据分布的泛化能力。

4.3. 高层任务性能

4.3.1. 分割性能

与分割网络联合训练的融合方法已展现出优异的分割性能[12]。然而,该方法将分割视为子任务,直接从源图像特征得到分割结果。相比之下,我们的工作聚焦于融合图像的分割效果。为公平评估所有模型生成的融合图像的分割性能,我们首先使用所有被评估的融合方法生成MSRS和FMB数据集中训练集的融合图像。随后,我们使用相同的训练配置在这些融合图像训练集上训练了十一款分割模型[71]。我们在图12中提供可视化结果以便客观比较。在第一组分割结果中,本方法保留了最多的Car-Stop信息,同时保持了Person腿部的精细轮廓。其他方法仅保留了有限的Car-Stop信息和行人大致轮廓。在第二组分割结果中,仅本方法有效分割出地面的Sidewalk类别,并在边缘轮廓方面表现最佳。

此外,我们在表1和表2中给出了定量结果。受篇幅限制,仅展示MSRS和FMB数据集上八个类别的交并比(IoU)。最终的平均交并比(mIoU)使用所有类别的IoU计算得出。可以观察到,我们的SPGFusion在两个数据集上均取得了最高的mIoU。尽管相对于次优方法的整体提升仅为约1个mIoU,但这一差距主要受限于现有红外-可见光数据集中分割训练数据的规模和多样性不足,这使得分割网络难以完全体现因融合质量差异而引入的性能变化。因此,所观察到的分割性能提升是合理的。值得注意的是,我们的融合结果在几乎所有语义类别上均取得了最高的IoU,并且作为一种无标签方法,SPGFusion仍能与TarDAL、SegMiF和MRFS等依赖标签的方法相竞争。同时,SPGFusion在bumps和poles等难以分割的目标上表现出色,这些目标的精确分割对下游感知任务至关重要。这主要归因于我们基于预训练视觉模型的全局-局部语义先验。这些先验引导语义自适应融合网络关注人工标注所忽略的关键语义信息。

4.3.2. 检测性能

与分割评估类似,我们首先在LLVIP数据集上使用不同融合方法生成融合结果。随后,使用这些融合图像微调YOLOv5 [72]检测器。定性和定量实验结果如图13和表3所示。在定性对比方面,我们提出的SPGFusion能够检测到场景中的所有目标,而TarDAL、CDDFuse、SHIP、MRFS、PSFusion和SAGE无法检测到三轮车上的行人这一困难样本。此外,我们的置信度得分也处于领先位置。在定量对比方面,SPGFusion取得了最佳的检测性能。

总体而言,我们在语义分割和目标检测上的实验证实,本方法SPGFusion不仅保持了出色的视觉质量,还展现出优越的语义性能。这一双重优势凸显了其在其他高层语义任务中应用的潜在价值。

4.4. 扩展至多聚焦图像融合

为进一步探究SPGFusion的能力,我们将红外-可见光融合训练的模型(未进行参数微调)直接应用于多聚焦图像融合(MFIF)基准,并选择MFI-WHU数据集[55]进行评估。推理时,每个模型统一将近聚焦(NF)和远聚焦(FF)的RGB图像对分别通过可见光支路和红外支路处理。值得注意的是,尽管本实验未在MFIF数据集上重新训练SPGFusion,但其集成的基于预训练视觉模型的语义自适应融合网络成功从NF/FF图像中提取了全局类别语义和局部纹理先验,从而使模型能够自适应地关注不同焦平面的关键语义信息。这一能力使SPGFusion在多聚焦场景下能够提供稳定、清晰且信息丰富的融合结果,同时保持跨异质成像模态的语义一致性。

如表4所示,SPGFusion在所有六项评价指标上均优于三种当前最优方法(U2Fusion [68]、YDTR [69]和SwinFusion [70]),在跨域融合场景中展现出更优的信息保持和失真抑制能力。此外,如图14所示,对比结果表明其他方法在试图同时保持近焦红色花朵和远焦路标时,出现了轻微模糊和颜色失真。相比之下,我们的方法清晰呈现了红色花朵的纹理细节和标识牌的轮廓。这些有力的定量和定性结果凸显了SPGFusion跨任务的鲁棒泛化能力。然而,直接将基于红外-可见光融合数据集训练的SPGFusion用于MFIF任务存在固有的局限性。由于损失函数仍是为红外-可见光融合定制的,且缺乏针对离焦模糊的显式损失项,融合结果可能出现细微伪影。此外,原本预训练的红外支路在处理RGB输入时可能不够理想,导致特征幅度不匹配和信息损失。

4.5. 消融实验

为验证所提方法的有效性,我们在LLVIP数据集上进行了五项消融研究。模型I:移除所有语义先验以及相应的通用和深层语义自适应融合(C/PSAF)模块。模型II:将所有CSAF替换为传统的注意力机制。模型III:将PSAF替换为CSAF。值得注意的是,我们没有进行反向设置,即用PSAF替换CSAF,因为PSAF中的交叉注意力机制会引入高内存消耗,使得此类实验在计算上不可行。模型IV排除DINO,模型V省略CLIP。图15和表5展示了这些组件对图像融合性能的影响。

在与模型I–III的对比实验中,移除全局和局部语义先验并排除所提出的语义自适应融合网络会导致融合质量显著下降,表现为可视化效果变差和定量指标大幅降低。这一结果表明,仅依赖低级特征不足以捕获关键语义线索,最终削弱了整体融合性能。此外,用传统注意力机制替代C/PSAF模块无法充分利用可用的语义先验进行有效的特征对齐与整合,凸显了我们的语义自适应融合网络在注入深层语义信息方面的重要性。同时,深层特征融合网络中缺少交叉注意力机制也限制了模型的整体效能。如图15和表5所示,在模型IV中,移除DINO的局部聚类能力使得模型在提取细粒度纹理时更容易受到红外干扰信息的影响。因此,行人(红色框)和文本区域(绿色框)的纹理细节变差,局部特征指标(如SF和AG)出现明显下降。尽管模型V能部分保留局部细节,但缺少CLIP提供全局语义对齐和上下文理解的能力,导致融合图像整体对比度降低,像素强度不理想,EN得分下降,这些共同表明整体信息量减少。总体而言,我们的方法在定性和定量评估中均超越了所有消融变体,凸显了其有效性。

4.6. 复杂度讨论

我们从参数量、浮点运算次数(FLOPs)以及在 224×224224 \times 224224×224 输入分辨率下的推理时间等方面,定量评估了各种图像融合方法。如表6所总结,本方法在这三项指标上并未达到最优,这主要归因于预训练视觉模型(CLIP/DINO)和基于Transformer的语义自适应融合网络引入的计算开销。然而,考虑到SPGFusion在融合实验、下游高层视觉任务和全面消融研究中的卓越表现,我们认为这种计算上的权衡是在获得显著性能提升下的可接受折衷。此外,虽然近期基于预训练视觉模型的方法如FILM和SAGE实现了轻量化架构,但它们在融合和高级视觉任务上的性能弱于Text-IF和我们的SPGFusion等更复杂的框架,表明它们尚未充分挖掘预训练视觉模型在图像融合中的潜力。总之,SPGFusion在可容忍范围内策略性地牺牲了部分计算效率,以换取跨任务、跨场景的语义感知自适应融合能力。未来工作将通过探索轻量化蒸馏机制,将强大的预训练视觉模型语义先验迁移至紧凑子网络,从而降低推理时的计算复杂度,同时保持高效部署能力。

4.7. 局限性与失败案例分析

尽管本方法在大多数场景下表现良好,但在源图像亮度对比极为悬殊的场景中偶尔会失效。如图16所示,可见光图像中的天空严重过曝,而红外图像中相应区域因低辐射几乎呈黑色。在这些场景中,我们比较了四种先进方法。结果表明,尽管CDDFuse、Text-IF和LFDTFuse成功抑制了天空区域的红外干扰,但它们不可避免地掩盖了建筑物的红外细节。PSFusion虽然较好保留了建筑物的红外信息,却错误地融合了天空的红外干扰,导致天空区域变暗。尽管SPGFusion尝试自适应融合天空和建筑区域,但在天空区域产生了一些灰黑色斑点,并且部分遮挡了建筑物的屋顶边缘,导致融合结果不理想。我们分析,这是由于两幅源图像在该区域已丢失大量有用信息,使得预训练视觉模型的语义先验难以捕获和区分细粒度语义信息,导致红外信息被错误注入天空区域并造成房屋屋顶纹理丢失。在未来的工作中,我们将探索这一困难场景下的语义自适应融合机制,以增强SPGFusion在各类复杂场景中的通用性和鲁棒性。

5.结论

本文提出SPGFusion,一种新颖的语义先验引导的红外与可见光图像融合方法。SPGFusion通过相关性池化结合了CLIP和DINO两大预训练视觉模型的优势,并以独特的方式将预训练视觉模型中丰富的无标签语义先验融入融合任务。凭借其语义自适应融合网络,SPGFusion通过保留不同语义对象的关键细节并提供全面的语义理解,实现了多模态信息的自适应融合。大量实验证明了该框架在图像融合和高层视觉任务中的有效性,并显著优于当前最先进的方法。此外,SPGFusion减少了对人工标注的依赖,在直接迁移至多聚焦图像融合时展现出强大的泛化能力。这些表现凸显了将无标签语义先验与精心设计的语义自适应融合网络相结合的有效性,从而为推动未来多模态图像融合研究提供了有价值的见解。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐