基于互补特征分解和视觉显著性特征的光学与SAR图像融合

Phase-Guided Cross-Frequency Integration Network for ISAR and Optical Image Fusion

作者: Ze Wang, Lei Liu,Zhenxi Zhang, Rongzhen Du, Wanting Zhou, Man Zhou, Jingjing Cai, and Feng Zhou
发表期刊: IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY
论文地址: https://ieeexplore.ieee.org/stamp/stamp.jsp?arnumber=11363241

摘要—逆合成孔径雷达(ISAR)与光学图像融合旨在生成一幅合成图像,同时突出光学图像中航天器的显著轮廓并保留ISAR图像固有的丰富纹理信息。然而,空间域方法有限的感受野限制了其捕获ISAR图像中强散射点之间全局上下文依赖关系以及有效整合互补光学特征的能力。为应对这一挑战,我们提出相位引导的跨频率集成模块(PGCFIM),该模块利用频域固有的全局建模能力和相位谱的语义表达能力。具体而言,采用深度傅里叶变换建立全图感受野进行域内全局建模。随后,显式聚合相位分量,并引入门控机制引导跨域长程依赖的集成,从而有效学习互补的跨模态表示。为消除对手工融合策略的依赖,我们设计了一个端到端网络,命名为PGCFINet。通过联合增强跨域交互、频域全局感知和显式互补特征集成,PGCFINet显著强化了跨域与跨模态的信息交互表示。此外,为缓解当前ISAR与光学图像数据集的匮乏,我们构建了一个包含多种航天器模型的新数据集,为评估提供了替代基准。大量实验表明,PGCFINet在定性和定量评估中均取得优于最先进方法的性能。此外,PGCFINet被扩展到红外与可见光图像融合中,良好的结果进一步验证了其鲁棒的泛化能力。我们的融合方法代码与数据集即将在https://github.com/WangZe0622/PGCFINet发布。

索引词—图像融合,ISAR与光学图像,相位引导,端到端网络

I. 引言在这里插入图片描述

逆合成孔径雷达(ISAR)和光学传感器是航天器成像的两种主要模态[1]–[3]。然而,由于成像硬件的限制和地理约束,单一传感器往往无法提供观测目标的完整描述[4]。具体而言,ISAR图像包含丰富的纹理信息,并能清晰地揭示边缘、突起和角点等结构细节[5], [6]。尽管如此,其固有的稀疏性限制了其描绘目标全局轮廓的能力,阻碍了直观解译。相比之下,光学图像捕获反射的可见光或红外辐射,能有效突出全局轮廓,并很好地符合人类视觉感知[7]。因此,融合来自ISAR和光学传感器的互补模态对于航天器分类[8]、在轨状态估计[9]和三维结构重建[10]等应用至关重要。 现有的图像融合方法通常分为传统方法和基于深度学习的方法[7], [11]–[13]。大多数ISAR与光学图像融合方法属于传统类别,这些方法通常通过数学运算将源图像投影到另一个域以进行特征提取[14]–[16]。然后,利用基于静态图像特性(如局部能量[17]、梯度[18]和标准差[19])的手工设计融合规则来整合互补特征,再通过逆变换生成融合图像。尽管传统方法取得了令人满意的融合性能,但其有效性严重依赖于手工制定的融合策略,往往泛化能力较差,可能引入伪影并降低感知质量。相比之下,深度学习驱动的端到端融合方法具备强大的特征提取和重建能力,无需依赖预定义的融合规则,有效克服了传统方法的局限性[20], [21]。 然而,深度学习驱动的端到端ISAR与光学图像融合方法尚未被深入探索。相反,在同样寻求将一种模态的丰富纹理与另一种模态的显著轮廓融合的端到端红外与可见光图像融合(IVIF)[22][24]领域,已取得了实质性进展[25]。这些方法通常分为三大类:基于卷积神经网络(CNN)的方法[26]–[29]、基于生成对抗网络(GAN)的方法[30][32]以及基于Transformer的方法[33]–[37]。与前两类方法相比,基于Transformer的方法在不同的稀疏分布下展现出更优越的融合性能,这得益于其增强的全局上下文建模能力、灵活的跨模态交互机制[38]以及强大的结构感知表示[39]。然而,仅依赖空间域处理仍然不足以实现ISAR图像中稀疏强散射体的全局感知。在其他图像处理任务中,有效利用频域信息已被证明是增强算法性能的有力手段。Kong等人[40]探索了Transformer的频域特性,并引入了一种计算高效的基于频率的自注意力机制,用于高保真图像去模糊。Zhou等人[41]提出了一种频率引导的图像恢复方法,提供高频和低频线索以辅助重建结构内容和精细细节。Shang等人[42]提出了全面的频率感知注意力和频率自适应前馈网络,它们共同实现了全局特征提取和对关键频段的自适应滤波,从而提升了曝光校正图像中的细节和色彩准确性。这些开创性工作激励我们更好地建模ISAR图像中强散射体的长程依赖关系,并从频域视角整合互补信息。 我们的挑战。1) 现有的ISAR与光学图像融合方法严重依赖于手工制作且复杂的融合策略,导致泛化性能有限。2) 仅依赖感受野有限的空间域特征,难以捕获ISAR图像中强散射体的全局上下文关系,也难以有效学习跨模态互补表示。3) 缺乏用于模型训练和标准化基准评估的ISAR与光学图像数据集。我们的动机。如图1所示,我们对ISAR和光学图像执行快速傅里叶变换(FFT),并对它们的幅度谱和相位谱进行了深入分析,得出两个关键观察结果:1) 幅度谱主要包含低层统计信息,而相位分量保留了来自源图像的高层语义内容[43]–[45]。如图1(a)所示,仅幅度重建无法揭示目标,而仅相位重建则成功保留了其轮廓和纹理。2) 当将两幅图像的幅度谱聚合并与原始相位谱结合进行重建时,生成的融合图像仅显示出像素强度的变化。值得注意的是,将融合后的相位谱与原始幅度谱结合,产生的融合图像呈现出清晰的互补特征保留,如图1(b)中红色矩形框所标示。这一现象与ISAR和光学图像融合的目标高度契合。因此,利用频域实现域内全局感知和域间互补特征融合是一种可行的途径。 我们的解决方案。受上述观察的启发,为解决现有方法严重依赖手工融合策略的限制,我们提出了一个利用多域交互和跨模态互补学习的端到端ISAR与光学图像融合框架,称为相位引导的跨频率集成网络(PGCFINet)。为解决空间域中有限的感受野并充分利用信息丰富的频谱信息,我们提出了相位引导的跨频率集成模块(PGCFIM)。一方面,PGCFIM能够实现全图感受野以进行全局上下文建模,显著增强全局感知能力。另一方面,显式的相位谱融合与门控机制相结合,引导网络学习跨模态互补表示,从而实现更有效的特征集成。 此外,我们构建了一个专用的ISAR与光学图像数据集(IODataset),包含16种航天器模型,为ISAR与光学图像融合评估提供了新的基准。除图像融合外,该数据集还可用于航天器目标识别和特定部件分割等任务。本工作的核心贡献总结如下:(1) 我们的工作是在开发统一的网络架构方面的一项开创性努力,该架构整合了空间域和频域交互,用于ISAR与光学图像融合。具体而言,通过探索多域协同全局感知和相位引导的互补表示学习,我们提出了PGCFINet。(2) 我们设计了一个PGCFIM,该模块在频域中显式地聚合相位分量,从而能够实现更有效的互补特征集成和更准确的长程依赖关系建模… (3) 我们构建了一个包含多种航天器模型的新IODataset。该数据集可作为ISAR与光学图像融合领域的代表性基准,并为其他视觉任务提供潜在益处。本文其余部分的结构安排如下:第二节简要回顾ISAR与光学图像融合方法以及基于Transformer的IVIF方法。第三节详细描述所提出的PGCFINet。第四节讨论消融分析和方法比较,随后在第五节给出结论。

II. 相关工作

本节首先回顾现有的ISAR与光学图像融合方法。随后,总结基于Transformer的红外与可见光图像融合(IVIF)方法的最新进展。

A. ISAR与光学图像融合方法

现有大多数关于ISAR与光学图像融合的研究依赖传统融合方法。Han等人[11]提出了一种ISAR与红外图像的融合方法,利用四叉树分解和Bézier插值提取显著的ISAR特征,然后与红外图像进行自适应逐像素融合。Zhang等人[12]提出了一种在航空航天目标分析背景下融合ISAR与光学数据的方法。首先,他们使用由空间频率和方差组成的信息丰富度度量对源图像进行多尺度分解。然后,利用自适应加权、脉冲耦合神经网络和形态学处理实现不同尺度间的融合。最终融合结果通过将所有子融合分量求和生成。Wang等人[13]提出了一种基于非下采样剪切波变换多尺度分解的航天器ISAR与光学图像融合方法。低通子带使用结合亮度和轮廓信息的活动水平度量进行融合,高通子带则通过自适应双通道脉冲耦合神经网络进行整合。融合图像最终通过逆变换过程获得。
尽管传统方法能够产生令人满意的融合结果,但仍存在显著不足:(1)严重依赖手工制作的融合规则;(2)由于侧重于低级空间特征,对高级语义信息的建模不足;(3)泛化能力差,常导致视觉伪影。为解决这些问题,我们提出一种端到端的ISAR与光学图像融合网络,利用显式建模和频域分析实现更鲁棒的特征集成并提升泛化性能。

B. 基于Transformer的IVIF方法

在这里插入图片描述

Vaswani等人[46]提出了Transformer架构,最初应用于机器翻译任务。由于其在对像素间全局交互建模方面的强大能力,Transformer在IVIF中展现出显著的有效性。Ma等人[33]设计了一种融合CNN与Swin Transformer的融合网络框架,将交叉注意力引入域间融合单元以促进互补信息集成。Tang等人[35]提出了一种基于双重注意力和Transformer的融合框架,其中通道注意力[47]和空间注意力[48]提取显著的局部特征,Transformer块对非局部依赖性进行建模。Zhao等人[34]提出了CDDFuse,一种相关性驱动的双分支Transformer-CNN网络,分解共享特征和模态特定特征,并使用Restormer块[49]重建融合图像。Chang等人[36]提出了一种自适应融合Transformer,摒弃了CNN用于IVIF,采用多头自注意力模块和前馈网络(FFN)进行特征提取,并结合多头自融合机制实现自适应特征集成。Park等人[28]设计了一种带有门控瓶颈的跨模态Transformer,以抑制空间和通道冗余。为减轻特征提取和重建过程中的信息损失,Tang等人[37]设计了一种交互式Transformer ITFuse,包含特征交互和重建模块,迭代地提取和集成显著特征。为实现有效的多模态信息集成,Li等人[50]通过比较不同模态掩膜的质量,选择性融合来自不同模态的优势目标区域。此外,他们提出了一种双向协作区域融合策略,以增强每种模态的判别表示。从频域视角出发,Wang等人[51]开发了一个统一的频率对抗学习框架,结合离散小波变换来探索跨模态互补性。然而,对于ISAR图像,仅在有限感受野的空间域中对稀疏分布的强散射点的长程依赖进行建模存在固有局限。这一局限也阻碍了互补光学信息的有效集成。因此,从频域视角出发,我们研究了一种基于显式相位聚合的相位引导门控注意力机制,并提出了一种更鲁棒的全局建模策略以及一个互补信息聚合模块。

III. 方法

本节对所提出的ISAR与光学图像融合框架进行全面阐述。首先,概述所提出的PGCFINet。随后,对所设计的融合模块进行深入分析。最后,给出网络训练中采用的损失函数。

A. 网络架构

受图1分析的启发,我们提出用于ISAR与光学图像融合的PGCFINet,如图2所示。令 IISAR∈RH×W×1I_{ISAR} \in \mathbb{R}^{H \times W \times 1}IISARRH×W×1IOpt∈RH×W×1I_{Opt} \in \mathbb{R}^{H \times W \times 1}IOptRH×W×1IF∈RH×W×1I_F \in \mathbb{R}^{H \times W \times 1}IFRH×W×1 分别表示ISAR图像、光学图像和融合图像。图像尺寸由 HHHWWWCCC 表示,分别指示高度、宽度和通道数。所提出的PGCFINet由三个核心组件构成:特征提取、频域特征融合和特征重建。首先,利用卷积层从ISAR和光学图像中提取浅层特征 FSF,ISARF_{SF,ISAR}FSF,ISARFSF,OptF_{SF,Opt}FSF,Opt。这些层高效捕获局部特征并将其投影到更高维空间,有利于早期视觉处理并增强训练稳定性[33], [52]。所有卷积层均采用 3×33 \times 33×3 的卷积核、步长为1,并包含Leaky ReLU激活函数。得到的浅层特征随后送入Transformer模块以生成多尺度深层特征 FDF,ISARdF^{d}_{DF,ISAR}FDF,ISARdFDF,OptdF^{d}_{DF,Opt}FDF,Optd,其中 d∈{1,2,3,4}d \in \{1, 2, 3, 4\}d{1,2,3,4} 表示网络深度。这些深层特征通过所提出的PGCFIM进行融合,产生 FDF,FdF^{d}_{DF,F}FDF,Fd,并在重建过程中由Transformer模块进一步细化。该方法不仅补偿了下采样带来的空间信息损失,而且促进了跨模态互补特征的聚合。最后,融合特征通过Transformer和卷积层逐步上采样,以重建高分辨率融合图像 IFI_FIF。所提出的PGCFIM的详细描述在下一小节中给出。

B. 相位引导的跨频率集成模块

PGCFIM的架构如图2红色矩形所示。它包括一个相位引导的跨频率集成注意力(PGCFIA)、两个归一化层、两个FFN和一个用于特征融合的卷积层。首先,F^DF,ISARn,d\hat{F}^{n,d}_{DF,ISAR}F^DF,ISARn,dF^DF,Optn,d\hat{F}^{n,d}_{DF,Opt}F^DF,Optn,d 分别通过PGCFIA获得,由以下数学表达式定义。

F^DF,ISARn,d=PGCFIA(FDF,ISARn−1,d,FDF,Optn−1,d)+FDF,ISARn−1,d, \hat{F}^{n,d}_{DF,ISAR} = PGCFIA(F^{n-1,d}_{DF,ISAR}, F^{n-1,d}_{DF,Opt}) + F^{n-1,d}_{DF,ISAR}, F^DF,ISARn,d=PGCFIA(FDF,ISARn1,d,FDF,Optn1,d)+FDF,ISARn1,d,

F^DF,Optn,d=PGCFIA(FDF,ISARn−1,d,FDF,Optn−1,d)+FDF,Optn−1,d,(1) \hat{F}^{n,d}_{DF,Opt} = PGCFIA(F^{n-1,d}_{DF,ISAR}, F^{n-1,d}_{DF,Opt}) + F^{n-1,d}_{DF,Opt}, \tag{1} F^DF,Optn,d=PGCFIA(FDF,ISARn1,d,FDF,Optn1,d)+FDF,Optn1,d,(1)

其中 PGCFIA(⋅)PGCFIA(\cdot)PGCFIA() 表示PGCFIA。随后,F^DF,ISARn,d\hat{F}^{n,d}_{DF,ISAR}F^DF,ISARn,dF^DF,Optn,d\hat{F}^{n,d}_{DF,Opt}F^DF,Optn,d 通过归一化层处理,分别得到 FDF,ISARn,dF^{n,d}_{DF,ISAR}FDF,ISARn,dFDF,Optn,dF^{n,d}_{DF,Opt}FDF,Optn,d,如以下等式所示。

FDF,ISARn,d=FFN(LN(F^DF,ISARn,d))+F^DF,ISARn,d, F^{n,d}_{DF,ISAR} = FFN(LN(\hat{F}^{n,d}_{DF,ISAR})) + \hat{F}^{n,d}_{DF,ISAR}, FDF,ISARn,d=FFN(LN(F^DF,ISARn,d))+F^DF,ISARn,d,

FDF,Optn,d=FFN(LN(F^DF,Optn,d))+F^DF,Optn,d,(2) F^{n,d}_{DF,Opt} = FFN(LN(\hat{F}^{n,d}_{DF,Opt})) + \hat{F}^{n,d}_{DF,Opt}, \tag{2} FDF,Optn,d=FFN(LN(F^DF,Optn,d))+F^DF,Optn,d,(2)

最后,对 FDF,ISARn,dF^{n,d}_{DF,ISAR}FDF,ISARn,dFDF,Optn,dF^{n,d}_{DF,Opt}FDF,Optn,d 进行通道维度的拼接,然后应用卷积操作来聚合特征。

FDF,Fd=Conv(Concat(FDF,ISARn,d,FDF,Optn,d)),(3) F^{d}_{DF,F} = Conv(Concat(F^{n,d}_{DF,ISAR}, F^{n,d}_{DF,Opt})), \tag{3} FDF,Fd=Conv(Concat(FDF,ISARn,d,FDF,Optn,d)),(3)

其中 Concat(⋅)Concat(\cdot)Concat() 表示沿通道轴的拼接。所提出的PGCFIA旨在从频域角度实现两个目标:长程依赖的细粒度建模和有效的互补信息集成。如图3所示,提取的深层特征 FDF,ISARdF^{d}_{DF,ISAR}FDF,ISARdFDF,OptdF^{d}_{DF,Opt}FDF,Optd 被用来构建查询、键和值表示,同时指导频域交叉注意力。在对输入深层特征进行归一化后,采用逐点卷积在像素级别捕获跨通道的上下文信息。随后,采用卷积核为 3×33 \times 33×3 的深度卷积[53]隐式捕获局部空间相关性,从而弥补纯自注意力在建模局部特征方面的局限[49]。相应的数学表述如下:

[Q^ISAR,Q^Opt]=[WQ,ISARXISAR,WQ,OptXOpt], [\hat{Q}_{ISAR}, \hat{Q}_{Opt}] = [W^{Q,ISAR}X_{ISAR}, W^{Q,Opt}X_{Opt}], [Q^ISAR,Q^Opt]=[WQ,ISARXISAR,WQ,OptXOpt],

[K^ISAR,K^Opt]=[WK,ISARXISAR,WK,OptXOpt], [\hat{K}_{ISAR}, \hat{K}_{Opt}] = [W^{K,ISAR}X_{ISAR}, W^{K,Opt}X_{Opt}], [K^ISAR,K^Opt]=[WK,ISARXISAR,WK,OptXOpt],

[V^ISAR,V^Opt]=[WV,ISARXISAR,WV,OptXOpt],(4) [\hat{V}_{ISAR}, \hat{V}_{Opt}] = [W^{V,ISAR}X_{ISAR}, W^{V,Opt}X_{Opt}], \tag{4} [V^ISAR,V^Opt]=[WV,ISARXISAR,WV,OptXOpt],(4)

其中 W(⋅)W^{(\cdot)}W() 表示 1×11 \times 11×1 逐点卷积和 3×33 \times 33×3 深度卷积。频域中的分量源自所有空间域元素,因此支持有效的全局建模。因此,我们首先将 Q^\hat{Q}Q^K^\hat{K}K^ 变换到傅里叶域。

QISAR=F(Q^ISAR),QOpt=F(Q^Opt), Q_{ISAR} = \mathcal{F}(\hat{Q}_{ISAR}), \quad Q_{Opt} = \mathcal{F}(\hat{Q}_{Opt}), QISAR=F(Q^ISAR),QOpt=F(Q^Opt),

KISAR=F(K^ISAR),KOpt=F(K^Opt),(5) K_{ISAR} = \mathcal{F}(\hat{K}_{ISAR}), \quad K_{Opt} = \mathcal{F}(\hat{K}_{Opt}), \tag{5} KISAR=F(K^ISAR),KOpt=F(K^Opt),(5)
在这里插入图片描述

受图1分析的启发,为了更好地集成互补特征并指导频域交叉注意力的计算,我们显式地融合相位谱并引入门控机制来生成包含两种模态信息的 VVV,如图3的第2步所示。首先对 FDF,ISARdF^{d}_{DF,ISAR}FDF,ISARdFDF,OptdF^{d}_{DF,Opt}FDF,Optd 应用傅里叶变换以获得其对应的相位谱和幅度谱:

AISAR,PISAR=F(FDF,ISARd),(6) A_{ISAR}, P_{ISAR} = \mathcal{F}(F^{d}_{DF,ISAR}), \tag{6} AISAR,PISAR=F(FDF,ISARd),(6)

AOpt,POpt=F(FDF,Optd),(7) A_{Opt}, P_{Opt} = \mathcal{F}(F^{d}_{DF,Opt}), \tag{7} AOpt,POpt=F(FDF,Optd),(7)

随后,通过逐元素相加显式地集成两种模态的相位谱,同时保留原始幅度谱以保持亮度信息。该过程的数学表述如下:

RF,ISAR=AISAR∗(cos⁡(PISAR)+cos⁡(POpt)), R_{F,ISAR} = A_{ISAR} * (\cos(P_{ISAR}) + \cos(P_{Opt})), RF,ISAR=AISAR(cos(PISAR)+cos(POpt)),

IF,ISAR=AISAR∗(sin⁡(PISAR)+sin⁡(POpt)), I_{F,ISAR} = A_{ISAR} * (\sin(P_{ISAR}) + \sin(P_{Opt})), IF,ISAR=AISAR(sin(PISAR)+sin(POpt)),

RF,Opt=AOpt∗(cos⁡(PISAR)+cos⁡(POpt)), R_{F,Opt} = A_{Opt} * (\cos(P_{ISAR}) + \cos(P_{Opt})), RF,Opt=AOpt(cos(PISAR)+cos(POpt)),

IF,Opt=AOpt∗(sin⁡(PISAR)+sin⁡(POpt)),(8) I_{F,Opt} = A_{Opt} * (\sin(P_{ISAR}) + \sin(P_{Opt})), \tag{8} IF,Opt=AOpt(sin(PISAR)+sin(POpt)),(8)

其中 RF,ISARR_{F,ISAR}RF,ISARRF,OptR_{F,Opt}RF,OptIF,ISARI_{F,ISAR}IF,ISARIF,OptI_{F,Opt}IF,Opt 表示融合傅里叶域特征的实部和虚部分量。然后将融合后的表示变换回空间域,并使用深度卷积和逐点卷积进行细化,最后通过基于Sigmoid的门控机制来指导频域交叉注意力:

YISAR=Sigmoid(Op(F−1(RF,ISAR,IF,ISAR))), Y_{ISAR} = Sigmoid(Op(\mathcal{F}^{-1}(R_{F,ISAR}, I_{F,ISAR}))), YISAR=Sigmoid(Op(F1(RF,ISAR,IF,ISAR))),

YOpt=Sigmoid(Op(F−1(RF,Opt,IF,Opt))), Y_{Opt} = Sigmoid(Op(\mathcal{F}^{-1}(R_{F,Opt}, I_{F,Opt}))), YOpt=Sigmoid(Op(F1(RF,Opt,IF,Opt))),

VISAR=V^ISAR⊙YISAR, V_{ISAR} = \hat{V}_{ISAR} \odot Y_{ISAR}, VISAR=V^ISARYISAR,

VOpt=V^Opt⊙YOpt,(9) V_{Opt} = \hat{V}_{Opt} \odot Y_{Opt}, \tag{9} VOpt=V^OptYOpt,(9)

其中 Op(⋅)Op(\cdot)Op() 表示 1×11 \times 11×1 逐点卷积和 3×33 \times 33×3 深度卷积的操作。最后,为了集成不同特征域间的全局交互,引入一种高效的频域交叉注意力求解器,如图3的第3步所示。根据卷积定理[54],两信号在空间域的相关或卷积对应于其频域表示的哈达玛积。因此,来自不同模态的查询与键之间的矩阵乘法被替换为频域中的哈达玛积,表示为:

CAISAR=PConv(Norm(F−1(QISAR⊙KOpt‾)⊙VOpt)), CA_{ISAR} = PConv(Norm(\mathcal{F}^{-1}(Q_{ISAR} \odot \overline{K_{Opt}}) \odot V_{Opt})), CAISAR=PConv(Norm(F1(QISARKOpt)VOpt)),

CAOpt=PConv(Norm(F−1(QOpt⊙KISAR‾)⊙VISAR)),(10) CA_{Opt} = PConv(Norm(\mathcal{F}^{-1}(Q_{Opt} \odot \overline{K_{ISAR}}) \odot V_{ISAR})), \tag{10} CAOpt=PConv(Norm(F1(QOptKISAR)VISAR)),(10)

其中 ⊙\odot 表示哈达玛积,(⋅)‾\overline{(\cdot)}() 表示共轭转置操作,PConv(⋅)PConv(\cdot)PConv() 表示 1×11 \times 11×1 逐点卷积,Norm(⋅)Norm(\cdot)Norm() 表示层归一化。

C. 损失函数

设计的损失函数旨在引导网络融合ISAR纹理与光学轮廓,包含两个基本分量:像素强度损失和纹理损失。数学表述如下:

Ltotal=λ1Lint+λ2Ltext,(11) L_{total} = \lambda_1 L_{int} + \lambda_2 L_{text}, \tag{11} Ltotal=λ1Lint+λ2Ltext,(11)

其中 λ1\lambda_1λ1λ2\lambda_2λ2 表示权重参数。像素强度损失 LintL_{int}Lint 调控融合图像的像素分布,并促使网络从ISAR和光学图像中提取全局强度特征:

Lint=1HW∥IF−max⁡(IISAR,IOpt)∥1,(12) L_{int} = \frac{1}{HW} \| I_F - \max(I_{ISAR}, I_{Opt}) \|_1, \tag{12} Lint=HW1IFmax(IISAR,IOpt)1,(12)

其中 ∥⋅∥1\|\cdot\|_11 表示 l1l_1l1 范数,max⁡(⋅)\max(\cdot)max() 表示逐元素最大值选取。为促进融合ISAR图像的细节纹理和光学图像的显著轮廓,引入纹理损失以引导精细结构特征的提取:

Ltext=1HW∥∣∇IF∣−max⁡(∣∇IISAR∣,∣∇IOpt∣)∥1,(13) L_{text} = \frac{1}{HW} \| |\nabla I_F| - \max(|\nabla I_{ISAR}|, |\nabla I_{Opt}|) \|_1, \tag{13} Ltext=HW1∥∣∇IFmax(∣∇IISAR,∣∇IOpt)1,(13)

其中 ∇\nabla 表示Sobel梯度算子,用于捕获图像纹理和边缘特征,∣⋅∣|\cdot| 表示绝对值运算。

IV. 实验

本节首先描述实验设置,然后给出所提方法与几种代表性SOTA方法的定性和定量比较。为进一步验证方法的适用性,我们在其他视觉任务上进行了额外实验。随后执行消融研究以评估所提出的PGCFIM的贡献。此外,将该网络扩展到IVIF任务以评估其泛化能力。最后,进行计算复杂度分析。

A. 实验配置

在这里插入图片描述

数据集构建:为训练所提出的端到端图像融合网络,我们在相同成像平面和相同分辨率下仿真ISAR和光学图像。从NASA数据库中选取16个航天器模型,例如Aqua、Envisat、Rosetta和Tiangong-1。对每个模型,在随机视角下生成4,000对ISAR和光学图像,总计64,000对图像。IODataset按7:2:1的比例划分为训练集、验证集和测试集。空间目标的电磁后向散射采用物理光学法[55]仿真,光学成像过程采用光线追踪算法[56]仿真。数据集的具体参数见表I,航天器模型和代表性图像对如图4所示。实际中,ISAR和光学传感器的成像平面通常不同。因此,在ISAR和光学图像融合之前需要配准过程。配准方法在我们之前的工作[13]中已有描述。一旦配准完成,便执行融合过程。
在这里插入图片描述

训练设置:批大小和总训练轮数均设为8。在每个训练步骤中,训练集的图像被调整为256×256。采用Adam优化器,学习率为2×10⁻⁴。损失平衡系数设为λ1\lambda_{1}λ1=10,λ2\lambda_{2}λ2=20。PGCFINet的实现使用PyTorch,所有实验在两块NVIDIA A100-PCIE-40GB GPU和2.70GHz Intel® Xeon® Platinum 8168M CPU上进行。
对比方法:由于ISAR与光学图像融合的目标类似于IVIF,即结合一种模态的轮廓特征与另一种模态的丰富纹理细节,我们将所提方法与一种传统ISAR与光学融合方法以及八种SOTA IVIF方法进行评估。这九种SOTA方法包括MSFIOF [13]、DenseFuse [20]、NestFuse [57]、RFN-Nest [58]、U2Fusion [26]、SwinFusion [33]、CDDFuse [34]、DATFuse [35]和FISCNet [45]。除传统方法(MSF-IOF)和两种离线训练模型(DenseFuse和NestFuse)外,所有其他方法均在我们的IODataset上使用与所提方法相同的训练配置和环境重新训练。
评估指标:为进行全面定量比较,采用九种指标衡量融合结果的质量,包括:1) Qabf [59]量化从原始输入传递到融合图像的边缘信息量;2) FMIw [60]使用小波域表示计算互信息;3) 差异相关和(SCD)[61]反映源输入到融合输出的信息保留与传输程度;4) SSIM [62]和5) MS-SSIM [63]量化源图像与融合图像之间的结构相似性;6) AG [64]和7) EI [65]指示融合图像中纹理信息的丰富程度;8) SF [66]评估融合结果中包含的空间频率水平;9) VIF [67]关于人类视觉感知评估融合图像质量。此外,这些指标值越高表示融合性能越好。

B. 结果分析

我们选择四对具有代表性的ISAR和光学图像对SOTA方法和所提方法进行定性分析。定性分析结果如图5至图8所示,显著结构用红色方框标示。MSF-IOF在图5©和图6©中产生伪影,影响感知质量。DenseFuse虽然能保留源图像信息,但由于其加权平均融合策略削弱了显著特征,降低了图像对比度。NestFuse和FISCNet在光学图像中实现了更好的亮度恢复,但ISAR图像存在不同程度的纹理损失,因为卷积网络有限的感受野不足以对稀疏分布的强散射点进行有效的全局建模。RFN-Nest产生模糊边缘,如图6(f)所示,这可归因于多尺度特征重建过程中局部高频分量的衰减。此外,SwinFusion和DATFuse难以突出ISAR图像中的强散射信息,如图8(h)和(j)所示,突显了仅在空间域进行全局建模的局限性。需要强调的是,所提出的PGCFINet不仅详细重建了ISAR图像的纹理特征和强散射点,如图6(l)所示,而且生动地恢复了光学图像的显著轮廓,如图8(l)所示,实现了两种模态互补信息的良好平衡集成。此外,我们的方法保持自然的跨模态融合,提供优越的主观视觉质量。这些优势源于频域中有效的全局上下文建模和互补特征聚合。特别是,我们的网络通过基于相位的融合显式引导跨模态注意力计算,促进了更有效的细粒度纹理和显著轮廓的聚合,同时增强了网络的泛化能力。
为定量评估性能,我们在6,400张测试图像上计算了所提方法和SOTA方法在九种评估指标上的平均性能。定量结果如表II所示。在表II中,性能最高的值以红色粗体显示,排名第二的以蓝色粗体显示,排名第三的值以粗体显示。可以观察到,PGCFINet在几乎所有指标上持续取得顶级性能。具体而言,最高的Qabf值表明我们的PGCFINet在融合图像中保留了更多边缘细节。最高的AG和EI值表明源图像丰富的纹理信息成功保留在融合输出中,与视觉评估结果一致。在FMIw和SSIM上的优越性能展示了该方法在保留亮度和结构信息方面的优势,实现了更准确的信息传递和更高的融合保真度。VIF指标排名第二,反映了与人类视觉感知的良好一致性。此外,所提方法在SCD、MS-SSIM和SF上同样表现良好。基于上述分析,PGCFINet相较于其他SOTA方法展现出优越的客观性能。
在这里插入图片描述

C. 面向其他视觉任务的ISAR与光学图像融合

面向目标分类的ISAR与光学图像融合:作为计算机视觉中的基础感知任务,目标分类是评估图像可辨别性和融合图像结构表示质量的有效手段。因此,我们首先通过比较使用源图像和融合图像作为输入的识别准确率,探索ISAR与光学图像融合对航天器目标识别的有效性。采用ResNet34 [68]作为识别网络。单模态数据集源自构建的IODataset。使用所提及对比融合方法在IODataset的训练和验证数据集上生成融合图像,用于各方法的训练和验证。训练策略遵循ResNet34的默认设置,训练轮数设为10。单模态图像和融合图像的目标识别准确率如表III所示,相应的混淆矩阵如图9所示。表III中最佳识别准确率以粗体突出显示。如表III所示,基于融合的方法在识别准确率上普遍优于单模态图像,表明集成互补的ISAR和光学信息增强了目标特征描述,有助于识别结构相似的航天器。值得注意的是,所提方法取得了最高准确率,证明PGCFINet中相位引导的频域建模显式增强了全局结构语义表示和互补特征融合。在分类任务中的性能提升表明其在更复杂下游感知任务中的优势。
面向语义分割的ISAR与光学图像融合:我们进一步研究ISAR与光学图像融合对语义分割的有效性。由于所提出的IODataset缺乏真值语义标注,采用Segment Anything Model (SAM) [69]无需额外训练即可对测试集进行定性评估。以图8和图6为代表性示例,相应的定性分析结果分别如图10和图11所示。差异显著的区域用红色边界框突出显示并放大可视化。五角星指示点提示的位置。图10中,点提示用于显著目标分割,而图11中则用于分割单个卫星太阳翼。如图10(a)所示,卫星主体的缺失导致分割模型错误地理解目标与背景。CDDFuse引入的伪影造成分割不完整,如图10(i)所示。此外,FISCNet无法有效重建ISAR图像中稀疏的强散射体,导致SAM偏向光学信息。除SwinFusion和所提方法外,其他方法均无法准确分割卫星天线结构。值得注意的是,PGCFINet在图11中产生了更平滑、更规则的太阳翼边界。总体而言,这些结果表明ISAR与光学图像融合较单模态输入提供更丰富的互补信息,产生更完整的目标轮廓,而所提出的互补融合策略显著提高了分割的完整性和准确性。

D. 消融研究

我们PGCFINet的融合性能主要受所提出的PGCFIM和设计损失函数的影响。因此,我们在IODataset测试集上通过全面的定性和定量评估研究它们对整体融合性能的贡献。定性评估中,视觉差异显著的区域用红色边界框突出显示并放大。定量分析中,最优值以红色粗体清晰标示。
融合模块分析:所提出的融合模块包含三个主要组件:相位引导集成、频域交叉注意力机制,以及通过Q和K的基于频域的全局上下文建模。相位引导集成和频域交叉注意力提高了网络提取互补特征的能力,而Q和K的频域建模使网络能更好地捕获全局上下文信息。进行消融实验以验证各组件的有效性,包括:1) 移除相位引导集成(w/o PGI);2) 在聚合块中用幅度融合替代相位融合(w/ Fuseamp);3) 将交叉注意力替换为自注意力(w/o CA);4) 省略对Q和K的傅里叶变换操作(w/o FFT)。幅度融合的数学表述如下:
RF,ISAR=(AISAR+AOpt)∗cos⁡(PISAR), R_{F,ISAR} = (A_{ISAR} + A_{Opt}) * \cos(P_{ISAR}), RF,ISAR=(AISAR+AOpt)cos(PISAR),

IF,ISAR=(AISAR+AOpt)∗sin⁡(PISAR), I_{F,ISAR} = (A_{ISAR} + A_{Opt}) * \sin(P_{ISAR}), IF,ISAR=(AISAR+AOpt)sin(PISAR),

RF,Opt=(AISAR+AOpt)∗cos⁡(POpt), R_{F,Opt} = (A_{ISAR} + A_{Opt}) * \cos(P_{Opt}), RF,Opt=(AISAR+AOpt)cos(POpt),

IF,Opt=(AISAR+AOpt)∗sin⁡(POpt)(14) I_{F,Opt} = (A_{ISAR} + A_{Opt}) * \sin(P_{Opt}) \tag{14} IF,Opt=(AISAR+AOpt)sin(POpt)(14)

网络结构的消融研究视觉对比如图12和图13所示。如前所述,我们的方法有效捕获跨模态的全局信息,利用全局上下文将互补特征集成到融合图像中。如图12和图13所示,PGCFIM显著改善了对强散射点信息的保留,特别是在Aura的主体和Rosetta太阳翼边缘的ISAR图像上。为更直观地呈现定性消融结果,进一步可视化了我们的融合结果与w/o PGI、w/ Fuseamp、w/o CA和w/o FFT结果之间的差异图。当移除互补特征聚合的显式建模(w/o PGI或w/ Fuseamp)时,模块无法恰当保留光学图像显著轮廓的亮度及ISAR图像纹理信息的丰富性,分别如图12(d)和(f)以及图13(d)和(f)所示。此外,不对Q和K应用频域建模,网络无法有效捕获ISAR图像全局稀疏的强散射特征,如图12(h)和图13(h)所示,这与图1的分析一致。交叉注意力通过融合显著光学轮廓和细致的ISAR纹理促进全局上下文集成。当替换为自注意力时,融合结果中的边缘和纹理强度均下降,如图12(j)和图13(j)所示。表IV中的定量实验为定性分析提供了进一步支持。如表IV所示,移除任何组件都会对融合性能产生不利影响。Qabf、AG、EI和SF的最高值再次证实了所提模块在保留光学图像轮廓和ISAR纹理细节方面的重要性。FMIw和SSIM的最高值进一步展示了该模块保留全局信息的能力。此外,VIF的最高值表明所提方法能够更自然地融合互补特征,从而提升视觉质量。
融合光学和ISAR图像的目标是合成一幅融合图像,既保留光学模态中航天器的清晰轮廓,又保留ISAR模态的精细纹理,同时提升主观视觉质量。然而,仅基于无监督损失函数的隐式监督训练融合网络以提取和重建互补特征可能导致不稳定。相比之下,我们的PGCFIM由与ISAR和光学图像融合原理一致的显式建模驱动,有助于更稳定地优化网络参数。为进一步突出所提出的PGCFIM的重要性和有效性,我们绘制了w/o PGI、w/ Fuseamp、w/o CA、w/o FFT以及所提模块在整个训练过程中的Qabf和FMIw指标曲线。Qabf和FMIw旨在量化输入模态的边缘信息和显著内容在融合结果中保持和表示的程度。如图14所示,所提出的PGCFIM通过引导网络计算交叉注意力和聚合互补特征来显式建模融合任务,从而促进更快收敛和更强鲁棒的泛化。在训练早期,我们的模块加速特征学习和重建,提升融合性能;在后期,它提供更强的泛化能力并减少性能波动。因此,所提模块的频域全局上下文建模和相位引导门控机制与ISAR和光学图像融合的目标高度契合,在融合性能和泛化稳定性方面均具有优势。
损失函数分析:所提出的损失函数整合了像素强度损失和纹理损失。像素强度损失引导PGCFINet保持与源图像一致的亮度细节。如图15©所示,移除这一项会导致亮度保持不准确,严重降低视觉质量和全部九个定量指标。为更好地重建光学图像的显著轮廓和ISAR图像中的丰富纹理,纹理损失被集成到损失函数中。如图15(d)所示,没有该约束,网络无法重建输入图像重叠区域的纹理细节,导致次优视觉质量。此外,我们进一步研究了λ₁和λ₂不同组合对融合结果的影响,以验证所选参数的合理性。当λ₁=1, λ₂=1和λ₁=20, λ₂=10时,融合图像与所提方法在定性上无明显差异,但未能达到最优定量性能。当λ₁=100, λ₂=20时,输出图像无法保留ISAR图像的纹理细节。当λ₁=10, λ₂=200时,网络主要关注光学图像的边缘轮廓而忽视其亮度信息,导致AG和SF值较高。当λ₁=10, λ₂=20时,所提方法不仅有效集成了ISAR与光学图像的互补特征,而且获得了优越的主观视觉性能。此外,大多数客观评估指标在此配置下达到最佳性能,证明了所选参数λ₁和λ₂的合理性。

E. 扩展至红外与可见光图像融合

为进一步验证所提方法的鲁棒性和有效性,使用MSRS数据集[70], [71]在IVIF任务上对PGCFINet进行评估。训练采用批大小16,共8轮。每次迭代时,输入图像转换为灰度图,随机裁剪为128×128区域,并归一化至[0,1]。所有基线方法均采用其作者提供的默认设置。对于定性和定量评估,我们使用MSRS测试集中的361对图像以及从TNO数据集[72]中随机选取的20对图像。代表性融合结果如图16和图17所示,显著目标用红色边界框突出显示并以放大子区域展示。同样,我们采用七种质量指标进行定量评估。平均性能结果如表VI所示。其中,最佳值以红色粗体标示,次优值以蓝色粗体标示,第三优值以粗体标示。MSF-IOF、DenseFuse、U2Fusion和DATFuse倾向于不同程度地抑制红外图像中的显著目标。RFN-Nest产生模糊轮廓,如图16(f)和图17(f)所示,而FISCNet产生边缘伪影,如图17(k)所示。相比之下,所提方法不仅更有效地重建可见光模态的精细纹理,还增强了红外图像中的显著目标。表VI中的定量结果支持了视觉分析。FMIw、SSIM和MS-SSIM的较高值表明PGCFINet有效保留了源图像的有用信息。Qabf、EI和SF的高性能进一步证明其恢复可见光图像丰富纹理和红外图像显著轮廓的能力。VIF的次优值表明该方法取得了良好的主观视觉质量。然而,当红外图像包含大面积低对比度区域时,例如图17中的天空区域,PGCFINet倾向于向可见光模态分配更多注意力,可能导致某些红外细节的次优增强并影响部分定量指标。尽管如此,PGCFINet在保留显著目标轮廓和全局信息方面从定性和定量角度仍表现出强大竞争力,凸显了所提出的频域相位引导全局建模的优势。
与ISAR和光学图像融合相比,PGCFINet在背景更复杂、大面积低对比度区域以及跨模态语义不一致的IVIF场景中的性能优势不那么显著,如图17中的背景所示。这可归因于ISAR和光学数据的内在特性,包括ISAR图像显著的稀疏性以及两种模态间强烈的信息互补性和语义一致性,如图1和图8所示。相应地,PGCFIA被设计为利用傅里叶变换进行全局建模,利用相位谱中编码的语义信息,并通过相位融合集成互补特征。这些设计原则使PGCFINet能够更好地建模ISAR图像中的全局上下文关系,并集成ISAR与光学模态间的互补信息。

F. 计算复杂度分析

如表VII所示,从两个角度进行复杂度评估,即训练参数量(大小)和每秒浮点运算次数(FLOPs),以评估不同方法在IODataset、TNO和MSRS数据集上的计算效率。使用测试集的第一张图像计算每种方法的FLOPs。尽管PGCFINet未取得最优结果,但在可比的计算效率下,相较于代表性的基于Transformer的融合方法(如SwinFusion和CDDFuse),它在定性和定量性能上均取得优势。此外,我们的方法在IVIF中展现出强大的泛化能力。值得注意的是,所提方法在网络参数和FLOPs之间取得了良好平衡。这一优势源于卷积定理的引入,频域中的逐元素乘法显著降低了计算复杂度。

V. 结论

为解决空间域有限感受野并更有效地集成互补信息,我们提出了PGCFIM。一方面,所提模块利用频域固有的全局建模能力有效捕获域内长程依赖。另一方面,它显式融合相位谱以引导网络学习互补特征表示。通过集成多域信息、在频域进行全局建模以及实现显式跨模态特征交互,我们进一步开发了一个端到端的ISAR与光学图像融合网络,称为PGCFINet。此外,为解决ISAR与光学图像融合数据集的匮乏,我们构建了一个包含多种航天器模型的新数据集,可作为替代基准,并支持其他视觉任务。综合实验表明,PGCFINet在视觉质量和客观指标上均优于SOTA方法,同时对其他视觉任务产生积极贡献。此外,其扩展至IVIF进一步证明在多数据集上的鲁棒泛化能力。然而,所提方法专为已配准的光学和ISAR图像设计。未来研究可专注于将图像配准与融合统一在端到端框架中。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐