目录

1、题目

2、文献信息

3、动机

4、主要工作

1)提出AttentionFGAN网络:

2)设计生成器:

3)设计双判别器:

4)实验评估:

5、核心创新点:

1)双向注意力机制:

2)多尺度特征捕获:

3)首创注意力损失:

4)双判别器对抗:

6、网络架构

1)总体架构

2)生成器架构

3)多尺度注意力网络

4)鉴别器架构

7、损失函数

1)生成器的损失函数

2)鉴别器的损失函数


1、题目

AttentionFGAN: Infrared and Visible Image Fusion Using Attention-Based Generative Adversarial Networks AttentionFGAN:基于注意力生成对抗网络的红外与可见光图像融合

2、文献信息

作者: Jing Li , Hongtao Huo , Chang Li , Renhua Wang, and Qi Feng

出处: IEEE Transactions on Multimedia,VOL.23,2021,1383-1396

链接:AttentionFGAN: Infrared and Visible Image Fusion Using Attention-Based Generative Adversarial Networks | IEEE Journals & Magazine | IEEE Xplore

3、动机

现有红外与可见光图像融合方法中忽略模态间互补差异性、将融合与后续目标检测任务割裂,以及缺乏全面的多模态基准数据集

4、主要工作

1提出AttentionFGAN网络:

一种端到端红外与可见光图像融合新方法,该方法将多尺度注意力机制集成到了GAN的生成器和判别器中

2设计生成器:

AttentionFGAN 的生成器由两个多尺度注意力网络(分别对应红外和可见光图像)以及一个图像融合网络组成。注意力网络负责提取源图像的注意力图,以此引导融合网络在重建图像时更加关注源图像的典型区域

3设计双判别器:

引入了两个独立的判别器,利用Wasserstein距离(WGAN机制)分别区分融合结果与真实的红外图像、可见光图像,从而强制融合结果同时保留两者的强度和纹理信息

4)实验评估:

TNOBEPMOSU三个公开数据集上进行了消融实验以及与六种现有最先进方法(SOTA)的定性和定量对比实验,验证了AttentionFGAN的优势与有效性

5、核心创新点:

1)双向注意力机制:

在生成器和判别器中同时引入多尺度注意力机制,引导网络精准聚焦红外图像的前景目标与可见光图像的背景细节

2)多尺度特征捕获

设计多尺度注意力网络,利用多尺度空间池化提取特征并自适应分配权重,有效捕获复杂大目标的综合空间信息

3)首创注意力损失

基于判别器创新性地设计了注意力损失函数,通过惩罚特征图差异,强制融合图像保留源图像的典型注意力区域

4)双判别器对抗:

构建分别对应红外和可见光图像的双判别器架构,避免单一判别器造成的信息流失,同步保留热辐射强度与高分辨率纹理

6、网络架构

1)总体架构

AttentionFGAN 核心目标是训练出一个强大的生成器,使其能够生成信息丰富且高度逼真的融合图像,逼真到让判别器无法将其与真实的源图像区分开来。整个框架由一个生成器(Generator)和两个判别器(Discriminator_ir Discriminator_vis)组成

2)生成器架构

核心组件: 生成器( Generator )包含红外多尺度注意力网络、可见光多尺度注意力网络和一个图像融合网络
特征提取: 红外 (IR) 和可见光 (VIS) 图像分别输入对应的多尺度注意力网络,计算出各自的注意力图 ( Attention_ir Attention_vis )
特征拼接: 生成的红外与可见光注意力图与原始源图像在通道维度上进行拼接 ( 即图中标注的“ C”)
图像融合: 拼接后的特征输入融合网络,在注意力图的引导下重建图像,从而保留红外图像的前景目标信息并捕获可见光图像丰富的背景细节信息

3)多尺度注意力网络

特征提取: 通过卷积网络( Conv Network )提取源图像的深层特征
多尺度池化: 应用多尺度空间池化(如 1x1 2x2 4x4 )以捕获大型物体的全面空间信息
权重计算: 受类别激活映射( CAM )启发 ,各尺度特征依次经全局平均池化( GP )、全连接层( FC )和 Sigmoid 函数( Sg )处理生成权重 ,以聚焦关键特征并抑制无关特征
特征重加权与归一化: 多尺度特征经上采样(↑)恢复尺寸后 ,与对应权重进行逐通道乘法( X )加权 ,相加后通过归一化( Normalization )得到各尺度的单层注意力图
特征拼接与映射: 将所有尺度的归一化注意力图在通道维度拼接( C ) ,最终应用最大值选择策略的注意力映射( Attention mapping )操作生成最终的注意力图

4)鉴别器架构

双判别器配置: 包含 Discriminator_ir Discriminator_vis ,分别用于区分融合图像( “Fake” )与真实的红外图像、可见光图像( “Real” ),两者网络结构相同但不共享参数
结合多尺度注意力机制: 输入图像会先进入多尺度注意力网络以生成注意力图,从而约束判别器聚焦于注意力区域而非整张输入图像
特征拼接输入: 生成的注意力图与原始输入图像在通道维度上进行拼接(图中“ C” 所示),随后输入至判别器主体( D_ir D_vis )以识别最具区分度的内容
WGAN 架构调整: 采用 WGAN 计算源图像与融合结果之间的 Wasserstein 距离 。为适应回归任务需求,去除了常规 GAN 损失中的对数函数以及判别器的最后一层 Sigmoid 激活函数

7、损失函数

1)生成器的损失函数

总损失: λ ξ 用于控制各项损失权重
内容损失: 约束融合图像保持与红外图像相似的像素强度以保留热源信息, ||• || F 表示矩阵的 Forbenius 范数
注意力损失: 惩罚判别器提取的融合图像注意力图与对应源图像注意力图之间的差异
对抗损失: 计算生成器对抗 Discriminator_ir (区分红外图像)和 Discriminator_vis (区分可见光图像)的损失总和

2)鉴别器的损失函数

        总损失

        公式等号右侧的前两项代表 Wasserstein 距离的估计值,pir/vis代表红外图像和可见光图像的真实数据分布。最后一项表示用于网络正则化的梯度惩罚项。ϕ被定义为控制惩罚强度的正则化参数

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐