IVIF文献阅读笔记:Multigrained Attention Network for Infrared and Visible Image Fusion
目录
1、题目
“Multigrained Attention Network for Infrared and Visible Image Fusion ”
《用于红外与可见光图像融合的多粒度注意力网络》
2、文献信息
作者: Jing Li , Hongtao Huo , Chang Li , Member, IEEE, Renhua Wang , Chenhong Sui , and Zhao Liu
出处: IEEE Transactions on Instrumentation and Measurement,VOL.70,2021,1-12
3、动机
现有基于生成对抗网络(GAN)的红外与可见光图像融合方法无法有效感知图像的判别性区域,导致在融合过程中容易丢失重要的前景目标、可见光的上下文细节以及未参与对抗博弈的图像信息
4、主要工作
1)构建融合新框架:
提出了一种基于编码器-解码器网络的多粒度注意力图像融合方法(MgAN-Fuse)
2)双编码与注意力引导:
采用双独立编码器分别处理不同模态图像,将提取的多尺度特征与多粒度注意力图结合并拼接,输入解码器生成结果
3)设计双判别器架构:
引入两个独立的判别器进行对抗训练,分别促使模型保留红外图像的强度信息和可见光图像的纹理细节
4)引入特征损失函数:
在训练中加入额外的特征损失项,通过计算特征差异来强制模型保留可见光图像的关键信息
5、核心创新点
1)多粒度注意力机制:
将其集成到编码器-解码器框架中,充分利用多尺度层的特征,迫使生成器聚焦于最具判别性的区域 。该机制既能保留红外图像的前景目标信息,又能捕获可见光图像的上下文信息
2)特征损失函数(Feature Loss):
为保留可见光图像的重要特征,通过计算判别器浅层网络中可见光图像与融合图像特征的差异,设计了特征损失函数
3)双对抗网络架构:
设计了两个结构相同的独立判别器,第一个用于区分融合图像与红外图像以保留红外强度,第二个用于区分融合图像与可见光图像以捕获纹理细节
6、网络结构
1)总体架构

MgAN-Fuse框架由一个生成器和两个独立且结构相同的判别器组成
生成器:基于编码器-解码器网络 。采用两个独立的编码器分别对红外和可见光图像进行多尺度特征提取 。编码器的各尺度层中集成了注意力模块(Att)以生成多粒度注意力图,随后将其与解码器网络相应的多尺度特征进行拼接,最终由解码器计算生成融合图像
Discriminator_ir:用于区分融合结果与真实红外图像,促使生成器保留足够的红外强度信息
Discriminator_vis:用于区分融合结果与真实可见光图像,促使模型捕获足够的可见光细节
2)生成器架构

生成器基于编码器-解码器网络构建
双编码器:使用两个独立的编码器网络分别对红外和可见光图像进行编码。每个编码器包含三个卷积块。每个卷积块由卷积层和PReLU激活函数构成 。第一个卷积块包含两个步长为1的卷积层(滤波器数为32)。第二和第三个卷积块各包含一个步长为2的卷积层(滤波器数量分别为64和128)
注意力模块:集成在编码器的各个尺度层中以计算多粒度注意力图
特征拼接:两个编码器的输出在通道维度上进行拼接,以供解码器计算融合结果。多粒度注意力图与解码器网络中相应的多尺度特征进行拼接
解码器:包含三个卷积块。解码器第一和第二卷积块的输出通过最近邻插值法进行上采样。解码器中滤波器数量依次设为128、128、64和1
生成器中所有卷积层的卷积核大小均设为3
3)注意力模块

该模块同时考虑通道和空间维度,通过学习权重来强调判别性特征并抑制无关信息
输入与维度转换:输入为编码器各卷积块的特征图fm,通过”全局平均池化(GP)”捕获全局信息,将空间特征压缩为1×1×m的通道向量
权重学习:利用”全连接层(FC)”学习通道间的相互依赖关系,随后通过 Sigmoid 函数(SG) 生成每个通道的权重系数
特征重加权:将学习到的权重与原始特征图fm进行逐元素相乘,选择地增强重要特征并抑制次要特征
空间图生成:在重加权后的特征基础上,通过Fmax操作(跨通道维度取最大值)构建最终的注意力图(Attention map)
计算公式:

4)鉴别器架构

K、n和S分别表示核大小、滤波器数和步长
MgAN-Fuse 设计了两个独立且结构相同的判别器,用于在对抗博弈过程中捕获源图像的关键信息
对抗博弈:Dir旨在区分融合结果与红外图像,强制生成器保留红外强度信息
细节捕获:Dvis旨在区分融合结果与可见光图像,帮助模型捕获可见光的纹理细节
训练稳定:采用带有梯度惩罚的 WGAN 架构,以解决传统 GAN 训练中梯度消失或爆炸的问题
逐层降采样:通过在偶数卷积块(第 2、4、6 块)中设置步长为 2 来实现特征图的下采样和空间信息压缩
7、损失函数
1)生成器的损失函数
生成器的总损失函数目的是平衡图像融合中的像素强度、纹理细节和对抗博弈,α和μ是控制各损失项权重的参数

内容损失(Lcon),保留红外图像中的像素强度信息(热源目标)。计算融合图像与红外图像之间的 Frobenius 范数,通过最小化像素差异来维持亮度

注意力损失:惩罚判别器提取的融合图像注意力图与对应源图像注意力图之间的差异

对抗损失:计算生成器对抗 Discriminator_ir(区分红外图像)和 Discriminator_vis(区分可见光图像)的损失总和

2)鉴别器的损失函数
总损失

公式等号右侧的前两项代表 Wasserstein 距离的估计值,pir/vis代表红外图像和可见光图像的真实数据分布。最后一项表示用于网络正则化的梯度惩罚项。ϕ被定义为控制惩罚强度的正则化参数
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)