目录

1、题目

2、文献信息

3、动机

4、主要工作

1)提出双层优化模型:

2)设计 TarDAL 融合网络:

3)收集并发布 M³FD 数据集:

4)提出协同训练策略:

5、核心创新点:

1)“求同存异”的融合机制:

2)“一生成、双判别”的对抗架构:

3)发布大规模多模态数据集(M³FD) :

6、网络架构

1)总体架构

2)问题表述(Problem formulation)

3)目标感知双对抗网络(Target-aware dual adversarial network)

a、生成器(Generator)

b、双鉴别器(Dual Discriminators)

c、总融合损失函数

7、协同训练策略

1)联合优化目标

2)梯度反向传播机制:

3)策略优势

8、多场景多通道基准


 1、题目

“Target-aware Dual Adversarial Learning and a Multi-scenario Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection ”

《目标感知双对抗学习和多场景多通道融合目标检测》

2、文献信息

作者: Jinyuan Liu, Xin Fan∗, Zhanbo Huang, Guanyao Wu, Risheng Liu‡, Wei Zhong, Zhongxuan Luo

出处: CVF Conference on Computer Vision and Pattern Recognition(CVPR),2022,5792-5801

链接:openaccess.thecvf.com/content/CVPR2022/papers/Liu_Target-Aware_Dual_Adversarial_Learning_and_a_Multi-Scenario_Multi-Modality_Benchmark_To_CVPR_2022_paper.pdf

代码:GitHub - dlut-dimt/TarDAL: CVPR 2022 | Target-aware Dual Adversarial Learning and a Multi-scenario Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection. · GitHub

3、动机

现有红外与可见光图像融合方法中忽略模态间互补差异性、将融合与后续目标检测任务割裂,以及缺乏全面的多模态基准数据集

4、主要工作

1)提出双层优化模型:

构建了一个将“图像融合”与“目标检测”结合的联合问题框架,通过双层优化公式对融合和检测网络进行统一建模

2)设计 TarDAL 融合网络:

将双层模型展开,设计了一个目标感知双重对抗学习网络(TarDAL )用于图像融合,并结合了常规的目标检测网络(如 YOLOv5)进行后续检测

3)收集并发布 M³FD 数据集:

搭建了由可见光和红外传感器组成的同步标定成像系统,采集并建立了一个多场景多模态数据集(M³FD)。该数据集包含4177对配准的高分辨率图像,并对6类常见目标提供了23635个标注

4)提出协同训练策略:

从双层优化公式中推导出一种协同训练策略,使得融合网络和检测网络在训练时能够互相促进,获得兼顾融合与检测的最佳网络参数

5、核心创新点:

1)“求同存异”的融合机制:

提出 TarDAL 网络,打破了以往仅“寻找共性”的局限,在保留共性的同时学习模态间的互补差异,直接服务于后续的目标检测任务

2)“一生成、双判别”的对抗架构:

生成器负责提取共性特征;同时创新性地引入两个判别器,分别用于保留红外图像的目标结构和可见光图像的背景纹理

3)发布大规模多模态数据集(M³FD) :

构建了目前涵盖全天候及各类复杂场景最全面的基准数据集,填补了该领域内的数据空白

6、网络架构

1)总体架构

2)问题表述(Problem formulation)

将融合与检测任务构建为双层优化模型,生成兼顾视觉效果与检测精度的图像

双层优化建模:基于Stackelberg博弈理论,建立红外图像(x)、可见光图像(y)、与融合图像(u)的双层优化模型;ℒ𝑑表示检测网络特定的训练损失,𝜓代表具有可学习参数𝜔𝑑的目标检测网络;𝑓⋅ 是基于能量的保真度项f(⋅) 是基于能量的保真度项,𝑔𝑇和𝑔𝐷别是定义在红外和可见光图像上的可行性约束

单层转化与网络展开:引入一个可学习参数𝑤𝑓的融合网络𝜙,并将双层优化转换为单层优化

通过这种转化,优化过程被展开为两个深度学习网络:融合网络𝜙和检测网络𝜓,检测网络𝜓采用了 YOLOv5 作为其骨干模型

3)目标感知双对抗网络(Target-aware dual adversarial network)

  1. a、生成器(Generator)

生成器:生成逼真的融合图像,以同时欺骗两个判别器,并保持与源图像相似的整体结构和像素强度分布

结构相似性损失:用于保留整体结构

像素损失:为了平衡源图像的像素强度分布,引入了基于显著度权重(SDW)的像素损失

b、双鉴别器(Dual Discriminators)

这两个判别器在不同的域中工作,以区分目标的一致性强度分布和背景的梯度纹理特征

目标鉴别器(DT)在图像域中工作,用于评估红外图像中的前景热目标与生成器给出的融合图像中掩码提取出的目标之间的强度一致性,其对抗损失函数:

细节鉴别器(DD)用于区分可见光图像的梯度分布与融合图像的梯度分布,从而保留背景细节。其对抗损失函数为:

总的对抗损失是这两个判别器损失之和:

c、总融合损失函数

综合生成器的特征提取与双判别器的对抗博弈,融合网络最终的损失函数由上述三个主要部分按比例组合:

7、协同训练策略

1)联合优化目标

作者并没有采用人工设计权重规则的方法,而是引入了包含权衡参数λ的正则化项,转化后的联合优化模型为:

2)梯度反向传播机制:

图2(c)展示了协同训练融合与检测网络时的梯度传播流程,损失函数对ωd(检测参数)和ωf(融合参数)的梯度分别计算如下:

检测损失相对于检测参数的梯度,以及相对于融合参数的梯度都会进行反向传播,且后者的更新还包含了融合损失相对于融合参数的梯度

3)策略优势

通过使融合网络接收来自检测任务的反向梯度指导,这种协同训练策略不仅能生成具有良好视觉吸引力的图像,还能基于训练好的参数输出高精度的检测结果。这使得模型能够找到“面向检测的融合(detection-oriented fusion)”的最优解,并且在收敛效率上优于单独训练各模块的方案

8、多场景多通道基准

类别

详细信息

硬件系统

包含一个双目可见光相机和一个双目红外传感器 。

相机基线距离

可见光双目相机的基线距离为 12cm,红外双目相机的基线距离为 20cm 。

光心距离

可见光与红外传感器之间的光心距离为 4cm 。

原始图像规格

可见光图像分辨率为 1024x768;红外图像分辨率为 640x512,波长范围为 8-14µm 。

图像配准结果

通过计算单应性矩阵将红外坐标投影至可见光坐标,最终获得分辨率统一为 1024x768 的对齐图像对 。

数据集规模

包含 4200 对配准的红外/可见光图像对 。

场景类型

划分为白天、阴天、夜间和挑战性环境 4 大类,并细分为 10 个子场景 。

目标标注

包含人、轿车、公交车、摩托车、卡车和路灯 6 个类别,共计标注了 33603 个目标 。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐