arxiv | 2025 | DuGI-MAE: Improving Infrared Mask Autoencoders via Dual-Domain Guidance
·
文章目录
arxiv | 2025 | DuGI-MAE
- 论文:https://arxiv.org/abs/2505.06855
- 代码:https://arxiv.org/pdf/2505.06855?
- 期刊:arXiv
- 时间:2025
创新点
- 本文团队设计了基于标记熵的确定性掩码策略,仅保留高熵标记用于重建以提升信息量
- 本文团队引入双域引导模块(DDG),该模块既能捕捉全局标记关联,又能自适应滤除红外图像中常见的非均匀背景噪声
- 为便于大规模预训练,本文团队构建了Inf-590K红外图像数据集,该数据集涵盖多样化场景、多种目标类型及多空间分辨率
贡献
- 提出了一种双域引导基础模型DuGI-MAE,该模型采用基于确定性熵的掩码策略以缓解信息缺失标记的问题
- 提出 DDG 模块用于指导掩码标记重建,通过采用自适应频率滤波技术来降低红外图像中的非均匀噪声
- 构建了一个大规模数据集Inf-590K,专门用于红外影像的自监督预训练。在Inf-590K数据集上进行预训练可显著提升各类自监督方法在红外图像解释任务中的泛化能力
- 在红外目标检测、语义分割及小目标检测方面的实验结果一致表明,DuGI-MAE具有优越性与泛化能力
摘要及引言
- 红外成像技术在弱光环境及恶劣天气条件下具有关键应用价值。然而,由于红外图像具有独特特征,基于可见光数据训练的掩码自编码器(MAE)等基础模型在红外图像解析任务中表现欠佳
- 尽管InfMAE效果显著,但仍存在信息标记缺失、全局关联建模不足及非均匀噪声处理不力等局限性

图1:(a)典型场景的代表性红外图像。左图:原始红外图像,背景信号强烈常会掩盖实际目标;中图:图像熵图;右图:采用自适应频域调制(AFDM)去噪声处理后的图像 ;(b)InfMAE的灰度值掩码与本研究熵基掩蔽方法的对比
- InfMAE的掩码:按灰度值选择,会保留部分背景噪声区域,漏掉部分⽬标区域,保留的Token分布散乱
- 本⽂的熵值掩码:只保留熵值最⾼的⽬标和边界区域,保留的Token精准且集中,能为后续还原提供⾜够的关键信息
- 为解决上述问题,本文团队提出了一种基于MAE的双域引导红外基础模型,命名为DuGI-MAE
- 本文团队首先设计了一种确定性掩码策略,选择性保留最具信息量的标记,从根本上避免了随机采样或固定间隔采样常导致的关键信息丢失
- 为增强全局关联性并同时抑制非均匀噪声,本文团队进一步引入了双域引导(DDG)模块,该模块整合了自适应频率滤波器
- DDG模块作为编码器与解码器之间的桥梁,有效提升了对鲁棒且抗噪红外表征的学习能力
- 为促进预训练工作,我们构建了大规模红外数据集Inf-590K,该数据集包含从多种平台和视角采集的590,700幅红外图像,涵盖广泛场景类型、目标类别及空间尺度
预备知识
- 信噪⽐:图像中有效⽬标信号和⽆⽤噪声的⽐例,⽐例越⾼图像越清晰
- 温度漂移噪声:⾮均匀噪声的⼀种,会导致⽬标区域变暗、背景区域变亮,严重压制⽬标
- 熵值掩码策略:按图像块的信息熵值选择保留的Token,熵值越⾼表⽰信息越丰富,优先保留
- 双域引导模块:融合空间域和频率域特征的模块,既强化全局关联,⼜过滤噪声
- ⾃适应频域调制:DDG模块的⼦模块,通过可学习的滤波器在频率域⾃适应压制噪声、保留有⽤信息
- 快速傅⾥叶变换:把图像从空间域转到频率域的快速算法,是信号处理的基础⽅法
- 径向滤波器:以频率域中⼼为原点,按径向距离设计的滤波器,专⻔处理低频率的背景/噪声
方法

图2:DuGI-MAE的整体架构。该架构包含:(a)基于熵的掩码模块、(b)编码器、(c)双域引导(DDG)模块以及(d)解码器
- a 熵值掩码模块:
(1)输入原始红外图像,先通过简单的卷积层把图像转化为特征图,再切成一个个Token
(2)计算每个Token的信息熵(熵值越高 = 信息越丰富,比如目标、目标和背景的边界)
(3)按熵值给Token排序,确定性保留熵值最高的25% Token,把剩下75% Token“掩码(遮住)”
(4)最终只把这 25% 的高价值 Token,送入下一个模块(编码器),从根上避免漏掉红外目标信息 - b 编码器:
(1)接收掩码模块送来的25%高熵Token,用Transformer层对Token做特征提取(Transformer 是模型的核心,能捕捉 Token 之间的关联)
(2)编码器分3 个阶段(Stage1/Stage2/Stage3),层数依次是2层、2层、11层Transformer,层层递进提取特征:
1.Stage1(浅层):提细节特征(比如目标的边缘、小轮廓)
2.Stage2(中层):提局部结构特征(比如目标的整体形状)
3.Stage3(深层):提全局语义特征(比如判断这个 Token 属于车 / 人 / 建筑)
(3)最终输出3个多尺度的空间域特征(F1/F2/F3),分别对应 3 个阶段的输出,这些特征是后续处理的基础 - c 双域引导 DDG 模块:
(1)支路 1:频率域特征提取(AFDM 处理)
直接对原始红外图像做自适应频域调制(AFDM)(就是图 4 的流程:FFT 转频率域→径向滤波器过滤低频率噪声→IFFT 转回空间域)
处理后得到频率域增强特征:噪声被滤掉,目标的全局结构更清晰,再通过简单的下采样、分块,转化为和空间特征匹配的 Token 格式
(2)支路 2:空间 + 频率特征融合(频率引导注意力注入)
1.把编码器输出的空间域特征(F1/F2/F3)作为“查询(Q)”(相当于模型的 “问题”:这个 Token 是什么?)
2.把 AFDM 处理后的频率域特征作为 “键(K)” 和 “值(V)”(相当于模型的 “参考答案”:从全局频率视角,这个 Token 应该对应什么特征)
3.模型通过注意力机制,让空间特征 “参考” 频率特征的答案,重新计算注意力权重 ——自动把注意力放在频率域中高响应的目标区域,把分散的空间 Token 关联起来(解决全局关联差的问题)
4.最终输出双域融合特征:既保留了空间域的局部细节,又融合了频率域的全局结构,还滤掉了噪声,是质量极高的特征 - d 解码器:
(1)接收 DDG 模块送来的双域融合特征,同时在特征图上补全被掩码的 Token 位置
(2)解码器同样用 Transformer 层,基于融合特征的信息,对每个空拼图位做像素还原
(3)最终输出完整的还原红外图像,和原始图像对比计算误差(均方误差 MSE),误差越小,说明模型学的红外特征越精准,自监督学习的效果越好
基于熵的掩码模块
- 本文采用香农熵作为量化指标来评估每个标记的信息含量。熵值较高的标记会被优先保留,而其他区域则采用更高比例的掩码处理
- 这种策略能有效促使模型聚焦于红外模态特有的判别特征标记,保留的始终能完整保留信息内容,包括目标区域及其与背景的边界特征
- 设λ为掩码比例,本文团队根据熵值对标记进行升序排序,并保留熵值最高的最后(1−λ)个标记,这些标记被认为代表红外图像中最具信息量的区域,通常包含重要热目标
- 该过程可表述为:
I keep = { I sort [ i ] ∣ i ∈ [ ⌊ λ ⋅ N ⌋ , N − 1 ] } \mathcal{I}_{\text{keep}} = \left\{ \mathcal{I}_{\text{sort}}[i] \mid i \in \left[ \lfloor \lambda \cdot N \rfloor, N-1 \right] \right\} Ikeep={Isort[i]∣i∈[⌊λ⋅N⌋,N−1]}
Mask [ i ] = { 1 , if i ∈ I keep , 0 , otherwise , \text{Mask}[i] = \begin{cases} 1, & \text{if } i \in \mathcal{I}_{\text{keep}}, \\ 0, & \text{otherwise}, \end{cases} Mask[i]={1,0,if i∈Ikeep,otherwise, - 其中 i i i为标记索引, I sort \mathcal{I}_{\text{sort}} Isort表示已排序的索引序列, I keep \mathcal{I}_{\text{keep}} Ikeep代表待保留的标记,[·]代表取整函数
双域导向
- 这是本⽂的核⼼创新模块,夹在编码器和解码器之间,核⼼是⽤频率域的全局信息引导空间域的局部信息,同时过滤⾮均匀噪声,分为⾃适应频域调制(AFDM)和频率引导注意⼒注⼊两个核⼼⼦模块
- 该模块通过自适应频域调制(AFDM)从红外图像中提取频域特征,随后通过补丁嵌入技术进行特征投影,为后续Transformer模块提供键值对数据
- 与此同时,编码器生成的空间特征被构建成查询-键-值三元组。频率增强特征随后对空间特征进行引导,使其能够更有效地关注目标区域
⾃适应频域调制(AFDM)
- 尽管高通滤波可有效抑制非均匀噪声(尤其是温度漂移噪声),但本文团队认为直接滤除低频分量会导致图像内容丢失。为此,本文团队提出了⾃适应频域调制(AFDM)

图3:自适应频域调制(AFDM)。输入图像首先通过快速傅里叶变换(FFT)转换至频域。随后应用可学习径向滤波器以抑制非均匀背景噪声(通常为低频分量),同时保留判别特征。最后通过逆 FFT(IFFT)将处理后的特征转换回空间域
- 核心作用:给红外图像做 “智能去噪”,专门过滤红外图像里的非均匀噪声(比如温度漂移噪声),同时还不丢失目标的有效特征,最终输出一张噪声少、目标清的频率增强特征图,给DDG模块的双域融合提供高质量的频率域特征
- 输入原始红外空间域图像:把还没做任何处理的原始红外图像送入 AFDM 模块,这张图的特点是:有非均匀噪声、目标可能被噪声压制(比如背景亮、目标暗)、整体信息模糊,也是需要去噪的 “原材料”
- 通过FFT(快速傅里叶变换)转成频率域频谱:转换后得到的频率域频谱是一个二维图,中心区域是低频成分(对应红外的非均匀噪声、大面积均匀背景),边缘区域是中高频成分(对应目标的热辐射特征、目标和背景的边界、小目标细节)
- 用可学习的径向滤波器对频谱做智能调制过滤:只对频谱中心的低频区做处理,对边缘的中高频区完全不碰,确保目标特征不被破坏,经过过滤后得到调制后的频率域频谱:频谱中心的低频噪声被自适应压制,边缘的中高频目标特征完全保留,实现了噪声和特征的精准分离。且这个滤波器不是固定参数(不是每次都压一样的低频),而是带可学习参数的:模型在训练时,会根据不同红外图像的噪声类型、强度,自己调整滤波器的参数,动态控制对低频噪声的压制程度和压制范围
- 通过IFFT(逆快速傅里叶变换)转回空间域:把第三步处理好的调制后频谱,重新转回到我们能处理的空间域特征图。这张图的特点是:非均匀噪声被大幅过滤、目标的热辐射特征更突出、背景更干净,而且完全保留了目标的形状和位置信息
频率引导注意力注入
- 使用频率增强特征图作为空间域特征的引导,在第一个Transformer模块中, 首先被编码为键( K f r e q K_{freq} Kfreq)和值( V f r e q V_{freq} Vfreq )对,随后与空间键( K s p a t i a l K_{spatial} Kspatial )和值( V s p a t i a l V_{spatial} Vspatial)对进行整合:
Attention ( F 1 , F freq ) = σ ( Q spatial ( K spatial T + K freq T ) d k ) ⋅ ( V spatial + V freq ) \text{Attention}(\mathbf{F}_1, \mathbf{F}_{\text{freq}}) = \sigma\left( \frac{\mathbf{Q}_{\text{spatial}} \left( \mathbf{K}_{\text{spatial}}^T + \mathbf{K}_{\text{freq}}^T \right)}{\sqrt{d_k}} \right) \cdot \left( \mathbf{V}_{\text{spatial}} + \mathbf{V}_{\text{freq}} \right) Attention(F1,Ffreq)=σ dkQspatial(KspatialT+KfreqT) ⋅(Vspatial+Vfreq) - F1表示编码器中第一阶段的输出, σ ( ⋅ ) σ(·) σ(⋅)为softmax函数, Q s p a t i a l Q{spatial} Qspatial表示空间特征查询, d k \sqrt{d_k} dk为缩放因子
- 在后续Transformer模块中,空间特征被添加到前一模块的输出中以形成键值表征,而空间特征本身仍作为查询输入
- 频率引导注意力注入机制将注意力权重导向高响应目标区域,从而增强关键结构
用于下游任务的DuGI-MAE
- DuGI-MAE的预训练编码器可适配下游任务,包括红外目标检测、语义分割和小目标检测
实验
红外目标检测

表1:不同目标检测方法在M 3 ^3 3FD-inf数据集上的性能比较
- 组1:纯监督方法(无自监督预训练,直接用标注数据训)
(1)包含:DETR、DINO、YOLOv8
(2)性能:mAP最高只有 53.7(YOLOv8),AP50最高 80.3
(3)结论:纯监督方法针对可见光设计,直接用在红外上效果最差,体现红外专用模型的必要性 - 组2:经典自监督方法(可见光 MAE 改进,适配红外)
(1)包含:MAE、MCMAE
(2)性能:MAE到MCMAE性能逐步提升
(3)结论:在Inf-590K上做自监督预训练后,性能大幅提升,证明红外大尺度预训练的核心价值 - 组3:红外专用自监督方法
(1)包含:InfMAE、DuGI-MAE
(2)性能:DuGI-MAE全面超越InfMAE,是表格中性能最好的模型
(3)结论:充分证明DuGI-MAE提取的红外特征更精准,做目标检测更有效
红外语义分割

表2:不同语义分割方法在 MSRS 数据集上的性能对比
- 组1:经典纯监督分割方法(针对可见光设计,无红外预训练)
(1)包含:DeeplabV3+、UperNet、DNLNet、DDRNet
(2)性能:mIoU 最高 67.3(DDRNet),mAcc 最高 75.7(DNLNet)
(3)结论:和目标检测一致,可见光纯监督方法直接用在红外分割上,效果远不如红外专用自监督方法 - 组2:经典自监督方法(可见光 MAE 改进,Inf-590K 预训练)
(1)包含:MAE、MCMAE
(2)性能:MAE到MCMAE性能逐步提升
(3)结论:再次验证Inf-590K 大尺度红外预训练是提升性能的关键,自监督预训练能让模型学到更通用的红外特征 - 组3:红外专用自监督方法
(1)包含:InfMAE、DuGI-MAE
(2)性能:DuGI-MAE依旧全面超越 InfMAE,是表格中所有方法的性能最高值
(3)结论:证明DuGI-MAE提取的红外特征不仅适合目标检测,也适合像素级的语义分割,泛化能力极强
红外小目标检测

表3:不同红外小目标检测方法在IRSTD -1k数据集上的性能对比
- 组1:传统手工设计方法(无深度学习,靠人工设计特征规则)
(1)包含:MPCM、IPI、RIPT
(2)性能:mIoU最高仅28.0,Pd最高65.7,性能最差
(3)结论:纯人工设计的规则,没法捕捉红外小目标的微弱特征,既找不准目标位置,又容易漏掉目标,完全跟不上深度学习方法 - 组2:深度学习监督方法(有标注数据训练,无红外自监督预训练)
(1)包含:ACMNet、DNANet、UIUNet、SCAFNet
(2)性能:mIoU最高66.3,Pd最高91.3,比传统方法大幅提升,但仍不如红外专用自监督方法
(3)结论:深度学习能学到更复杂的特征,但这些方法多针对可见光/通用场景设计,没有经过红外大尺度预训练,对红外小目标的特征捕捉仍不够精准 - 组3:红外专用自监督方法
(1)包含:MAE、MCMAE、InfMAE、DuGI-MAE
(2)性能:DuGI-MAE仍然是全表性能最高的模型
(3)结论:经过Inf-590K红外大尺度预训练后,模型能学到更贴合红外小目标的特征;而DuGI-MAE凭借熵值掩码+DDG双域融合,比上一代红外模型InfMAE更精准,实现了小目标检测的性能突破
消融研究

表4:DDG 模块在不同自监督预训练模型上的性能提升效果
- MAE/MAE+DDG:即使是针对可见光设计的通用MAE,加上DDG模块后,红外检测性能也能明显提升,证明DDG 能有效弥补通用模型在红外特征学习上的短板
- MCMAE/MCMAE+DDG:MCMAE本身性能比MAE高,加DDG后仍有稳定提升,说明DDG对改进型MAE模型同样有效
- InfMAE/InfMAE+DDG:即使是专门为红外设计的InfMAE,加上DDG模块后,性能仍能进一步提升,证明DDG模块的双域融合设计,比InfMAE的单一空间域特征学习更优,能有效提升红外专用模型的性能
- 结论:DDG模块不仅能用于本文的DuGI-MAE,还能无缝集成到其他主流的MAE/MCMAE/InfMAE模型中,且均能带来性能提升,说明DDG模块不是 “专属补丁”,而是通用的红外特征增强模块,具有很强的泛化性和工程应用价值
结论
- 本文提出了一种专为红外模态设计的自监督预训练框架DuGI-MAE,该模态本身具有信息密度较低的固有特征
- 针对激进掩蔽导致的重建瓶颈,本文团队设计了融合空间域与频域线索的双域引导(DDG)模块。该设计显著提升了模型同时捕捉精细局部细节与全局结构模式的能力
- 通过物体检测、语义分割及小目标检测等下游任务的广泛实验表明,DuGI-MAE始终优于现有最先进方法
- 值得关注的是, DDG 模块可无缝集成到现有编码器-解码器预训练框架中,进一步提升了红外数据处理性能
未来方向
- 在后续工作中,本文团队将通过在预训练过程中引入更多物理先验信息,以推动红外基础模型的开发
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)