MAE方向基础知识

研究背景

在高分辨率遥感图像场景中,飞机目标经常被云层、雾霭等遮挡,导致传统识别模型精度大幅下降。

掩码图像建模(MIM)是当下主流的视觉自监督学习技术,其中MAE(掩码自编码器) 凭借高效的特征学习能力,被广泛用于图像理解、目标识别任务,也是本研究的基础模型。

MAE 是一种自监督学习模型,核心思路分为两步:

在这里插入图片描述

图 1 MAE掩码-重建预训练机制

1.随机掩码:将输入图像分割为多个图像块,随机遮盖其中大部分区域(常规掩码比例 75%),只保留小部分可见内容;

2.图像重建:利用可见区域特征,通过编码器 + 解码器结构,还原被遮盖的图像块。

MAE预训练结构特点:
采用非对称编解码设计:编码器只处理未被掩码的图像块,轻量化解码器负责完整图像重建,训练速度快、算力消耗低;

仅在掩码区域计算损失,聚焦缺失内容的还原,是视觉领域主流的预训练框架。

传统MAE的不足

(1)无差别随机掩码
原生 MAE 随机遮盖图像块,无法区分飞机(关键目标)和云层、空地(背景),会把等量计算资源分配给无效背景,浪费模型学习能力。

在这里插入图片描述

图 2 包含云层干扰的图像重建

(2)重建策略单一
对所有图像块使用相同重建权重,面对机翼、尾翼等被云层遮挡的飞机细节时,难以精准补全缺失信息。

(3)跨视角 / 遮挡适应性差
遥感图像存在拍摄角度不同、云层厚薄不一的情况,纯 MAE 易出现特征漂移,在重度遮挡场景下识别精度断崖式下跌。

(4)局部特征捕捉弱
以 Transformer 为核心的结构擅长全局建模,但对飞机边缘、纹理等局部细粒度特征提取能力不足

研究的改进思路

设计教师 - 学生双编码器结构:
由教师网络判断每个图像块的重要程度,优先对云层等非关键区域掩码,引导模型重点关注飞机本体区域,利用教师分支对语义重要区域的感知能力,引导学生分支在重建过程中对不同区域施加差异化的重建约束;

根据目标重要性分配不同重建权重,拉高飞机关键区域的权重,弱化背景干扰,强化遮挡区域的特征还原效果;

引入卷积增强局部纹理提取能力,结合交叉注意力融合局部细节 + 全局结构,弥补 Transformer 的短板;

利用对比学习约束教师、学生编码器的特征分布,保证模型在不同拍摄角度、不同云层遮挡等级下,特征保持稳定,提升泛化能力。
在这里插入图片描述

图 3 DUGI-MAE

有关数据集基础

以无云层遮挡的高分辨率光学遥感飞机图像为基础,构建了一个飞机原始图像数据集ASRAir(Airplane Scene Representation for Airplanes)。该基础数据集共包含50个飞机类别,其中训练集和验证集分别包含18,823张和5,366张图像,总计24,189张。

在这里插入图片描述

图 4 云层遮挡的原始图像数据集ASRAir (a)与云层遮挡场景下的数据集ASRAirC (b)

在此基础上,根据不同的实验目的,类别划分为以下三个数据集版本:
(1)ASRAir(Airplane Scene Representation – Airplane):无云层遮挡的图像数据集(如图 2(a));

(2)ASRAirC(Airplane Scene Representation – Airplane with Cloud occlusion):在ASRAir的基础上引入云层遮挡生成的含云飞机图像数据集(如图 2(b)),用于评估模型在云层遮挡场景下的下游任务性能,其训练集和验证集分别包含5,773张和1,668张图像;

在这里插入图片描述

图 5 ASRAirCL数据集

(3)ASRAirCL(Airplane Scene Representation – Airplane with Cloud-Level occlusio),从ASRAirC中进一步选取样本,并根据云层覆盖率将图像划分为1–10个等级,共包含4,691张图像,用于分析模型在不同遮挡强度条件下的性能稳定性。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐