TPAMI 2024 | EMAE | 具有自一致性的高效掩码自动编码器

论文题目:Efficient masked autoencoders with self-consistency
论文作者:Z Li, Y Zhu, Z Chen, W Li, R Zhao, C Zhao, M Tang, J Wang
发表单位:中国科学院自动化研究所(模式识别国家重点实验室、基础模型研究中心)、鹏城实验室、中国科学院大学
发表会议 / 期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2024
代码链接:暂未公开

论文主要贡献

该论文针对掩码图像建模(MIM)中高掩码率导致数据利用率低、预训练周期长、预测结果不一致三大痛点,提出高效自洽掩码自编码器(EMAE)。通过并行掩码策略实现图像块全量利用,显著提升预训练效率;引入自洽学习机制约束不同掩码视图的预测一致性,增强特征可靠性。实验表明,EMAE 仅用 MAE 约 13% 的预训练时间,即可在 ImageNet 分类、COCO 目标检测、ADE20K 语义分割等任务上超越 MAE 并达到 SOTA,为高效、稳定的掩码图像建模提供了新范式。

论文创新点

  1. 提出并行掩码策略,将图像划分为多个非重叠区域,在单次迭代中并行执行掩码图像建模(MIM)任务,实现图像块的全量利用,大幅提升数据利用效率,仅用 MAE 约 13% 的预训练时间即可完成训练。
  2. 设计自一致性学习机制,针对不同掩码轮次中同一图像块预测不一致的缺陷,引入一致性约束,强制模型对重叠掩码块生成语义一致的预测,有效消除掩码随机性带来的表示偏差,提升特征的鲁棒性。
  3. 将并行掩码与自一致性学习结合,既显著缩短了预训练周期,又保证了特征表示的可靠性;在 ImageNet、COCO、ADE20K 等多个主流数据集上,EMAE 在图像分类、目标检测、语义分割任务中均取得 SOTA 级性能,验证了方法的有效性与泛化性。

方法

在这里插入图片描述

MIM基准的掩码平均绝对误差(MAE)

图像分块与掩码策略

1. 图像分块
将输入图像切分为 N N N个固定块,每个块表示为 x ∈ R N × S \boldsymbol{x} \in \mathbb{R}^{N \times S} xRN×S S S S为块维度,如16×16块的 S = 256 S=256 S=256)。

2. 随机掩码
生成二进制掩码 m ∈ { 0 , 1 } N \boldsymbol{m} \in \{0,1\}^N m{0,1}N 0 0 0=可见、 1 1 1=遮蔽),掩码比例为 p p p(如75%):

  • 可见块(编码器输入): x v = x ⋅ ( 1 − m ) ∈ R κ × S \boldsymbol{x}_v = \boldsymbol{x} \cdot (1-\boldsymbol{m}) \in \mathbb{R}^{\kappa \times S} xv=x(1m)Rκ×S κ = N × ( 1 − p ) \kappa = N \times (1-p) κ=N×(1p)
  • 掩码块(解码器目标): x m = x ⋅ m ∈ R η × S \boldsymbol{x}_m = \boldsymbol{x} \cdot \boldsymbol{m} \in \mathbb{R}^{\eta \times S} xm=xmRη×S η = N × p \eta = N \times p η=N×p

该策略让模型基于少量可见块(如25%)重建掩码块(如75%),但存在单轮数据利用率低的问题。

编码器-解码器架构
编码器:仅处理可见块 ,输出潜在特征(如ViT编码器通过自注意力提取全局特征)。
解码器:接收编码器输出的可见块特征,结合掩码位置信息,重建掩码块 x_mx
m的原始像素值(或特征)。解码器通常设计为轻量级(如MAE解码器仅8层Transformer),仅用于重建任务,不参与下游任务。

损失函数:像素级重建误差

MAE通过最小化**重建掩码块与原始掩码块的均方误差(MSE)**优化模型,损失函数定义为:
L MAE ( x ) = L ( x v , x m ) = E ∥ g ( f ( x v ) ) − x m ∥ 2 \mathcal{L}_{\text{MAE}}(\boldsymbol{x}) = \mathcal{L}(\boldsymbol{x}_v, \boldsymbol{x}_m) = \mathbb{E}\left\| g\left(f(\boldsymbol{x}_v)\right) - \boldsymbol{x}_m \right\|^2 LMAE(x)=L(xv,xm)=Eg(f(xv))xm2
其中:

  • f ( ⋅ ) f(\cdot) f()为编码器(处理可见块 x v \boldsymbol{x}_v xv);
  • g ( ⋅ ) g(\cdot) g()为解码器(基于编码器输出重建掩码块)。

该损失仅计算掩码块 x m \boldsymbol{x}_m xm的重建误差(可见块无需预测,故不参与损失计算)。

并行掩模策略

在这里插入图片描述

  1. 图像分块与随机索引生成
    将输入图像 x \boldsymbol{x} x划分为 N N N个等大图像块;生成长度为 N N N的随机张量 t \boldsymbol{t} t(元素服从 [ 0 , 1 ] [0,1] [0,1]均匀分布),对 t \boldsymbol{t} t按数值升序排序,得到排序后的索引序列 i d s \boldsymbol{ids} ids,即:
    i d s = S ( t ) \boldsymbol{ids} = \mathcal{S}(\boldsymbol{t}) ids=S(t)
    其中 S ( ⋅ ) \mathcal{S}(\cdot) S()表示排序操作。

  2. 索引均匀划分为 K K K个不重叠子集
    将长度为 N N N的索引序列 i d s \boldsymbol{ids} ids等分为 K K K个无重叠的子集 i d s 1 , i d s 2 , … , i d s K \boldsymbol{ids}_1, \boldsymbol{ids}_2, \dots, \boldsymbol{ids}_K ids1,ids2,,idsK,第 i i i个子集的索引范围为:
    i d s i = i d s [ ( i − 1 ) × N K : i × N K ] \boldsymbol{ids}_i = \boldsymbol{ids}\left[(i-1) \times \frac{N}{K}: i \times \frac{N}{K}\right] idsi=ids[(i1)×KN:i×KN]
    基于该子集索引,可从原始图像块中提取对应的可见块部分 x v i \boldsymbol{x}_{v_i} xvi,即:
    x v i = D ( x , i d s i ) \boldsymbol{x}_{v_i} = \mathcal{D}(\boldsymbol{x}, \boldsymbol{ids}_i) xvi=D(x,idsi)
    其中 D ( ⋅ ) \mathcal{D}(\cdot) D()表示根据索引提取图像块的操作。

  3. 掩码生成与掩码块提取
    针对第 i i i个子集,生成对应的掩码 m i \boldsymbol{m}_i mi(标记当前子集中的可见块区域),即:
    m i = M S ( t , i d s i ) \boldsymbol{m}_i = \mathcal{MS}(\boldsymbol{t}, \boldsymbol{ids}_i) mi=MS(t,idsi)
    通过掩码 m i \boldsymbol{m}_i mi与原始图像 x \boldsymbol{x} x的逐元素运算,得到该子集对应的掩码块 x m i \boldsymbol{x}_{m_i} xmi
    x m i = x ⊙ m i \boldsymbol{x}_{m_i} = \boldsymbol{x} \odot \boldsymbol{m}_i xmi=xmi

  4. 并行MIM任务与整体损失
    将每个子集的可见块 x v i \boldsymbol{x}_{v_i} xvi输入编码器-解码器架构,执行掩码图像建模(MIM)任务;对 K K K个子集的任务损失取期望,得到整体损失:
    L whole ( x ) = E i ∈ [ 1 , K ] L ( x v i , x m i ) \mathcal{L}_{\text{whole}}(\boldsymbol{x}) = \mathbb{E}_{i \in [1,K]} \mathcal{L}(\boldsymbol{x}_{v_i}, \boldsymbol{x}_{m_i}) Lwhole(x)=Ei[1,K]L(xvi,xmi)

自洽学习

为解决不同掩码轮次下同一图像块预测结果不一致的问题,EMAE引入自洽学习,通过约束不同子集预测结果的重叠区域,强制模型输出语义统一的表征。

1. 重叠预测区域的定义

对于任意两个子集 i i i j j j,其掩码 m i \boldsymbol{m}_i mi m j \boldsymbol{m}_j mj的交集,即为两者预测结果的重叠位置 s i j \boldsymbol{s}_{ij} sij
s i j = m i ∩ m j \boldsymbol{s}_{ij} = \boldsymbol{m}_i \cap \boldsymbol{m}_j sij=mimj

2. 自洽损失函数

自洽损失的核心是最小化重叠区域内两组预测结果的差异,同时通过梯度停止操作( sg [ ⋅ ] \text{sg}[\cdot] sg[])避免梯度冲突。其定义为:
L s c ( x v i , x v j ) = E ( ∥ sg [ x p i ] − x p j ∥ + ∥ x p i − sg [ x p j ] ∥ ) ⊙ s i j \mathcal{L}_{sc}(\boldsymbol{x}_{v_i}, \boldsymbol{x}_{v_j}) = \mathbb{E}\left( \left\| \text{sg}[\boldsymbol{x}_{p_i}] - \boldsymbol{x}_{p_j} \right\| + \left\| \boldsymbol{x}_{p_i} - \text{sg}[\boldsymbol{x}_{p_j}] \right\| \right) \odot \boldsymbol{s}_{ij} Lsc(xvi,xvj)=E( sg[xpi]xpj + xpisg[xpj] )sij
其中:

  • x p i \boldsymbol{x}_{p_i} xpi x p j \boldsymbol{x}_{p_j} xpj分别为子集 i i i j j j对应的预测结果;
  • sg [ ⋅ ] \text{sg}[\cdot] sg[]表示梯度停止操作(仅传递前向计算结果,不反向传播梯度);
  • ⊙ \odot 为逐元素乘法,仅保留重叠区域 s i j \boldsymbol{s}_{ij} sij内的损失。
3. 整体自洽损失

对所有子集对的自洽损失取期望,得到图像级的自洽损失:
L consistency ( x ) = E i ∈ [ 1 , K ] , j ∈ [ i + 1 , K ] L s c ( x v i , x v j ) \mathcal{L}_{\text{consistency}}(\boldsymbol{x}) = \mathbb{E}_{\substack{i \in [1,K], \\ j \in [i+1,K]}} \mathcal{L}_{sc}(\boldsymbol{x}_{v_i}, \boldsymbol{x}_{v_j}) Lconsistency(x)=Ei[1,K],j[i+1,K]Lsc(xvi,xvj)

4. EMAE的最终损失函数

将“并行掩码的MIM损失”与“自洽损失”结合,得到EMAE的总损失:
L total ( x ) = L whole ( x ) + L consistency ( x ) \mathcal{L}_{\text{total}}(\boldsymbol{x}) = \mathcal{L}_{\text{whole}}(\boldsymbol{x}) + \mathcal{L}_{\text{consistency}}(\boldsymbol{x}) Ltotal(x)=Lwhole(x)+Lconsistency(x)

该设计通过约束重叠区域的预测一致性,让模型对同一图像块的输出更稳定,既解决了高掩码率下的预测偏差问题,又不依赖额外数据或复杂模块,是EMAE表征可靠性的核心保障。

实验分析

  1. ImageNet-1K分类(表II):
    效率优势:ViT-Base仅300 epoch预训练,线性探测准确率达68.2%(与MAE 2400 epoch相当),微调准确率83.8%;ViT-Large 800 epoch线性探测76.7%、微调86.3%,超越MAE 1600 epoch(75.6%/85.9%)。
    在这里插入图片描述

  2. 目标检测与实例分割(表III-V):
    COCO数据集:ViT-Base 300 epoch APb=50.6%(MAE 1600 epoch为50.4%);ViT-Large+ViTDet+Cascade Mask R-CNN达58.1% APb、50.4% APm,超越MAE+级联(57.6%/50.0%)。
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述

  3. 语义分割(表VI):
    ADE20K数据集:ViT-Base 800 epoch mIoU=49.3%(MAE 1600 epoch为48.1%),采用CAE设置时达50.8% SOTA。
    在这里插入图片描述

消融实验与分析

在这里插入图片描述

泛化性验证
  1. 多数据集预训练:在COCO(表VIII)、OpenImages(表IX)上,EMAE 100-4000 epoch性能均优于MAE 8000 epoch,验证对非图标数据集的适应性。
    长周期训练增益:ViT-Base 1600 epoch线性探测71.2%、微调84.2%,性能持续提升。
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述

个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐