CVPR | 2026 | RVM-MAE
文章目录
CVPR | 2026 | RVM-MAE
- 论文:
https://openaccess.thecvf.com/content/CVPR2026/papers/Zoran_Recurrent_Video_Masked_Autoencoders_CVPR_2026_paper.pdf - 期刊:CVPR
- 时间:2026
创新点
-
本文设计循环视频掩码自编码器(RVM),引入循环计算机制建模视频时序结构,结合非对称掩码目标函数与Transformer循环神经网络,高效聚合视频时序信息,仅通过简单像素重建损失即可完成自监督训练
-
创新性融合空间域与时间域建模能力,打破传统图像模型空间表征强、时序能力弱,视频模型时序建模优、空间几何表征不足的固有壁垒,实现双领域性能兼顾
-
提出基于GRU与Transformer结合的循环核心模块,摒弃传统视频模型二次方级计算开销,实现时序处理线性计算成本,有效解决长视频序列特征不稳定、推理成本高的问题
-
模型具备极致参数效率,无需知识蒸馏即可实现小模型高性能,参数效率远超同类视频掩码自编码器,最高可达传统模型的30倍
贡献
-
提出全新通用型视频自监督预训练框架RVM,通过循环时序建模与非对称掩码重建,同时适配密集空间几何任务与动态时空视频任务,通用表征能力远超现有主流模型
-
设计轻量化循环时序聚合架构,可在超长时间跨度内实现稳定特征传播,以线性计算成本处理视频序列,适配流式推理、长视频分析、机器人在线控制等实际场景
-
大量实验证明,RVM 在动作分类、物体追踪、语义分割、深度估计、关键点检测等多类下游任务中均达到最优性能,兼具图像模型的空间精度与视频模型的时序感知能力
-
消融实验充分验证循环架构、非对称掩码、多帧源输入的核心作用,模型可依托海量无标注视频数据持续优化性能,无过拟合问题,具备极强的扩展性与工程落地价值
摘要及引言
- 视频自监督学习是视觉表征学习的核心研究方向,依托掩码自编码器范式的VideoMAE、V-JEPA等模型,已成为视频特征学习的主流方案。但现有视频模型普遍存在设计缺陷,多采用对称掩码与全局时空注意力机制,忽略视频时序的因果性与方向性,无法适配在线流式推理场景,且长序列处理时计算成本高昂、特征稳定性差
- 与此同时,现有视觉模型存在明显能力割裂:以DINOv2为代表的图像模型擅长挖掘空间几何、像素级精细特征,但无法捕捉视频帧间运动与时序依赖;VideoMAE等视频模型侧重时序动态建模,却大幅牺牲空间表征精度,两类模型无法兼顾双场景需求。此外,主流小尺寸视觉模型普遍依赖知识蒸馏提升性能,参数效率低、部署成本高
- 为解决上述问题,本文团队提出循环视频掩码自编码器(RVM),创新将非对称掩码自监督范式与循环时序计算机制结合。模型通过独立ViT编码单帧空间特征,再依托循环神经网络聚合跨帧时序信息,精准建模视频动态规律。区别于传统对称掩码方案,RVM 以未掩码历史源帧为条件,重建高掩码比例的未来目标帧,显式学习时序因果特征
- 大量实验表明,RVM 构建了全新的视觉模型帕累托最优前沿,时空任务性能媲美顶尖视频模型,空间几何任务匹配甚至超越专业图像模型。其循环架构可实现长时序稳定特征传播与线性计算开销,小模型无需蒸馏即可实现卓越性能,参数效率大幅领先同类方法
预备知识
-
掩码自编码器(MAE):主流自监督视觉学习范式,通过掩码图像/视频部分标记,依托可见区域特征重建掩码区域内容,无监督学习通用视觉表征
-
非对称掩码机制:区分视频源帧与目标帧,对未来目标帧执行高比例掩码、历史源帧完整保留,基于时序先后关系构建重建任务,建模视频因果性
-
循环神经网络(GRU):具备状态记忆能力的时序网络,通过门控机制更新历史状态与当前输入信息,可线性处理序列数据,适配长时序依赖建模
-
傅里叶位置编码:替代传统位置编码的轻量化编码方式,为图像分块标记补充精准空间位置信息,适配Transformer编码需求
-
交叉注意力机制:通过查询、键值映射实现不同特征交互,以源帧时序特征引导目标帧掩码区域重建,完成跨帧信息聚合
-
参数效率:模型性能与参数量、计算量的匹配效率,高参数效率模型可依托小体量实现高精度,适配轻量化部署场景
-
循环神经⽹络(RNN):按时间顺序逐帧处理数据,保留上⼀时刻的记忆(状态),天然适配序列 / 视频数据
方法

图1:RVM的整体架构。该架构包含:(a)分词与掩码处理模块、(b)单帧ViT编码器、(c)GRU循环时序聚合模块、(d)交叉注意力解码器、(e)损失计算模块
a 分词与掩码处理模块
(1)输入视频序列,逐帧将原始图像切分为固定尺寸的非重叠图像块,通过可学习线性投影完成图像块嵌入,生成规整的标记序列
(2)对所有帧的标记序列添加傅里叶位置编码,补充空间位置信息,并拼接可学习的[CLS]标记,统一模型输入格式
(3)采用非对称掩码策略区分源帧与目标帧:训练所用历史源帧完全不掩码,保留完整空间特征;未来目标帧采用95%超高比例随机掩码,仅留存少量有效标记
(4)将处理完成的源帧完整标记序列、掩码目标帧标记序列分别送入编码器,为后续时序建模与图像重建提供输入
b 单帧ViT编码器
(1)采用预归一化、无丢弃层的标准ViT模块作为基础编码器,所有视频帧共享同一套编码器权重,保证特征空间一致性
(2)独立对每一帧图像标记进行特征提取,逐帧挖掘图像的局部纹理、空间结构、语义信息,输出精细化单帧空间特征
(3)编码器不参与时序交互,仅专注空间表征学习,完整保留图像几何与细节特征,为后续时序聚合提供高质量基础特征
c GRU循环时序聚合模块(核心创新)
(1)接收ViT输出的连续多帧源帧特征,初始化零向量时序状态,按视频时间步序贯处理帧特征,实现时序信息逐步聚合
(2)融合GRU门控机制与Transformer注意力结构,通过重置门过滤无效历史时序信息,通过更新门平衡历史状态与当前帧新特征
(3)以当前帧空间特征为查询向量,历史时序状态为键值向量,通过交叉注意力完成帧间信息交互,精准捕捉短时运动特征与长时时序依赖
(4)持续迭代更新时序状态与输出特征,全程仅产生线性计算开销,彻底解决传统时空注意力模型二次方级计算复杂度的弊端
(5)最终输出融合空间细节与全局时序动态的高质量表征,作为解码器重建掩码帧的核心依据
该模块核心计算公式如下:
u t = σ ( W e u e ^ t + W s u s t − 1 ) u_{t}=\sigma\left(W_{e}^{u} \hat{e}_{t}+W_{s}^{u} s_{t-1}\right) ut=σ(Weue^t+Wsust−1)
r t = σ ( W t r e ^ t + W s r s t − 1 ) r_{t}=\sigma\left(W_{t}^{r} \hat{e}_{t}+W_{s}^{r} s_{t-1}\right) rt=σ(Wtre^t+Wsrst−1)
h ^ t = T x ( q = e ^ t , k v = r t ⊙ s t − 1 ) \hat{h}_{t}=Tx\left(q=\hat{e}_{t}, k v=r_{t} \odot s_{t-1}\right) h^t=Tx(q=e^t,kv=rt⊙st−1)
s t = ( 1 − u t ) ⊙ s t − 1 + u t ⊙ h ^ t s_{t}=\left(1-u_{t}\right) \odot s_{t-1}+u_{t} \odot \hat{h}_{t} st=(1−ut)⊙st−1+ut⊙h^t
o t = s t o_{t}=s_{t} ot=st
其中, u t u_t ut为更新门、 r t r_t rt为重置门, e ^ t \hat{e}_t e^t为当前帧编码特征, s t − 1 s_{t-1} st−1为上一时刻时序状态, T x Tx Tx为混合注意力Transformer模块, σ \sigma σ为Sigmoid激活函数
d 解码器
(1)输入由掩码占位标记、少量可见标记组成的目标帧序列,以及循环模块输出的源帧时序聚合特征
(2)解码器由交叉注意力、MLP前向网络、自注意力三层核心组件堆叠而成,全程配备残差连接与预归一化处理,保证训练稳定性
(3)以掩码目标帧标记为查询,源帧时序融合特征为键值,通过交叉注意力实现全局时序信息引导,精准还原掩码区域像素信息
(4)将解码后的特征映射至原始图像块维度,重构出完整的目标视频帧,用于后续损失计算
e 损失函数
- 模型全程采用全局像素级 L 2 L_2 L2损失函数,直接计算重建帧与原始目标帧的像素误差,不进行分块归一化处理。仅依靠单一像素重建损失完成自监督训练,无需额外正则化、数据增强、知识蒸馏等辅助手段,训练框架简洁高效
训练细节
- 训练数据集:整合HowTo100M、Kinetics700、SSV2、YTBB等公开视频数据集,构建包含840万段视频片段、20亿训练样本的大规模混合训练集,场景与运动类型覆盖广泛
- 数据预处理:所有视频帧统一缩放至256×256分辨率,采用随机翻转、随机缩放裁剪完成数据增强,提升模型泛化能力
- 训练配置:单次迭代输入4帧连续源帧,在最后一帧源帧后4~48帧区间随机采样目标帧;全局批次大小设置为2048,基础模型训练100万步,消融实验模型训练25万步
- 优化策略:采用AdamW优化器搭配余弦衰减学习率调度,结合FSDP参数分片技术适配大尺度训练;前向与反向传播采用bfloat16精度,损失计算与权重参数存储为float32精度,兼顾训练效率与稳定性
用于下游任务的RVM
RVM预训练编码器具备极强的通用表征能力,可无缝适配两大类视觉下游任务,无需针对性微调架构:
- 时空视频任务:动作分类、视频物体追踪、点位追踪、视频实例解析
- 空间几何任务:室内深度估计、视频语义分割、人体关键点追踪、人体部位追踪
实验
通用视觉表征性能对比

表1:大规模模型综合性能对比
组1:图像基准模型(DINOv2系列)
(1) 优势:在深度估计、语义分割等空间几何任务中表现优异,像素级表征精度高
(2) 劣势:无法有效建模帧间运动与时序依赖,视频追踪、动作识别等时空任务性能大幅衰减
组2:主流视频基准模型(VideoMAE、V-JEPA2、4DS)
(1) 优势:擅长捕捉视频时序动态与运动特征,时空任务性能突出
(2) 劣势:空间几何表征能力薄弱,密集像素级任务精度远低于专业图像模型
组3:本文RVM模型
(1) 性能:在空间任务与时空任务中均保持顶尖性能,综合归一化平均性能全面超越所有基线模型
(2) 结论:RVM 彻底打破图像模型与视频模型的能力边界,实现空间、时空表征能力的双向最优,是当前综合性能最强的通用视觉编码器
小模型性能与参数效率测试

表2:RVM 无需蒸馏即可实现强大的小型模型性能
测试基线:SiamMAE-S、4DS-S、蒸馏版DINOv2-S、VideoMAE-B
实验结果:仅34M参数量的RVM-S,无需任何知识蒸馏,在8项主流视觉评估任务中,6项性能超越四倍参数量的VideoMAE-B,综合归一化性能领先所有同体量模型
结论:RVM架构具备极致参数效率,彻底摆脱小模型依赖蒸馏优化的行业痛点,同等性能下参数效率最高可达传统视频MAE模型的30倍,轻量化部署优势显著
长时序特征稳定性测试

表3:RVM 的特征在长时间尺度上具有独特的稳定性
测试方案:选取80帧以上超长视频序列,在16帧、32帧、48帧、64帧、80帧不同帧间隔下,基于Davis分割任务测试模型特征稳定性
实验结果:所有模型性能均随时长增加产生衰减,但RVM性能衰减速率远低于VideoMAE、DINOv2等基线模型;且循环架构的线性计算开销,对比传统时空注意力模型的二次方级开销,长视频推理效率优势随序列长度增加持续放大
结论:RVM循环时序机制可有效留存长距离时序关联信息,超长序列特征稳定性与推理效率全面领先主流模型
消融研究

表4:RVM 消融实验
(1)源帧数量消融
-
1帧源帧:性能与SiamMAE持平,仅能学习静态空间特征,无法捕捉运动信息
-
2帧源帧:可识别匀速简单运动,无法建模加速度等高阶动态特征
-
4帧源帧:所有下游任务性能达到峰值,可完整捕捉复杂时序动态与帧间关联
结论:4帧源输入为最优配置,多帧时序信息可显著提升模型动态建模能力。
(2)时序聚合架构消融
-
全自注意力聚合:计算开销大,运动理解类任务性能受限
-
RNN循环聚合(本文方案):计算效率更高,动作识别、深度估计等任务性能全面提升
结论:循环时序聚合架构比纯自注意力更适配视频序列建模,兼顾性能与效率。
(3)训练数据量消融
- 2.5亿/5亿/10亿/20亿训练样本:模型性能随数据量递增持续提升,全程无过拟合现象
结论:RVM表征学习能力具备极强扩展性,可依托海量无标注数据持续优化性能。
定性可视化实验
-
PCA与K-Means聚类可视化:RVM对长视频特征的聚类结果语义清晰、时序一致性强,可精准划分视频场景与目标区域,特征结构化程度更高。
-
纯噪声运动目标测试:在单帧无有效结构、仅存在帧间运动的白噪声视频中,图像模型完全失效,RVM可依托时序聚合能力精准识别运动目标。
-
多模型特征对比:相较于VideoMAE、V-JEPA、DINOv2,RVM输出的特征图噪声更少、时空结构更连贯,表征质量显著领先。
局限性
-
短视频场景下,循环时序架构的效率优势无法发挥,计算负担略优于传统分块式视频模型
-
训练过程中需逐帧执行ViT编码器反向传播,对设备内存资源要求较高,训练成本有一定门槛
-
模型性能随训练数据量增加持续提升,暂未探明数据饱和点,大规模扩展规律仍需进一步探索
结论
-
本文提出一种面向通用视频表征学习的循环视频掩码自编码器(RVM),通过循环时序计算机制与非对称掩码重建任务,精准建模视频时空特征。模型创新性结合单帧空间编码与循环时序聚合,既保留了图像模型的精细空间几何表征能力,又具备视频模型的动态时序建模优势,成功弥合了两类视觉模型的能力鸿沟
-
大量实验证明,RVM在动作分类、目标追踪、语义分割、深度估计等多类下游任务中实现最优性能,同时具备极致参数效率与长时序稳定性,小模型无需蒸馏即可落地应用。其线性计算开销的循环架构,可高效适配长视频、流式推理、机器人控制等复杂场景,具备极高的学术价值与工程应用价值
未来方向
-
引入多模态先验信息,融合文本、音频特征,拓展多模态视频基础模型能力边界
-
针对机器人实时控制、超长视频分析等落地场景,对模型架构与推理策略进行定向优化
-
探索模型数据饱和边界,建立标准化的模型规模与训练数据扩展方案
-
融入更多视频时序物理先验知识,提升极端场景下复杂运动特征的建模能力
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)