面向半监督目标检测的混合尺度教师与有潜力标签挖掘
MixTeacher:面向半监督目标检测的混合尺度教师与有潜力标签挖掘
摘要:本文介绍了 MixTeacher,一种面向半监督目标检测的创新框架。该框架通过构建混合尺度特征金字塔,结合有潜力标签挖掘策略(PLM),有效解决了传统方法在处理极端尺度目标时的伪标签漏检问题。MixTeacher 的核心创新包括:1)混合尺度特征金字塔,融合原始分辨率与下采样特征以提升伪标签质量;2)跨尺度分数提升挖掘,从低置信度候选框中识别被常规尺度遗漏的正确目标;3)三尺度一致性训练,增强模型的尺度不变性。实验表明,MixTeacher 在 MS COCO 和 PASCAL VOC 多个半监督设定下均达到新的 SOTA 性能,且所有额外模块仅在训练阶段使用,推理时不增加计算开销。
📑 目录
01 论文信息
- 论文题目:MixTeacher: Mining Promising Labels with Mixed Scale Teacher for Semi-Supervised Object Detection
- 论文作者:Liang Liu, Boshen Zhang, Jiangning Zhang, Wuhao Zhang, Zhenye Gan, Guanzhong Tian, Wenbing Zhu, Yabiao Wang, Chengjie Wang
- 发表单位:腾讯优图实验室、上海交通大学、浙江大学、荣旗科技
- 发表会议/期刊:CVPR 2023
- 代码链接:https://github.com/lliuiz/MixTeacher
02 论文主要贡献
-
提出 MixTeacher 框架:首次在半监督目标检测中显式构建混合尺度特征金字塔,教师网络利用该金字塔生成质量更高的伪标签,有效缓解因目标尺度极端导致的伪标签漏检问题。
横轴:模型预测的置信度分数 (Score);纵轴:IoU=0.5 条件下的精确率 (Precision)、召回率 (Recall) -
提出有潜力标签挖掘策略(PLM):通过比较同一提案在常规尺度和混合尺度下的分类置信度提升(Δq),从低置信度候选框中挖掘出被常规尺度遗漏但混合尺度能正确识别的目标,显著减少假阴性。
-
可丢弃的多尺度模块:所有额外引入的模块(下采样分支、特征融合、混合尺度金字塔)仅在训练阶段使用,推理时完全移除,不增加计算开销,保证与原始检测器完全兼容。
-
在 MS COCO 和 PASCAL VOC 多个半监督设定下达到新 SOTA:在 COCO 2% 标注时达到 29.11 mAP(超越 PseCo 约 1.3),5% 标注时达到 34.06 mAP,10% 标注时达到 36.72 mAP;在 VOC 额外数据设定下 AP50-95 达到 56.25,均领先现有方法。
03 论文创新点
1. 混合尺度特征金字塔(Mixed-Scale Feature Pyramid)
- 做法:对同一张无标签图像,同时提取两个特征金字塔:一个来自原始分辨率(1×),另一个来自下采样到一半尺寸(0.5×)的图像。
- 如何融合:用一个轻量的“通道注意力”模块自动学习每个通道的融合权重,将对应层的特征进行加权相加,得到混合尺度的特征金字塔。
- 优点:参数量极少,成本低;由于0.5×下采样后,无需复杂对齐,天然可以融合。
- 作用:混合尺度特征同时包含大尺度和小尺度的信息,教师网络用它可以生成更准确的伪标签,尤其是对极端尺度的物体更精准。
2. 跨尺度分数提升挖掘(PLM)
- 问题:传统方法只保留置信度 > 0.9 的伪标签,导致很多置信度较低但实际上是正确的目标被当成背景被错误地识别。。
- 核心思路:如果一个物体在常规尺度下置信度较低,但在混合尺度下置信度明显提高,说明它是“有潜力的”——只是因为常规尺度不适合它。
- 做法:对这类低置信度候选框,计算得到一个提升量 Δq(混合尺度下的平均分类分数减去在常规尺度下的平均分数)。如果 Δq 超过一定阈值,就将其采纳为伪标签。
- 效果:在不引入过多假阳性的前提下,有效召回那些被常规尺度漏掉的正确目标,减少假阴性。
3. 三尺度一致性训练
- 设定:教师网络用混合尺度特征生成伪标签(只生成一次,用同一套伪标签)。
- 学生网络:同时输入三个不同的视图(原始尺度1×、下采样尺度0.5×、混合尺度),三个视图共用同一个检测头,都使用教师生成的同一套伪标签作为监督目标。
- 损失计算:三个视图分别计算检测损失,然后相加。
- 意义:强迫模型在不同尺度下对同一物体做出一致的预测,从而学习到尺度不变性;同时,每个分支都能从更准确的混合尺度伪标签中获益,互相促进。
04 方法
4.1 问题定义与基础框架
- 任务定义:给定少量有标签数据集 和大量无标签数据集,训练目标检测模型。
- 基础范式:Mean Teacher + 伪标签。教师网络(EMA of student)对无标签图像的弱增强视图生成伪标签,学生网络对强增强视图学习。
- 总损失:

4.2 混合尺度教师(Mixed Scale Teacher)

4.2.1 特征金字塔提取
- 输入图像经过 backbone + FPN,得到常规尺度金字塔
- 同时将图像下采样 0.5×,再次经过同一 backbone + FPN,得到小尺度金字塔
- 由于下采样因子为 0.5,空间上常规尺度Pi和小尺度Pi-1尺寸相同,便于融合。
4.2.2 融合模块设计
-
对每一层 i(i ≥ 3),定义融合权重:

-
混合尺度特征:

-
参数量:仅增加一个轻量 MLP(两个全连接层 + ReLU),相比检测器主干可忽略不计。
4.2.3 伪标签生成与训练目标
- 教师网络:输入图像常规尺度和下采样尺度,构造混合尺度金字塔
- 学生网络:同时输入三个视图(1×,0.5×,混合×),共享检测头,均用来监督计算损失。

4.3 有潜力标签挖掘(Promising Labels Mining, PLM)
4.3.1 动机
- 高阈值能保证高精度,但会漏掉大量低置信度的正确目标,尤其是极端尺度目标。
- 低阈值又会引入很多假阳性。
- 在低置信度下挖掘有潜力的标签,在混合尺度特征下,这些被遗漏的目标往往置信度提升明显。
4.3.2 具体流程
-
构建候选框集合:对每张无标签图像,教师网络的 RPN 生成若干 proposal。
-
高置信度伪标签:分类分数 > 设定的置信度阈值 的直接保留(用于所有尺度)。
-
低置信度候选:分类分数 在合理阈值范围内 的进入 PLM 流程。
-
计算分数提升 Δq:
- 对每个候选框,提取其在常规尺度下的 proposal bag(通常 K 个 proposal)。
- 分别送入教师网络的分类头输入为常规尺度特征和混合尺度特征,得到每个 proposal 对类别 c 的分数。。
- 计算平均值之差:

-
筛选:若 Δq > δ(δ=0.1),则将该候选框视为“有潜力伪标签”,加入到训练中(仅用于分类损失,回归仍采用不确定性阈值)。
- 注意:整个过程使用教师网络的参数θ,且只用常规尺度作为源、混合尺度作为目标,避免强增广的干扰。
4.3.3 与现有标签分配方法的区别
- 之前的标签分配方法(如 OTA、TOOD)主要解决正负样本不平衡问题,但无法处理“因置信度低而被完全忽略”的伪标签。
- PLM 显式挖掘了这些被常规尺度遗漏的 hard examples,与现有方法是正交的。
4.4 训练与推理细节
- 检测器:Faster R-CNN + FPN + ResNet-50(也测试了 FCOS)
- 优化:SGD,base lr=0.01,8 GPUs
- 超参数:
- 温度 T = 3.0
- 高阈值 τ_h = 0.9
- 低阈值 τ_l = 0.7
- 提升阈值 δ = 0.1
- α(无监督损失权重):COCO 部分标注 4.0,其他 2.0
- 推理:仅使用常规尺度输入,丢弃下采样分支和混合融合模块,速度与原始 Faster R-CNN 完全相同。
05 实验分析
5.1 数据集与设置
- MS COCO:
- 部分标注:随机抽取 1%/2%/5%/10% 的 train2017 作为有标签,其余为无标签;报告 5 折均值和标准差。
- 额外标注:全部 118k train2017 有标签 + 123k unlabeled2017 无标签。
- PASCAL VOC:
- 额外:VOC07 trainval 有标签 + VOC12 trainval 无标签。
- 混合:VOC07 trainval 有标签 + COCO 中 20 类相关图像 + VOC12 trainval 无标签。
- 评估指标:COCO 标准 AP(AP50:95, AP50, AP75, APs, APm, APl)。
5.2 与 SOTA 对比(核心结果)
5.2.1 COCO 部分标注

- 解读:在 1% 极端稀疏下,MixTeacher 与需要类分布估计的 LabelMatching 几乎持平(差距仅 0.65,但标准误差更小);在 2%/5%/10% 下均显著超越之前的所有方法。这证明混合尺度教师和 PLM 在低标注比例下尤其有效。
5.2.2 COCO 额外标注(全量有标签 + 额外无标签)
- MixTeacher 达到 45.7 mAP,与 PseCo (46.1) 和 Soft Teacher (44.5) 相比非常有竞争力。说明即使在有标签数据充足时,额外无标签数据仍能通过混合尺度获益。
5.2.3 在 FCOS(anchor-free)上的结果

- 证明 MixTeacher 不依赖于 anchor 机制,可推广到其他检测器。
5.2.4 PASCAL VOC 结果
- VOC 额外:MixTeacher 达到 AP50=85.85,AP50-95=56.25,均优于 LabelMatching(85.48 / 55.11)和 Rethinking Pse(79.00 / 54.60)。
- VOC 混合:MixTeacher 达到 AP50=86.58,AP50-95=56.83,同样最佳。
- 这进一步验证了方法在小型数据集上的鲁棒性。
5.3 消融实验与深入分析
5.3.1 各组件贡献(10% 标注)

- 关键发现单纯引入混合尺度特征但伪标签仍由常规尺度生成成,反而导致性能下降(34.1 vs 34.7)。这说明必须让教师网络使用混合尺度生成伪标签,否则多尺度特征无法对齐正确的监督信号。
- PLM 带来额外 0.5 mAP 提升,说明挖掘低置信度候选的有效性。
5.3.2 与其他多视图方法的比较

- 相比只做尺度一致性正则化(SCR、MSIL),MixTeacher 带来了超过 1.3 mAP 的显著提升。即使训练时随机丢弃一条路径(减少计算),仍能保持 36.0 mAP,超过之前最佳方法。
5.3.3 不同特征融合方式对比

- SE-like 的加权融合明显优于简单的相加或拼接融合,说明自适应选择尺度的重要性。
5.3.4 不同测试尺度的性能

- 下采样尺度对于大物体(AP_l)最高(50.0),但小物体极差(14.6);混合尺度在保持小物体能力的同时,大物体达到 51.1,综合最佳。这验证了混合尺度作为伪标签生成源的合理性——它能平衡各尺度。
5.3.5 超参数敏感性

- 温度 T:T=3.0 最佳(mAP=36.2),T 过小导致融合权重接近 0.5,失去选择性;T 过大使融合退化为硬选择。
- 低阈值 τ_l:0.7 最佳(mAP=36.7),τ_l 太低会引入过多噪声,太高则遗漏可挖掘样本。
- 提升阈值 δ:0.1 最佳(mAP=36.7),对应每图平均挖掘 0.28 个额外框,带来 0.5 mAP 提升。
5.4 定性可视化

- 图4(a):对比常规尺度和混合尺度生成的伪标签。混合尺度生成的框更准确(如大物体和小物体都能召回),而常规尺度存在明显的漏检(false negative)。
- 图4(b):对比阈值 0.7、0.9 和 PLM。阈值 0.9 时漏检很多,阈值 0.7 时出现假阳性;PLM 成功挖掘出被 0.9 漏掉但被混合尺度正确识别的目标(青色框),且不会引入额外假阳性。
06 结论与局限性
结论
- MixTeacher 通过混合尺度教师显式提高了伪标签质量,并利用 PLM 挖掘低置信度中的 hard positives,在半监督目标检测的尺度变化问题上取得了 SOTA。
- 方法简单、额外参数少、推理无开销,可灵活集成到现有检测框架。
局限性
- 目前基于较老式的 Faster R-CNN + 标准 FPN,尚未探索更先进的 FPN 变体(如 TridentNet、NAS-FPN)或更优的标签分配策略(如 OTA、TOOD)能否带来进一步提升。
- PLM 依赖于 RPN 生成的 proposal bag,在 anchor-free 检测器上的实现可能需要调整(但表2中 FCOS 实验已验证整体框架有效)。
- 训练时多尺度分支增加了约 1.5 倍的计算开销(1.22 vs 0.75 sec/iter),但可通过随机丢弃路径缓解(1.03 sec/iter,mAP 仅下降 0.2)。
07 个人声明
本文为作者对原论文的详细学习笔记与汇报材料。受个人学识与理解所限,文中对论文内容的解读或有不周之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)