DP-VLPA:长尾多标签识别的双阶段视觉语言预训练和适应

这篇论文主要做的是 长尾多标签识别。也就是一张图里可能同时存在多个类别,但不同类别的数据量差异很大:常见类样本很多,尾部类样本很少,模型往往容易识别“person、car”这类头部类别,却忽略“handbag、stop sign”等尾部类别。

代码地址:GitHub - dz1104/DP-VLPA: Dual-Phase Visual-Language Pretraining and Adaptation for Long-Tailed Multi-Label Recognition · GitHub

期刊:The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

创新点:

1.提出 DP-VLPA 双阶段框架,把整个方法分成两个阶段:第一阶段是 Knowledge Injection,主要解决尾部类语义信息不足的问题;第二阶段是 Adaptive Fine-tuning,主要解决模型在长尾数据上容易偏向头部类、忽略尾部类的问题;

2.提出 STAG 模块,用 LLM 生成尾部类别增强文本,用大语言模型根据图像标签和原始 caption 生成更详细的文本描述,尤其强调尾部类别及其上下文关系;

3.提出 DQR 动态 Query 重加权机制,模型在训练时容易被头部类主导,DQR 的作用就是找到和尾部类别更相关的视觉 query,并给它们更高的权重,让模型在训练和推理时更关注尾部类证据。

整体框架:

 DP-VLPA 框架

1.第一阶段:知识注入,解决尾类的信息贫乏问题

通过将标签和原始标题输入到 STAG,并引导大型语言模型生成新的、丰富的文本描述,特别是多个对象之间的关系,然后,通过自设计的一个基于视觉语言的模型来从这些增强的文本图像对中学习,该模型具有一组 K 个可学习的视觉查询 Q,它们通过 Q-Former 进行处理以提取关键视觉信息,产生细粒度的图像特征。

结构化尾部感知生成(STAG)详解

1.1STAG

首先,全局对比学习(GCL)损失建立了粗略的场景级对齐,其次通过获取任何图像查询和文本的全局“[CLS]”特征之间找到的最大相似度来计算图像 i 和文本 j 之间的总体相似度得分,并引入基于查询的细粒度对比学习(QCL)损失来创建单个单词和特定视觉区域之间的直接对应关系。

2.第二阶段:自适应微调,使知识丰富的模型适应特定的分类任务,重点关注尾类注意力和共现建模

首先,采用动态查询重新加权(DQR)机制来动态放大对于识别尾类至关重要的视觉查询的影响,其次,共现感知(COA)损失明确地告诉模型标签之间的统计依赖性。

2.1DQR:Dynamic Query Reweighting

动态提高尾部类别相关 query 的权重,因为头部类样本多,训练信号强,模型为了降低 loss,会优先关注这些常见类别,而DRQ会先判断哪些视觉queries 和当前图像里的尾部类别最相关,然后给这些 query 更大的权重。

2.2COA:Co-occurrence-Aware Loss

让模型学习标签之间的共现关系,先根据训练集统计一个类别共现矩阵 C,这个矩阵表示不同类别之间共同出现的概率,然后 COA 会约束模型 query 特征之间的相似性,让它和真实类别共现矩阵保持一致。

可创新:

目前先做 STAG-Lite,没有动模型结构,先从 prompt入手,对数据异常语义进行增强,想用 LLM 生成 tail-aware 描述来缓解尾类语义贫乏,但是想先看看效果,就生成了一个类别描述,效果还是挺好的,下一步准备找找开源数据集试一试,把自己的数据当作一个应用模块。

这是目前所做的一个结果汇总表。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐