ICCV 2025 | IRGPT:利用大规模基准测试的双模态课程理解真实世界的红外图像
文章目录
1 论文信息

- 论文题目:
IRGPT: Understanding Real-world Infrared Image with Bi-cross-modal Curriculum on Large-scale Benchmark - 论文作者:Zhe Cao,Jin Zhang,Ruiheng Zhang
- 发表单位:Beijing Institute of Technology(北京理工大学)
- 发表会议:ICCV 2025
- 代码链接:https://github.com/WheatCao/ICCV2025-IRGPT
2 论文主要贡献
- 数据层面 开源了大规模真实红外-文本数据集IR-TD,为红外多模态研究提供了高质量基准数据支撑
- 模型层面 提出了专用红外多模态大模型IRGPT,在红外图像问答、描述、分类等多任务上实现了SOTA性能
- 方法层面 提出双跨模态课程迁移学习策略,实现了可见光到红外领域的高校知识迁移,为跨模态领域自适应提供了新思路
3 论文创新点
(1)数据集构建
基于大规模红外-文本数据集(IR-TD),包含超过26万组真实的图像-文本对
(2)模型设计
提出首款面向真实场景红外图像的多模态大语言模型IRGPT
(3)学习策略
提出双向跨模态课程迁移学习策略,通过考量 “红外 - 可见光”“红外 - 文本” 两个维度的难度分数,实现从可见光领域到红外领域的系统性知识迁移

图 1 现有的多模态大语言模型在解读真实世界的红外图像时会出现幻觉,而IRGPT能有效抑制这一现象。
4 方法
研究目的:构建真实有效的红外-文本数据集(IR-TD),推动红外多模态大型语言模型的发展
研究方法:
- 一方面,手动筛选可见光-红外图像对,利用大型语言模型为可见光图像生成描述初稿并调整使其用于标注对应的红外图像
- 另一方面,针对不同类型的标注信息,开发基于规则的描述生成方法和问答对构建方法。
产生的阶段性研究成果:IR-TD数据集包含超过260K条高质量红外-文本配对数据,既保持了红外图像的真实性,又使模态间的语义对齐。
面临的新挑战:现实世界红外图像语义信息稀疏,在不同光谱下成像存在差异,热信息在目标显著性中占主导地位–>针对红外图像的多模态大型语言模型难以与在可见光上进行大量训练的大型语言模型抗衡
针对现有多模态大语言模型在红外图像理解任务中的性能瓶颈,本文提出双跨模态课程学习策略:以预训练多模态大语言模型的视觉 - 语言理解能力为基础,依托红外 - 可见光图像的模态相似性与红外 - 文本的语义对齐性,通过增量式的 “易到难” 预训练范式,实现模型从可见光图像理解能力到红外图像理解能力的迁移。基于该策略,本文构建了 IRGPT—— 首个面向真实场景红外图像的专用多模态大语言模型。
图 2. IRGPT 可有效处理复杂的红外图像 - 文本任务(例如目标定位、目标识别),这体现了其从可见光领域到红外领域的知识迁移取得成功,同时也展现出对红外数据的深度语义理解能力。我们进一步展示了 IRGPT 的描述生成能力:它能够识别出行驶中的车辆会呈现出发动机温度升高的特征。
上图展现出IRGPT模型展现出的强大的跨模态理解能力
实验验证:在9项基准任务中,IRGPT取得了当前领域最优水平(SOTA)。在零样本(不给他额外训练样本)设置下,与基线(之前的参考模型)相比,IRGPT的正和(优良指标)提升了76.35,负和(误差指标)降低了31.56。
4.1 三模态数据转化

图 3. 三模态数据的转换
(a)三模态数据的转换关系与潜在生成路径
(b)IR-TD 数据集中基于大语言模型(LLM)的红外 - 文本配对生成方法
研究人员探索的红外图像、可见光图像与文本描述之间转化的可行性:
(I)人工标注:这种方法面临着重大挑战,特别是在实现多样性方面存在困难,这使得它在大规模数据对收集方面不切实际。
(II)文本到图像生成:大多数模型不支持红外数据的生成。
(III)合成图像生成:将可见光图像转换为红外图像无法保持真实性。
(IV)使用对齐的RGBT对进行生成:利用大语言模型(LLMs)来描述与红外图像相对应的可见光图像,并将这些描述作为红外图像标注的替代物。
(V)基于规则的生成:根据标签,可以生成大规模的图文对,但缺点是缺乏多样性。
本文提出的解决方案整合了方法(IV)和(V)以达到质量和多样性的平衡
- 利用大语言模型LLMs生成可见光图像的详细描述
- 将这些描述作为对应红外图像的文本标注
- 对于可见光图像不足的特殊场景(如夜间场景):采用Retinexformer来提高可观测性
- 可见光图像存在挑战(小目标或伪装物体):采用基于规则的方法,利用可用标注生成的图像-文本对,确保IR-TD语义正确
IR-TD的三个部分:
- 用于增量预训练的预训练子集
- 用于微调的指令子集
- 用于验证的基准集

- 数据规模与覆盖度的对比
- 预训练图像样本:IR-TD(190k)远多于 IID(118k),意味着模型训练的素材更充足;
- 指令样本:IR-TD(33k)是 IID(12k)的近 3 倍,能更好支撑模型的指令理解能力;
- 基准测试样本:IR-TD(37k)多于 IID(22k),测试结果更具可靠性;
- 原始数据源:IR-TD 整合了 63 个原始数据集,是 IID(7 个)的 9 倍,数据多样性更强;
- 基准测试任务:IR-TD 覆盖 9 类任务,比 IID(6 类)多 3 类,能更全面评估模型能力。
- 数据集属性的对比
- 开源性:IR-TD 是开源的(√),而 IID 是闭源的(×),更便于其他研究者复用;
- 图像真实性:IR-TD 的图像是真实红外数据(√),IID 依赖合成 / 迁移数据(×),数据质量更贴近实际场景;
- 数据冗余性:IR-TD 无数据冗余(×),IID 存在冗余(√),避免了重复样本对训练效率的干扰。
简言之,IR-TD 在规模、多样性、真实性、可用性上都优于 IID,是更优质的红外 - 文本数据集。
4.2 预训练子集生成
研究人员进行以下几个措施来处理图像生成预训练子集
- 根据从标签中提取的物体位置对图像进行裁剪——>解决因相机参数不同导致的视野差异
- 重采样——>减少从视频中提取的红外帧的冗余
整合了 63 个公开数据集,先收集 “RGB 图像 - 文本对”,再通过 “裁剪图像 + 标注对齐” 的方式,把 RGB 的文本描述适配到对应的红外图像上;同时还做了 “去冗余” 处理(比如只保留 VTLAVI 数据集 1% 的图像)。
最终结果:得到了84,284个RGBT对(红外图像-文本对)
4.3 指令子集生成
分类:基于大语言模型的部分和基于规则的部分
基于大语言模型的部分:采用与LLaVA相同的提示词——>让 LLM 基于红外图像生成问答对,有助于将大语言模型的问答能力从可见光图像有效迁移至红外图像
基于规则的部分:以任务为导向,针对具体红外任务(比如 “识别车辆”)设计问答对,让模型能更好响应实际任务指令——>增强大语言模型在面对红外图像时处理特定任务查询的相关性
4.4 基准定义

图 4. IRGPT 的训练策略
(a)增量预训练阶段:通过课程学习训练视觉编码器与投影层,实现图像 - 文本的对齐;(b)有监督指令微调阶段:采用 LoRA(低秩适应)技术适配大语言模型(LLM),同时对投影层进行训练。
包含9个跨模态任务,能全面评估模型的各项能力
4.6 IRGPT:红外视觉-语言模型
4.6.1 模型架构与训练策略
目标:解决红外模态专用视觉 - 语言模型从零构建的效率与性能瓶颈
基于已有的预训练多模态大模型做迁移学习—— 借助预训练模型的视觉 - 语言理解能力,再通过迁移学习让它适配红外图像,既能利用已有能力,又能降低训练难度。
- 模型架构
IRGPT 基于预训练多模态大语言模型(InternVL2-8B)进行模态适配,核心组件包括:
• 视觉编码器(IR_Enc):提取红外图像的模态特异性特征,适配红外数据低对比度、热信息主导的特性;
• 大语言模型(LLM):保留原模型的语言理解与生成能力,作为跨模态语义交互的核心;
• 文本处理器(Tokenizer):将自然语言指令或描述转换为 LLM 可解析的 token 序列;
• 视觉投影层(Projector):实现红外视觉特征与 LLM 文本特征的模态对齐,缓解红外 - 文本模态鸿沟。
- 两阶段训练策略
(1)增量预训练(Incremental Pre-training)
• 训练对象:仅优化视觉编码器与视觉投影层,冻结 LLM 参数;
• 核心目标:使视觉编码器学习红外模态特征分布,同时通过对比学习等方法,让投影层将红外视觉特征映射至与文本特征兼容的向量空间,实现红外 - 文本模态初步对齐。
(2)监督指令微调(Supervised Instruction Fine-tuning)
• 训练对象:联合优化视觉投影层与 LLM,LLM 采用低秩适应(LoRA)策略进行参数高效微调;
• 核心目标:在保留 LLM 语言能力的前提下,提升模型对红外任务指令的响应能力,适配 9 类红外跨模态任务(如识别、定位)的输出要求,强化红外 - 文本的任务级语义匹配。
4.6.2 双跨模态课程迁移学习
双跨模态课程迁移学习(Bi-cross-modal Curriculum Transfer Learning) 针对增量预训练中红外 - 文本样本难度异质性导致的模型收敛震荡问题,提出分维度量化样本难度、渐进式知识迁移的课程学习框架:
4.6.2.1 RVIS
红外像可见光图像之间的模态差距决定了样本难度。
• 核心逻辑:基于模态相似性定义样本迁移难度 —— 红外图像与可见光图像的域差距越小,迁移学习难度越低;
• 实现方法:采用**最大均值差异(MMD)**计算红外 - 可见光域间分布差异
MMD 2 = ∥ 1 n ∑ i = 1 n φ ( x i ir ) − 1 m ∑ j = 1 m φ ( x j vis ) ∥ H 2 \text{MMD}^2 = \left\|\frac{1}{n} \sum_{i=1}^{n} \varphi(x_i^{\text{ir}}) - \frac{1}{m} \sum_{j=1}^{m} \varphi(x_j^{\text{vis}})\right\|_{\mathcal{H}}^ 2 MMD2=
n1i=1∑nφ(xiir)−m1j=1∑mφ(xjvis)
H2
这个公式描述的是“红外图片和可见光图片的‘特征差异程度’”:用所有红外样本特征向量的平均值与所有可见光样本特征向量的平均值的第二范数的平方来刻画其差异程度
c ir = 1 n ∑ i = 1 n φ ( x i ir ) , c vis = 1 m ∑ j = 1 m φ ( x j vis ) . c^{\text{ir}} = \frac{1}{n} \sum_{i=1}^{n} \varphi(x_i^{\text{ir}}), \quad c^{\text{vis}} = \frac{1}{m} \sum_{j=1}^{m} \varphi(x_j^{\text{vis}}). cir=n1i=1∑nφ(xiir),cvis=m1j=1∑mφ(xjvis).
以上分别求出了红外样本和可见光样本的“特征中心”(即所有样本的特征向量的平均值)
d i = ( φ ( x i ir ) − c ir ) ⋅ c vis − c ir ∥ c vis − c ir ∥ + MMD . d_i = (\varphi(x_i^{\text{ir}}) - c^{\text{ir}})\cdot \frac{c^{\text{vis}} - c^{\text{ir}}}{\|c^{\text{vis}} - c^{\text{ir}}\|} + \text{MMD}. di=(φ(xiir)−cir)⋅∥cvis−cir∥cvis−cir+MMD.
第一项:红外样本特征与“红外模态中心”的偏离向量,能够描述样本在红外模态中的离群程度
上面的公式通过将 “红外内偏离向量” 在 “红外–>可见光的模态差异方向” 进行投影,得到样本在跨模态方向上的偏离程度;最后再加上MMD这个全局固定值即可。
差异得分=单个样本在跨模态方向上的偏离+跨模态全局分布差异
• 难度规律:随红外光谱波长增加(近红外 NIR→短波红外 SWIR→热红外 TIR),样本难度呈递增趋势。
采用特征提取器,通过在红外和可见光灰度图像上使用掩蔽策略重新训练,以提取具有判别性的特征。为了实现样本级别的距离评分,需要进行个体距离计算。然而,许多红外图像缺乏对应的可见光图像,这就需要一种创新的解决方案。因此,如图5所示,我们提出通过域内距离投影来计算跨模态距离,其中每个样本到相反模态的距离是通过将域内距离投影到跨域方向上来估计的。
图 5. 双跨模态课程迁移策略
课程 1 聚焦于通过几何指标量化红外与可见光图像之间的域差距,构建域投影距离作为样本迁移难度得分;
课程 2 强调红外图像与文本配对之间的语义对齐,利用预热后的 CLIP 模型计算损失,将其作为样本对齐难度得分。值得注意的是,损失变化率在预训练阶段被用作辅助权重。(注:NIR:近红外;SWIR:短波红外;TIR:热红外)
4.6.2.2 IR-T
核心逻辑:基于红外 - 文本语义对齐质量定义样本学习难度 —— 对齐度越高,样本越易优化;
为红外-文本对齐建立判别标准,提出损失变化率
α = l ′ − l l \alpha = \frac{l' - l}{l} α=ll′−l
公式说明:
动态筛选有效样本:当损失变化率小于零时,说明预热后损失下降–>
该样本能有效帮助模型提升性能,需在后续训练中赋予更高权重;
抑制噪声样本干扰:当损失变化率大于零时,说明预热后损失未降甚至上升,该样本可能存在模态对齐偏差(如红外图像与文本语义不匹配),需通过权重调制降低其对训练的负面影响;
适配课程学习节奏:结合损失变化率的样本权重调整,使模型优先学习 “易提升” 样本,再逐步挑战高难度样本,符合从简单到复杂的课程学习逻辑。
4.6.2.3 课程表
将上述距离分数和对齐分数进行整合
从易到难循序渐进的分层,在每个层级内随机抽样进行训练
w i = { 1 − σ ( α i Median ( { α j ∣ α j > 0 } ) ) , α i > 0 , 1 + σ ( − α i Median ( { − α k ∣ α k ≤ 0 } ) ) , α i ≤ 0. w_i = \begin{cases} 1 - \sigma \left( \frac{\alpha_i}{\text{Median}(\{\alpha_j \mid \alpha_j > 0\})} \right), & \alpha_i > 0, \\ 1 + \sigma \left( \frac{-\alpha_i}{\text{Median}(\{-\alpha_k \mid \alpha_k \leq 0\})} \right), & \alpha_i \leq 0. \end{cases} wi=⎩
⎨
⎧1−σ(Median({αj∣αj>0})αi),1+σ(Median({−αk∣αk≤0})−αi),αi>0,αi≤0.
以交叉熵损失为基础,引入样本权重并对所有N个样本取平均值,构建最终训练目标,通过对不同贡献度的样本损失进行加权,是模型训练过程向“高价值样本”倾斜,提升训练效率和泛化技能。
L = 1 N ∑ i = 1 N w i [ − ∑ c = 1 C y i , c log p i , c ] . \mathcal{L} = \frac{1}{N} \sum_{i=1}^{N} w_i \left[ - \sum_{c=1}^{C} y_{i,c} \log p_{i,c} \right]. L=N1i=1∑Nwi[−c=1∑Cyi,clogpi,c].
用损失变化率给数据加权:前面导出的损失变化率将作为自适应加权因子–>让模型“抑制噪声样本,强化有效样本”(更加重视有挑战性的好样本,少关注错位样本)
5 实验
5.1 实验设置

零样本:模型在未经过目标任务专属数据训练或微调的情况下,直接对该任务的输出进行推理并输出结果,仅以来预训练阶段学到的通用知识
微调:模型在预训练完成后,再使用目标任务的专属数据(如红外指令数据集)进行针对性训练
论文中,在预训练阶段,用IR-TD中的预训练子集,让模型学会可见光图像 + 文本的通用对应关系;
微调阶段,用 IR-TD中的用于微调的指令子集,让它学会红外图像的特征(比如红外目标的轮廓、热辐射差异),从而更好地完成红外相关任务。
- Pandagpt-7B
定位:一款多模态对话模型,基于 LLaMA-7B(大语言模型)+ 视觉编码器(如 CLIP)构建,主打 “图像理解 + 文本对话” 的融合能力。
特点:早期多模态模型代表之一,能处理图像描述、问答等基础跨模态任务,但在复杂场景(如红外图像)的零样本适配性较弱(表格中零样本表现一般)。 - LLaVA1.5-7B
定位:基于 LLaMA-7B + CLIP-ViT-L/14 构建的多模态模型,以 “指令微调” 为核心,擅长遵循文本指令完成图像相关任务(如图像问答、编辑)。
特点:在可见光场景的对话任务中表现较好,但表格中显示其在红外零样本任务中表现较弱(如 ReID 仅 2.61),说明对特殊领域(红外)的适配性不足。 - Qwen2-VL-7B
定位:阿里云开发的多模态模型,基于 Qwen-7B(自研大语言模型)+ 视觉编码器,支持多语言、多模态理解,是国内主流开源多模态模型之一。
特点:通用场景(如日常图像)的跨模态任务表现较强(表格中零样本 Rec. 达 59.42),但红外场景的微调前适配性不如后期模型。 - InternVL2-8B/26B
定位:上海 AI 实验室开发的多模态模型(有 8B/26B 参数版本),以 “超大视觉数据集 + 强视觉编码器” 为核心,主打高精度图像理解(如细粒度识别、多图推理)。
特点:表格中零样本 / 微调场景表现都不错(如 InternVL2-26B 零样本 Scene 达 62.24),是 IRGPT 的 “预训练基础模型” 之一,通用多模态能力很强。 - IRGPT 系列(anti-CL/Random/CL)
定位:表格中重点研究的红外专属多模态模型,基于 InternVL2-8B 初始化(以预训练完成的该模型为基础框架和初始参数起点,在此之上进行适配性调整,快速构建新场景下的模型。)针对 “红外图像 - 文本” 任务优化(论文核心提出的模型)。
IRGPT变体(核心变量为训练策略)
IRGPT (anti-CL):反课程学习(从难到易训练);
IRGPT (Random):随机采样训练;
IRGPT (CL):论文提出的双跨模态课程学习(从易到难,核心优化策略)
IRGPT 是专门针对红外场景优化的模型,因此在表格任务中表现最优。
场景分类(Scene Understanding):从4个选项中选对图像场景,考察模型对场景的识别能力
目标识别(Recognition):从4个选项中选对图像中的目标类别,考察模型对视觉或文本的分类
目标定位(Grouping):根据文本描述返回目标边界框,衡量定位精度,考察模型对物体或元素的分组、聚类能力
空间关系判断(Relation Reasoning):判断文本描述的目标空间关系是否正确,考察模型理解实体间关系的能力
行人目标重识别(PeID,Person Re-identification):考察模型跨图像匹配同一行人的能力
安全排查(Security):从 4 个选项中找出图像中不存在的目标,考察模型输出的安全性与模态间的一致性
psum:上述任务的得分总和
nsum:下面任务的得分总和
坐标定位(Localization):输出指定类别所有目标的坐标,误差越小越好,考察模型在图像中定位目标物体的能力
属性混淆(A.C,Attribute Confusion):考察模型是否把属性分配给了错误的实体
每个评测问题都有目标实体ID和属性标签,若模型将实体选对,属性标签不等于GT a ^ ≠ a G T \hat{a} \neq a^{\mathrm{GT}} a^=aGT
则记为一次A.C
GT:即Ground Truth,通常是由人工或权威流程标注的正确答案,在任何监督学习或评测中都是判断模型预测对错的唯一标准,通常结构化
部件混淆(P.C,Part Confusion):考察模型是否把部件归属给了错误的位置或错误的整体对象,只要部件类型、部件归属、部件位置其中一项出现错误,就计入一次P.C
属性混淆和部件混淆都是比定位错误更高级、更致命的理解错误
实验结果:IRGPT(CL)在这两项上几乎清零,说明其结构化多模态理解能力显著提升
5.2 消融研究

由表可知,移除课程和使用反课程学习都会降低红外图像的理解能力,L2对psum的敏感性高于L1。
这是因为:
L2强调图像-文本的相似性–>影响语义正确性;
L1考虑图像质量–>影响感知正确性。
由表可知:所有基于反向难度的策略都会对性能产生不利影响,融入随机性的方法能提升模型的有效性
5.3 可视化


图7. 带有排名结果的样本对。展示了语义复杂度和图像质量的变化。
6.个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)