IVIF文献阅读笔记:SAM-guided multi-level collaborative Transformer for infrared and visible image fusion
目录
1、题目
SAM-guided multi-level collaborative Transformer for infrared and visible image fusion
基于 SAM 的多层级协同 Transformer 在红外与可见光图像融合中的应用
2、文献信息
作者:林果 、罗晓青 *、刘悦 、张展成 、吴小军
出处:PATTERN RECOGNITION,2025(162)111391
IF:7.6, JCR分区:Q1,新锐分区:计算机科学1区
3、动机
现有图像融合方法提取的语义信息不足,且忽视了人机视觉差异,削弱了与下游视觉任务的兼容性;任务驱动方法难以平衡视觉与语义表示,导致融合表示不够完整且兼容性差
4、主要工作
1)提出了一种基于SAM引导的多级协同Transformer红外与可见光图像融合网络(SpTFuse)
2)引入基于SAM的语义先验分支并与多尺度视觉表示分支进行三级渐进式交互以提高融合表示的完整性和兼容性
3)设计了模态间融合块(IEB)和模态内交互块(IAB),通过单步协同Transformer(SCT)和双路径协同Transformer(DCT)聚合与平衡多模态特征
4)开发了语义补偿块(SCB)以补偿解码器网络上采样过程中丢失的语义信息
5)在MSRS、TNO、RoadScene和FMB数据集上进行了实验验证
5、核心创新点
1) SAM语义先验引导架构:首次将大型视觉模型(SAM)的强大零样本分割能力转化为融合网络的语义先验,以多级协同方式注入网络,从根本上提升了融合表示在下游任务中的兼容性
2)级联双路径协同Transformer:构建了双路径Transformer级联结构(先验协同路径与视觉细化路径),在获取语义先验的同时兼顾视觉信息的细化,有效实现了视觉与语义特征的深度平衡与完整融合
3)重建过程的语义补偿机制:针对解码器上采样易导致语义丢失的问题,提出语义补偿块(SCB),将层级交互的语义表示逐层补偿并整合回解码器中
4)多维度综合损失函数:设计了由语义先验损失、梯度损失和强度损失组合而成的新型联合损失函数,精准引导融合网络提取并保留关键视觉纹理与语义先验信息
6、网络结构
1)总体架构

2)SpTFuse 整体框架:
多分支特征提取:红外与可见光图像分别输入多尺度编码器获取视觉特征,同时输入Segment Anything Model (SAM) 获取语义先验特征
三级渐进式交互:在特征提取的后三个尺度,网络被划分为三个交互层级,以渐进地整合多分支的视觉与语义信息
图像重建与损失:交互后的特征由多尺度解码器生成最终融合图像 。整个网络由语义先验损失、强度损失和梯度损失共同驱动训练
3)IEB和IAB
模态间融合块 (IEB):位于第一级交互,利用单步协同Transformer (SCT) 聚合语义先验与视觉特征,随后通过模态整合模块 (MIM) 克服特征分布差异,完成红外与可见光特征的初步融合。SCT:通过交叉注意力机制使语义先验与视觉表示进行交互,优先学习与语义先验相关的视觉特征。MIM:采用基于条件机制的仿射变换策略,通过计算缩放与偏移系数来调整模态特征,解决红外与可见光之间的特征分布差异并完成融合
模态内交互块 (IAB):位于第二、三级交互,通过双路径协同Transformer (DCT) 级联提取语义先验并细化视觉信息,再由语义增强模块 (SEM) 深度平衡视觉细节与语义完整性。DCT:包含两条级联路径,先验协同路径负责持续整合先验知识,视觉细化路径则在保持语义完整性的同时平衡视觉信息。SEM:结合语义先验特征对DCT的输出进行调制,进一步增强融合表示的完整性

、
4)语义补偿块(SCB)
语义补偿块 (SCB):位于解码重建阶段,将层级交互的特征上采样并补偿注入到对应的解码器层中,有效防止图像重建过程中语义信息的丢失

7、损失函数
总损失函数:由强度损失、梯度损失和语义先验损失组成,实验中权重参数设置为𝛼 = 155, 𝛽 = 10, and 𝛾 = 7:
![]()
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)