摘要:

端到端的基于Transformer的跟踪器在大多数与人类相关的数据集上取得了显著的性能。然而,在异构场景中训练这些跟踪器带来了巨大的挑战,包括负干扰- -模型学习到冲突的场景特定参数- -以及有限的领域泛化,这往往需要过多的微调来使模型适应新的领域。为了应对这些挑战,我们引入了参数高效的特定场景跟踪架构( PASTA ),这是一种结合了参数高效微调( PEFT )和模块化深度学习( MDL )的新框架。具体来说,我们定义了关键场景属性(例如,摄像机视角,照明条件等),并为每个属性训练专门的PEFT(参数高效微调)模块。 这些专家模块在参数空间中进行组合,可以在不增加推理时间的情况下对新领域进行系统的泛化。在MOTSynth上的大量实验,以及在MOT17和PersonPath22上的零样本评估表明,由精心选择的模块构建的神经跟踪器优于其单一模块的神经跟踪器。我们发布模型和代码。

1、Intro

点出 尽管基于检测的跟踪方法在多个数据集上被证明是有效的,但由于用于将新的检测与现有的轨迹联系起来的不可微机制,它们的性能难以在更大的数据集上扩展。为此,基于查询的方法被用来统一检测和关联阶段。然而,训练这种端到端的基于Transformer的方法具有重大的挑战,因为它们往往会过度拟合特定场景设置[ 37、55 ] (例如,摄像机视点,室内和室外环境),需要大量的数据[ 63 ],并产生大量的计算成本。此外,这些方法在域偏移下性能下降,难以超越传统的Tb D方法。

针对这些挑战,我们提出了一种新的框架,即参数高效的特定场景跟踪架构( Parameter-efficient Scenario-specific Tracking Architecture,PASTA ),旨在减少计算成本并增强此类模型的传输能力。利用参数有效微调( PEFT )技术[ 16、34 ]可以显著减少计算成本和训练时间,从在合成数据上预训练的冻结backbone开始。然而,该模型仍可能经历负干扰在多个任务(或场景)上进行训练的现象会导致模型学习到可能发生冲突的任务特定参数。例如,如果模型学习为室内体育活动量身定制的参数,可能会对其在描述人们行走的新的室外场景中的性能产生不利影响。为此,受模块化深度学习( Modular Deep Learning,MDL ) [ 35 ]的启发,我们为每个属性使用一个轻量级的专家模块,分别学习它们,最后高效地组合它们[ 17 ]。这种方法- -如图1所示- -类似于厨师准备面食菜肴。每个配料(即,模块)单独制作,以保持其独特的风味,然后和谐地组合在一起,创造一个平衡的菜肴。 此外,由于面食必须是完美的,以作为各种酱料的理想基础,预训练的骨干应该是健壮的和经过良好调整的,以作为模块的基础。这些模块必须进行有效的组合,以确保模型在不同的场景中表现良好。相反,如果不兼容的模块混合在一起,结果将是次优的- -类似于将互不互补的成分组合在一起。事实上,组合对比模块可能导致对不同任务的无效处理。

值得注意的是,这种模块化框架带来了两个优点:它避免了负干扰,并通过利用特定领域的知识来增强泛化能力。首先,从预训练的主干开始,独立训练每个模块以防止参数冲突,确保针对特定场景的梯度更新仅限于相关模块。这保证了为一个属性学习到的参数不会对另一个属性的性能产生负面影响。其次,模块化方法允许我们充分地利用领域知识,即使遇到新的属性组合。的确,如Sec . 5 . 5时,即使在零样本(即,无需在目标数据集上进一步微调)的情况下,我们的方法也是有效的。 而且,模块的选择可以由视频监控操作人员自动完成,也可以在更真实的生产环境中完成。

为了评估我们的方法,我们在合成的MOTSynth [ 10 ]和真实世界的MOT17 [ 8 ]和PersonPath22 [ 44 ]数据集上进行了广泛的实验。实验结果表明,PASTA能够有效地利用模块学习到的知识,在源数据集和零样本场景下提高跟踪性能。归纳起来,我们强调以下主要贡献:

·我们提出了一种新的基于模块化深度学习的多目标跟踪框架PASTA,使用PEFT技术对基于查询的跟踪器进行微调。

·通过结合专家模块,我们在微调MOT模型的同时改善了域迁移并防止了负干扰。

·综合评估证实了我们方法的有效性及其在零样本跟踪场景中的有效性。

2、Related works

多目标跟踪。多目标追踪( Multiple Object Tracking,MOT )最广泛采用的范式是基于检测的跟踪( Tb D ) [ 3、51、61、28、43、38]。首先,一个目标检测器(如YOLOX等)定位当前帧中的目标。接下来,关联步骤通过求解一个最小代价的二分匹配问题,将检测与前一帧的轨迹进行匹配,关联代价定义为各种形式的(例如, Io U [ 3,61 ]、GIo U 或几何线索[ 29,33 ])。这种配对通常在使用运动模型( e. g . , Kalman Filter )将先前的轨迹传播到当前帧后立即发生。

值得注意的是,遵循这种范式的方法在复杂的人类相关的MOT基准测试集[ 8、9、47、44]上取得了成功。在Tb D中,检测和数据关联步骤对于准确定位和跟踪目标同样至关重要。最近的工作[ 65、1 ]试图统一这些步骤;然而,向完全统一算法的进展受到一个重大限制- -数据关联过程(例如,匈牙利算法)本质上是不可微的。最初的努力是由Xu等人[ 53 ]提出了一个可微的匈牙利算法,后来由基于端到端转换器的跟踪器[ 31、58、63、56、13]提出。 然而,基于Transformer的跟踪器(也被称为注意力跟踪)需要大量的数据才能达到较好的泛化能力[ 58、31 ]。由于MOT中数据的稀缺性,这些模型往往过度拟合它们所训练的特定领域,这阻碍了它们泛化到不同领域[ 17、21、37 ]的能力。

模块化深度学习( MDL)。考虑到深度学习领域的最近趋势,最先进的模型变得越来越大。因此,微调这些模型变得奢侈;同时,他们还在与符号推理和时间理解等任务进行斗争[ 35 ]。最近基于模块化深度学习( Modular Deep Learning,MDL ) [ 35 ]的学习范式可以通过将核心预训练知识与领域特定能力分离来应对这些挑战。通过应用模块化原则,深度模型可以很容易地进行编辑,从而实现新功能的无缝集成和现有功能[ 26、36 ]的选择性移除。

具体来说,使用轻量级的计算函数模块来适应预训练的神经网络。 为此,可以使用几种微调技术来实现这些模块,如LoRA [ 16 ],( IA ) 3 [ 25 ]和SSF [ 23 ]。这些多个模块可以在不同的任务上进行学习,从而可以专门用于不同的概念[ 32 ]。在推理时,并不是所有模块都必须同时处于活动状态。相反,它们可以根据需要有选择地使用,既可以基于领域的先验知识,也可以根据当前输入动态地使用。为了建立激活哪些模块,通常的做法是依赖一个路由功能,它既可以被学习,也可以被固定。最后,使用聚合函数对所选模块的输出进行组合。 为了最小化推理代价,这个过程通常在参数空间而不是输出空间中进行,这一活动通常被称为模型合并[ 54 ]。具体来说,使用由路由函数选择的权重的线性组合产生的权重进行单次前向传递。

MOT中的领域自适应和开放词汇方法。目前,域适应技术仅被应用于基于检测的跟踪方法,GHOST [ 43 ]和DARTH [ 42 ]就是其中著名的例子。特别地,GHOST通过在推理过程中更新Batch Normalization层的充分统计信息来适应用于反馈外观模型的视觉编码器。相比之下,我们的方法采用基于注意力机制的跟踪方法,并适应整个网络。此外,DARTH采用了测试时间自适应( TTA ) [ 24 ]和知识蒸馏( Knowledge Distillation ),需要多个前向通道和整个序列,因此计算量大,不太适合实时应用。 相比之下,我们的方法是完全在线的,只需要基本的目标场景属性,在部署时不需要进一步的训练。零样本跟踪的最新进展主要集中在开放词汇跟踪上,该模型可以通过使用相应的文本表示来跟踪新的目标类别。在这方面,OVTrack [ 22 ]和Z - GMOT [ 48 ]等方法利用CLIP [ 39 ]和基于语言的预训练,而OVTracktor [ 7 ]则将跟踪扩展到任何类别。我们的方法不使用开放词汇模型,而是强调端到端的跟踪器中的领域知识迁移。

3、预备知识

高效微调。考虑到最近的视觉主干的巨大规模,通常由数以亿计的参数组成,使它们适应新的场景在计算上是昂贵的,无论是在时间和内存需求方面。为了解决上述问题,参数高效微调( Parameter Efficient Fine-Tuning,PEFT )在最近的文献中开始出现。在这些方法中,低秩自适应( Low-Rank Adaptation,LoRA ) [ 16 ]在这样的目的上表现得尤为出色。具体地,LoRA采用预训练的权重矩阵θ 0∈Rd × k,d和k为矩阵的维数,通过低秩分解θ 0 +∆θ = θ0 + BA,其中B∈Rd × r,A∈Rr × k,r远小于min( d , k)。在训练过程中,θ 0保持冻结,而较小的A和B矩阵则改为可训练的,使得该过程具有较高的效率。 前向通道变为h = θ0x + BAx,其中x为输入特征。

基于查询的多目标跟踪。我们的基于Transformer的跟踪器的底层主干遵循[ 58 ]的结构。简而言之,这种基于查询的模型迫使每个查询跨不同帧回忆同一个实例。具体来说,我们使用基于Deformable DETR [ 6 ]框架构建的端到端可训练跟踪器,该框架以卷积主干(即ResNet )提取的图像特征为条件。在文献[ 63 ]的基础上,我们进一步将DETR解码器设置为一组来自外部检测器网络的检测和一个共享的可学习查询。在t = 0时刻,从场景中检测到的物体中生成新的提议。然后通过自注意力更新这些建议,并通过可变形注意力层与图像特征进行交互。 最终的预测输出是初始锚点和预测偏移量的总和。对于后续帧( t > 0),将前一帧生成的轨迹查询与当前帧的可学习提议查询串联。此外,以前的预测与当前的建议相结合,为即将到来的框架建立新的锚点。读者可参阅原文[ 63 ],以获得更进一步的细节。值得注意的是,这种架构的灵活性允许基于模块化的技术的无缝集成。

4、方法

本文提出了一种新的多目标跟踪方法PASTA (如图2所示),该方法利用PEFT模块来实现特定属性模块的特殊化和重用。该方法允许动态配置端到端的跟踪器,通过为每个输入场景选择合适的模块,充分利用异构预训练,同时避免负迁移。

基于属性的模块。我们设计了一组可学习的模块来微调基于查询的跟踪器的每一层。每个模块与一个属性相关:如图3所示,我们定义N = 5个属性,即照明,视点,占有率,位置和相机运动,并为这些属性的每个离散值提供一个定制的模块,这些属性取(见Sec . 5 . 3为详细信息)。例如,位置属性有室内和室外模块。在推理时,利用关于输入场景的先验知识来确定每个属性的合适值,进而从"库存"中选择相应的模块,记为M。

由于基模型[ 63 ]依赖于异构层,即卷积( e.g. , Res Net)和基于注意力的块( e.g . , Deformable DETR),我们采用两种不同的策略对模块进行微调。具体来说,在ResNet主干的每个卷积层之后,我们应用了一个策略,即学习通道尺度和平移参数;对于Deformable DETR的每一层,我们在每一个线性层采用基于LoRA的微调。在形式上,考虑到ResNet主干网络的每个卷积层,我们部署| M |对{ γm,βm } | M | m = 1的可学习向量γ,β∈RC,其中C是输出通道数。对于Deformable DETR下的编码器-解码器结构的每个线性层l,我们设计了| M |对{ Am,Bm } | M | m = 1的可学习LoRA矩阵。

在训练过程中,我们从预训练的权重开始,在保持原始参数冻结的同时整合所有模块。 为了防止负干扰,我们独立优化每个模块,每次随机采样一个属性,并且在每次训练迭代时只更新相应的模块。在训练过程结束时,我们得到一组专门的参数(专家),这些参数可以在推理过程中无缝地合并,以提高整体的跟踪性能。

通过领域专家进行布局。在推理过程中,利用学习到的模块需要两个必要的步骤:分布和整合。在库存M中有多个模块可用的情况下,需要一个分布策略来确定应该活动的模块。为了进行这样的选择,我们借鉴了文献中已知的专家知识[ 52、35 ] (或图2中的"领域专家")。在真实世界的应用中,如视频分析,指导选择的专业知识可以来自视频监控操作员或人类分析师,他们配置适当的模块以反映特定领域和场景的设置,例如相机视角,照明条件和其他关键细节。 这种方法允许用户针对其独特的上下文来优化跟踪模块,而无需进行大量的再训练。此外,系统的模块化性质使新模块易于集成,以应对新出现的属性或场景。

依托领域专家进行属性选择是现实应用中的扎根实践。例如,在固定摄像机场景中,摄像机的安装视角以及场景是在室内还是室外是典型的已知因素。此外,还可以设想自动方法,以进一步减少人为干预。例如,通过分析亮度水平可以推断光照条件,检测器可以统计场景中感兴趣的物体,对人群密度进行分类。

模块组成。在最后一步中,我们将选择的模块(图2中的"模块构成")进行聚合,并将结果合并到预训练的跟踪器中,以创建专家模型。由于这些模块是由θ 0微调得到的,因此每个模块θ⋆相对于初始预训练参数θ 0在参数空间中对应一个特定的位移τ⋆= θ⋆- θ 0。这个位移被称为任务向量[ 18 ]。定义最终的合成模型f ( · ; θc)为:

当λ i = 1N时,公式简化为每个属性对应的任务向量的平均值。我们对λ i采用这种直截了当的策略,对所有属性赋予相等的权重。然而,考虑到与第i个属性相关的任务向量τ i,我们采用了更复杂的方法。如果在推理(也就是说,训练和测试都发生在同一个数据集上,如MOTSynth)时没有领域偏移,则将任务向量τ i简单地设置为由Domain Expert选择的专家模块产生的位移τ⋆。相反,当域转换存在(例如,在MOTSynth上的训练和在MOT17上的测试)时,我们采用软策略,考虑与相关属性相关联的库存中的所有模块。 在这样做的过程中,我们遵循了[ 59 ]的见解,其中作者证明了具有转换任务的场景受益于比从单个优化情节中获得的更丰富的表示。

具体来说,给定第i个属性,令R ( i )是它的模的集合.我们记得每个属性都有多个离散值( e.g. , R (占有率)) = { '低','中','高' } ),不同的属性可能有不同的基数( e.g. , | R (占用) | = 3和| R ( light ) | = 2,详见Sec5 . 3 ) .在此基础上,我们使用软路由来创建相应的任务向量,分配最大的蛋糕部分,例如ρ = 0。80,至领域专家选择的模块。其余模块按( 1 - ρ) / ( | R ( i ) | -1 )加权,保证总和等于1。例如,考虑用LoRA微调的那些层,相应的任务向量被计算为:

值得注意的是,当ρ = 1时,软策略变得硬,这意味着只有Domain Expert选择的模块被使用。通过将上述公式应用于所有属性,我们得到了N个任务向量,这些任务向量按照等式进行聚合。( 1 ) .类似地,我们应用通道尺度和移位[ 23 ]操作来适应每个骨干层。在形式上,给定卷积层的输出F,第i个模块应用尺度和移位操作得到编辑后的F ( i ),使得F ( i = γi⊙F + βi,其中⊙表示Hadamard积。在推断时,我们将不同尺度和平移模块的输出合并,注意到

也就是说,采用简单的加权平均对尺度和平移层进行参数化,可以有效地对相应的各个层的输出进行平均。上述公式适用于域内环境,但可以很容易地推广到由等式描述的软路由方案中。( 2 ) .最后,正如[ 23 ]中讨论的那样,尺度和位移层可以被吸收到前面的投影层中,从而确保推理过程不会产生额外的计算成本。同样的再参数化技巧可以用来提取尺度和平移微调(详见附录A以作补充说明)下的任务向量。

5、实验

我们在域内和域外场景上评估了我们提出的PASTA。对于领域内评估,我们在MOTSynth合成数据集( Sec。5 . 4 )上使用专家模块在特定领域背景下对PASTA进行训练和测试。作为基准,我们在不使用模块的情况下在MOTSynth上训练[ 63 ],将该模型称为MOTRv2 - MS。对于域外评估,我们在MOT17和PersonPath22 ( Sec。5 . 5 )上进行了合成到真实的零样本实验。从MOTSynth上的训练开始,我们在这些数据集上测试了PASTA,无需额外的训练,显示了其在非相同分布域下的泛化能力。最后,我们在第二节给出了一系列的消融研究来进一步考察本文方法的有效性。

我们使用DanceTrack [ 47 ]提供的预训练权重来初始化我们的模型,正如文献[ 63 ]的作者所提供的那样。采用YOLOX [ 14 ]作为辅助检测器,利用Byte Track [ 61 ]的权重。为了给PASTA和MOTRv2 - MS训练提供一个共享的初始化,我们从DanceTrack预训练开始,在MOTSynth训练集上训练了28k次迭代的自举模型。这种自举初始化使用MOTSynth原始训练序列的一半来将我们的模型与数据集中所表示的场景进行对齐。transformer的学习率设置为5 × 10 - 5,视觉backbone的学习率设置为1 × 10 - 6。

在第二阶段,我们部署PEFT模块对自举模型进行微调。通过在自举过程中剔除一半的序列,我们确保模块仍然可以学习到有价值的特征。为了保证比较的公平性,我们对每个模块进行了与MOTRv2 - MS相似的迭代次数的训练,迭代次数约为17k。对于编码器-解码器模型,除了输出维度小于128的线性层外,我们将模块化策略应用于每个线性层。对于LoRA超参数,我们取r = 16,权重衰减为0。1,学习率为3 × 10 - 4。尺度层和位移层采用1 × 10 - 5的学习率和1 × 10 - 4的权重衰减。训练在单个RTX 4080 GPU上进行,两个阶段的批处理大小均为1。 由于小批量的特点,在执行优化器步骤之前,我们在四个向后的步骤中积累梯度。每个模块在整个MOTSynth训练集上独立训练。通过12个模块,我们的模型有大约1500万个可训练参数。

属性。我们使用五个关键属性来实现我们的模块化架构:照明,相机视点,人员占用,位置和相机运动。在照明方面,针对良好和不良的照明条件,我们专门设计了模块。为此,我们将HSV表示的亮度值V阈值设为70。视点属性包括高、中、低相机角度的模块。我们对该属性进行了如下人工标注:i )将行人头部水平或以下摄像头与地面平行的场景标注为"低层";i ) "高层"视点,包括摄像机位置很高或离人很远的垂直视角或场景;iii ) "中等水平"包括所有其他相机角度。 对于占有率,我们设计了反映场景内人群密度的模块:低(最多达10人)、中( 10 ~ 40人)和高( 40余人),基于置信度得分在0以上的检测次数。2 .位置属性区分了室内和室外设置。最后,运动属性包含了运动相机和静态相机的模块,使模型能够适应不同的相机运动场景。数据集统计详见附录C。

5.4 在In - Domain设置中的表现

为了评估负干扰的影响,我们在MOTSynth (见表1 )上进行了多次实验。考虑到这样一个合成数据集中的场景多种多样,我们可以欣赏使用专门模块的好处。事实上,集成我们的模块导致了其微调对应物( MOTRv2-MS )的整体改进。具体来说,我们观察到关联指标( Ass A、IDF1)以及HOTA和MOTA指标的改进。这些增强表明了我们的方法在减少训练过程中的负面干扰方面的好处。通过为每个模块分配针对特定场景设置的特定角色,我们通过由领域专家指导的确定性选择过程实现了训练稳定性的提高。

5.5 out - domain下的性能

通过针对各种输入条件设计不同的模块,我们可以有效地选择适当的模块来处理分布变化,例如到新域的转换。我们使用合成数据进行训练来评估这种能力的好处,然后对新的、未见过的数据集进行评估,而无需任何额外的重新训练(零样本)。为此,我们从在 MOTSynth 上训练的模型开始,如第 2 节所述。 5.4 并在 MOT17(表 2)和 PersonPath22(表 3)上对其进行评估。虽然这些数据集在我们使用的属性上有相似之处,但我们强调源数据集是合成的,目标是真实世界的,从而导致了重大转变。  

结果报告于表中。表 2 和表 3 显示了相对于基线(即 MOTRv2-MS)的改进,零样本 MOT17 中的 HOTA 为 +1.4,IDF1 为 +1.9,PersonPath22 中的 MOTA 为 +1.7,IDF1 为 +0.7。我们的方法展示了更好的泛化能力,有助于缩小与经过充分训练的方法的差距,同时计算要求较低。这些结果表明,模块化增强了源数据集内的性能并改进了域泛化,从而导致更可靠和更通用的跟踪方法。此外,除了报告标准模块选择的结果(仅考虑场景中存在的模块,ρ = 1)之外,我们还尝试了所有模块的加权聚合(ρ = 0.8)(详见第 4 节)。有趣的是,虽然标准策略显示出改进,但加权聚合策略产生更好的性能。这表明通过每个属性包含多个模块获得的更丰富的表示对于零样本场景比单模块方法更有效[59]。

评估零样本真实到真实的迁移。在图 4 中,我们提出了一项额外的实验来评估 PASTA 在零样本设置中的性能,这次使用真实的数据集作为源,而不是合成的数据集。为了进行比较,我们在 MOT17 数据集上训练 MOTRv2,并评估其在 PersonPath22 上的性能。与经过微调的 MOTRv2 相比,我们的方法展示了更出色的结果,强调利用模块增强了模型,并提高了新领域和现实领域的泛化能力。

6、消融研究

如表5 所示,我们评估了域内设置(MOTSynth,表 5 左侧)和零样本设置(MOT17,表 5 右侧)中各种路由和聚合策略的效果。在域内场景中,结果表明,对域专家选择的模块进行平均,特别是使用 Mean avg (ρ = 1.0),是最有效的策略。我们还尝试了求和,如[60]所提出的,但这种方法产生了不好的结果,我们将其归咎于对多个模块求和时权重大小的改变。另一个值得注意的方法是加权平均值,如第 4节所述,其中包含所有模块,包括那些未选择的模块。

 虽然仅使用选定的模块是域内场景中的最佳策略,但对于零样本情况(MOT17),合并来自未选定模块的知识 - 具体来说,使用加权平均值。 (ρ = 0.8) – 增强跟踪性能。当域转移涉及对 PersonPath22 数据集进行评估时,这种模式也是一致的(参见附录 E)。

模块选择。我们是否应该仅选择代表当前场景的模块(由领域专家方法确定),还是通过合并所有可用模块来提高性能?在表5我们通过比较这两种方法来调查这个问题。为了提供更全面的视角,我们还评估了一种与领域专家形成鲜明对比的策略,该策略选择相反的模块(例如,在呈现室内光线充足的场景时选择室外和照明较差的模块)。当使用相反的模块时观察到最低的性能,这表明使用正确的模块可以提供有关当前场景的有价值的信息。有趣的是,尽管使用相反的属性,该模型仍然表现相对较好,这可能是由于其他模块的贡献,这些模块的领域常识维持了整体性能。这表明模块可以互相协助来解决任务。此外,还减少了负面干扰——通过单独训练每个模块来实现——防止模块相互依赖,并允许它们独立做出独特的贡献。  

此外,在图 4 中,我们说明了专用模块的增量添加如何改进 IDF1 和 HOTA 指标,表明模块的更大专业化逐渐提高了整体性能。如需更详细的分析,请参见表  6、我们为每个属性选择相反的模块而不是正确的模块。尽管指标进一步减少,但由于其强大的预训练,该模型表现良好,如表中所示的无模块基线所示。

模块分析。在我们的方法中,应用与属性相关的模块来编辑整个网络。然而,用户可以选择有选择地编辑架构的特定部分,从而确定哪些组件是最关键的。在表7我们通过排除我们的模块应用于架构的不同组件来进行消融研究。结果表明,不将任务向量应用于解码器会显着降低检测和关联指标。我们认为,这种退化可以通过考虑解码器的关键作用来解释。解码器确实必须从检测、跟踪和建议查询中收集信息,同时集成来自编码器的视觉信息。因此,不调整解码器会阻止架构有效地利用查询和视觉提示。编码器也做出了很大的贡献,尽管程度比解码器要小,因为它主要是对主干网的视觉特征进行细化和上下文化。最后,主干网的贡献最小。

7、结论

在这项工作中,我们介绍了 PASTA,这是一种新颖的框架,可以增强多对象跟踪的按查询跟踪方法的领域泛化。我们的方法采用模块化结构,具有针对现实世界场景的不同属性定制的专用模块。这些模块利用参数高效微调技术,实现场景特定参数的集成,同时最大限度地减少计算负载。综合实验表明,领域专用模块可以显着增强鲁棒性,无需进行大量的再培训即可实现跨领域的有效适应。 PASTA 进一步使摄像机操作员能够为每个独特的场景配置最佳模块,确保精确适应不同的现实世界设置。

这篇文章很吸引人的一点是通过微调模块就实现了零样本迁移的具有竞争力的效果,而且这是少有的用了personpath22的数据集进行实验,但是没有公布源码,对于遮挡,光照,视角等模块的方法介绍的也很少,更像是一种调参的组合,而不是真正的模块化工作。很奇怪但是也很新颖的讲故事思路。

整个文章更倾向怎么用LoRA的方法怎么整合和并行模块工作

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐