专家混合模型作为深度多视角聚类的表征学习

——失策了,对专家混合模型不感兴趣,等等,后面发现,这个好像不是传统的专家混合模型

摘要

当前方法中,要么是针对每个视图提取特征,要么是对所有视图用统一的特征。本文提出一种专家混合框架。引入了一个门控网络,该网络可以动态地为每个数据样本选择多个专家来进行处理,从而从不同视图中捕获多样且互补的信息。为了保持专家的多样性,还加入了一个均衡损失,防止依赖一个专家。
——如何让视图之间协作,又保留视图自己的特定信息,本文采用多个专家网络来实现。

1、引言

现有方法强调可靠的融合机制,但还是采用传统的,比较分离的方式。比如每个视图先单独提取特征再考虑融合,限制了多个视图的协作和相关性利用。如果用共享组件又会忽略视图的独特信息。

所以关键问题在于:如何在保留视图特定表示独特性的同时,促进多个骨干网络之间的协作,从而实现有效的多视图聚类?

本文提出,不同于提取和融合分离,这个过程可以被统一起来,利用专家混合模型(MoE),引入多个专家网络来融合多视图数据的特征。

可以理解成“动态共享的多编码器系统”,不是为每个视图准备一个专家,而是准备一组专家,针对不同的视图或者样本,可以选择不同的专家组合。不同的视图可以用相同的专家,实现一致性协同,也可以有自己的专家,保持独立性。选择top K是为了减少冗余。

两个潜在风险:第一,某些专家被过度依赖,第二,不同的专家可能会收敛到相同函数(相当于塌缩成一个相同的专家了)。所以引入了一个均衡损失,以确保专家参与的均衡性。并设计一个差异性增强器。——有点像防塌缩项。

1、引入专家混合系统框架
2、设计均衡损失
3、设计差异化增强器

2、相关工作

2.1 多视图聚类
2.2 专家混合模型

一种机器学习范式,将一个任务拆解为多个子模型,也就是专家来解决问题。

两个典型现代应用:

NLP 里的 Switch Transformer:每个 token 只激活部分专家。这个思想可以减少每次前向传播的计算量,同时扩大模型总参数规模。

CV 里的图像分类和视频识别:不同专家可以关注不同视觉模式、区域或特征。

3、本文方法

3.1 问题定义

总的来说,本文提出方法的整体损失函数为:

前者是不同视图的表示学习损失,确保学习到的信息是完整的,后者是MoE表示学习器对应的损失函数。——各视图重构损失和专家相关损失。

3.2 协作式多视图专家混合模型

独立提取视图特征的范式无法很好捕捉视图之间的互补信息,这是本文的直接动机。
所以想改成:X(v)→共享专家池→Hv​ 这样不同视图就可以通过调用部分相同的专家实现协同。

MoE 表示学习器由专家网络和门控网络组成,其学习过程可以形式化为:
Em是第m个专家的学习函数,Πm是第m个专家的门控权重,X(v)是视图数据,Hv是学到的特征。

第 v 个视图的数据来了以后,专家 1 给出一个表示,专家 2 给出一个表示,专家 3 给出一个表示……门控网络判断这些专家各自有多重要,然后把它们加权融合。

门控权重的计算方式

所以这个是针对样本级别的,而不是针对视图级别的。Gm(⋅)表示门控函数,由一个单层全连接网络进行参数化。

然后论文使用 Top-K策略。也就是说,虽然公式里对所有 M个专家都计算了 softmax 权重,但实际参与表示学习的只有分数最高的 K个专家。

接着,引入一个聚合函数

A(⋅) 是 concatenation,也就是把V个视图得到的特征进行拼接。于是第 j个样本最终的融合表示大概是:

为了保证融合特征中能够同时尽可能多的保留视图的信息,引入解码器,从融合特征中恢复各视图的原始数据,并设定重构的损失函数:

从训练角度看,Lrecon(v)会同时反向传播到 decoder、专家网络和 gating network,迫使整个表示学习器产生对重构有用的表示。

但是,仍然存在两个问题:

  • 模型可能会过度依赖某些专家,而其他专家则被低度使用,导致冗余,并且无法高效利用模型能力。
  • 多个专家可能会收敛到相似的函数,这会降低专家的多样性,并导致次优的聚类性能。

作者认为的融合到底发生在哪里?如果只是做拼接,那融合太浅薄,而且专家混合里的协作只是在特征提取阶段的专家(小网络模块)协作,没看到视图或者视图之间的特征是怎么协作的。

而且从融合特征中恢复视图的原始数据,但是还是没法说服自己这个是怎么融合的。。。除非恢复本视图数据的时候把H中本视图的特征给去掉,用其他视图的拼接特征来重构?然后视图的信息自己重构?
—— 自视图特征负责保留 view-private 信息;其他视图特征负责预测该视图中可由跨视图互补信息解释的部分;最后再加权融合。感觉机制上有点意思,但是实际不一定会work,其他视图来重构本视图感觉有点扯。


3.3 专家均衡选择

就是为了解决可能的问题1

3.4 专家特性增强器

解决问题2

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐