MoE是目前LLM等大模型中最核心的基础组件之一,今天这篇文章给大家介绍几篇近两年针对MoE结构的优化方法,涵盖ICLR、NIPS、ACL等顶会工作。

1
ReMoE—可微路由

论文标题:ReMoE: Fully Differentiable MoE with ReLU Routing(ICLR 2025)

基础的MoE采用softmax+选topK的方式进行转化选择,给模型引入了一些不可微的训练过程。这篇文章把softmax+选topK这种方式升级成了ReLU的方式。ReLU天然的将小于0的数置为0,实现了稀疏化的作用。通过ReLU的输出结果和各个Expert加权求和,实现动态路由。为了提升稀疏性,引入了L1-norm,约束ReLU的输出结果,实现稀疏化。

图片
在这里插入图片描述

2
DynMoE—自动化MoE配置

论文标题:DynMoE: Dynamic MoE, An Auto-Tuning Approach(ICLR 2025)

超参数的设置对MoE的效果影响比较大,比如专家总数量、每个token要激活的专家数量等。这篇文章提出了一种可以让模型自动学习每个token激活多少专家数、一共需要多少专家数的方法。第一个模块是Top-Any Gating,将激活专家数转换为多分类问题,计算每个专家输出的表征和输入向量的夹角余弦,大于一个可学习的阈值即进行激活。此外,训练过程中会记录每个Expert的激活次数和每个样本激活了哪些Expert,如果一个Expert一直不被激活,或者一个样本哪个Expert都没激活,就会进行相应的增删Expert操作,动态调整Expert的总量和质量。

图片

3
MoE++—引入简单专家

论文标题:MoE++: Accelerating MoE with Zero-Computation Experts(ICLR 2025)

这篇文章给MoE增加了一些特殊的token,实现对token的个性化处理。一般的MoE中,每个token都要过多个FFN进行计算,但实际上有的token可能不需要这么复杂的计算。这篇文章给MoE增加了Zero、Copy、Const三种特殊的Expert,分别是直接输出0、直接拷贝输入、用输入和一个可学习向量做加权。同时,为了让异构Expert引入后学习更加稳定,文中采用了类似残差的方式,当前层的各个专家的预估路由分会考虑上一层的路由分作为输入。

图片

4
DeepSeekMoE—专家切分和共享专家

论文标题:DeepSeekMoE: Advancing MoE Architecture with Fine-Grained Expert Segmentation(ACL 2024)

DeepSeek提出的MoE结构的修改,核心在于一方面将每个Expert拆成更小、更细的专家,并且激活比例不变。另一方面,引入了多个通用的共享专家,专门用来处理通用的知识,所有token固定激活共享专家。

图片

5
提升专家多样性

论文标题:Advancing Expert Specialization for Better MoE(NIPS 2025)

为了避免MoE中只有少数专家被激活的问题,在MoE中一般会引入负载均衡的loss。但是这篇文章发现,这种loss的引入会导致每个专家处理的信息重叠,专家缺少个性化,严重可能退化成FFN。为了解决这个问题,本文引入了2个损失函数。第一个损失函数要求各个专家的输出表征正交,通过两两专家之间的夹角余弦求和得到。第二个损失函数要求每个专家生成的分数方差尽可能大,用每个专家打分和所有专家打分均值计算方差求和得到。通过上述两种方式,实现了专家的差异性,减少路由的趋同性问题。

图片

最后

选择AI大模型就是选择未来!最近两年,大家都可以看到AI的发展有多快,时代在瞬息万变,我们又为何不给自己多一个选择,多一个出路,多一个可能呢?

与其在传统行业里停滞不前,不如尝试一下新兴行业,而AI大模型恰恰是这两年的大风口,人才需求急为紧迫!

人工智能时代最缺的是什么?就是能动手解决问题还会动脑创新的技术牛人!智泊AI为了让学员毕业后快速成为抢手的AI人才,直接把课程升级到了V6.0版本‌。

这个课程就像搭积木一样,既有机器学习、深度学习这些基本功教学,又教大家玩转大模型开发、处理图片语音等多种数据的新潮技能,把AI技术从基础到前沿全部都包圆了!

课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事‌!

图片

课程还教大家怎么和AI搭档一起工作,就像程序员带着智能助手写代码、优化方案,效率直接翻倍‌!

这么练出来的学员确实吃香,83%的应届生都进了大厂搞研发,平均工资比同行高出四成多‌。

智泊AI还特别注重培养"人无我有"的能力,比如需求分析、创新设计这些AI暂时替代不了的核心竞争力,让学员在AI时代站稳脚跟‌。

课程优势一:人才库优秀学员参与真实商业项目实训

图片

课程优势二:与大厂深入合作,共建大模型课程

图片

课程优势三:海外高校学历提升

图片

课程优势四:热门岗位全覆盖,匹配企业岗位需求

图片

如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!

·应届毕业生‌:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。

·零基础转型‌:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界‌。

·业务赋能 ‌突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型‌。

图片

智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念‌,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势‌,构建起"前沿课程+智能实训+精准就业"的高效培养体系。

重磅消息

人工智能V6.0升级两大班型:AI大模型全栈班AI大模型算法班,为学生提供更多选择。

图片

图片

由于文章篇幅有限,在这里我就不一一向大家展示了,学习AI大模型是一项系统工程,需要时间和持续的努力。但随着技术的发展和在线资源的丰富,零基础的小白也有很好的机会逐步学习和掌握。

【最新最全版】AI大模型全套学习籽料(可无偿送):LLM面试题+AI大模型学习路线+大模型PDF书籍+640套AI大模型报告等等,从入门到进阶再到精通,超全面存下吧!

获取方式:有需要的小伙伴,可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

来智泊AI,高起点就业

培养企业刚需人才

扫码咨询 抢免费试学

⬇⬇⬇

在这里插入图片描述

在这里插入图片描述

AI大模型学习之路,道阻且长,但只要你坚持下去,就一定会有收获。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐