一文解读:多模态大语言模型综述,建议收藏!
多模态大语言模型综述,这篇文章就是对这篇综述论文的解读:

大家要是想了解更详细的内容,可以去看原文。我会尽量把论文里的重要信息都总结出来,希望能帮到大家。
引入
多模态模型主要有两种范式,一种是Discriminative(判别式),另一种是Generative(生成式)。其中,判别式的代表就是CLIP,生成式的包括OFA,还有咱们这次重点要讲的——多模态大语言模型(MLLM)。
Discriminative(判别式)
CLIP是OpenAI的经典作品,它用对比学习的方法,把视觉信息(比如图片)和文本信息(比如文字描述)整合到同一个特征空间里,这样对后续做各种多模态相关的任务都很有帮助。
之所以说它是判别式范式,是因为CLIP用的是对比学习框架,训练的时候会对比正样本(匹配的图片和文本对)和负样本(不匹配的图片和文本对)。

这种学习方式的核心,就是锻炼模型区分不同类别的能力,具体来说就是分清哪些图片和文本是匹配的、哪些不匹配。而且,就算没见过某个类别的标签,它也能完成分类任务,就像下面这张图展示的那样:

Generative(生成式)
OFA模型,也就是One-For-All模型,是阿里巴巴达摩院提出来的一款多模态预训练模型。
它属于生成式方案,用的是统一的Transformer encoder-decoder架构来做预训练和微调,不用针对不同的任务专门设计特定的模型层。
简单说,OFA会把各种不同的任务,都转换成序列到序列(Seq2Seq)的形式,通过生成的方式进行预训练和微调,这样模型就能同时学习多种任务了。

随着大模型的发展,生成式方案现在已经成了研究的热点。其中,多模态大语言模型凭借着强大的多模态感知和理解能力,在一些需要结合多种模态信息进行推理的任务中,表现得特别出色,也能给用户带来更自然、更方便的交互体验。
接下来,咱们就全面解读一下多模态大语言模型的几个重要方面。
多模态大语言模型

一般来说,多模态大语言模型的网络架构,主要包含三个部分:一个预训练的模态编码器、一个预训练的LLM(大语言模型),还有一个模态接口Connector。当然,也可以在LLM后面再加上一个生成器,用来生成不同模态的结果。
模态编码器
模态编码器其实就是一种预训练的模态对齐模型,它的作用很简单,就是提前把不同模态的输入数据,和LLM的输入数据调整到同一维度、相互匹配。
根据输入数据的不同类型,模态编码器也分种类,比如处理图片的图片编码器、处理声音的音频编码器,还有处理视频的视频编码器。
举个例子,常见的图片编码器有这些:

很多研究都表明,输入更高分辨率的图片,能让模型的性能有明显提升。至于怎么提升输入图片的分辨率,目前主要有两种思路:
direct scaling way(直接缩放法)
就是直接输入分辨率比较高的图片,这就需要要么微调一个能接收高分辨率图片的编码器,要么直接换一个本身就支持高分辨率的编码器。
比如CogAgent,它就用了双编码器的结构,一个接收低分辨率图片,一个接收高分辨率图片,然后通过cross-attention,把高分辨率的特征嵌入到低分辨率的分支里。
patch-division methods(补丁分割法)
就是把高分辨率的图片切成多个小补丁(patches),这些小补丁都能输入到低分辨率编码器里。
之后,这些小补丁和这张高分辨率图片对应的低分辨率版本,一起输入到图片编码器中,这样就能分别捕捉到图片的局部特征和全局特征了。
除了图片编码器,还有其他类型的模态编码器,比如CLAP是用来对语音进行编码的,ImageBind则能对图片、文本、语音、深度图、热图、IMU数据这些多种模态的数据进行编码。
大语言模型
大语言模型是一种预训练的大模型,这个大家应该都比较熟悉了:

模态接口

模态接口其实就是一个可以学习的网络,它主要有三种形式:projection-based、query-based和fusion-based。前两种属于token级别的混合,最后一种属于特征级别的混合。
简单解释一下:projection-based方法,就是通过MLP把其他模态的数据特征,映射到文本特征空间里;
query-based方法,就是通过查询(query)的方式,找到输入模态数据对应的文本特征;fusion-based方法,则是通过多头注意力机制,把输入中的文本特征和其他模态的特征混合在一起。
前两种方法得到的文本特征,也需要和输入中的文本特征结合起来,不过和fusion-based的结合方式不一样,前两种一般是直接拼接(concat)在一起。
最后
选择AI大模型就是选择未来!最近两年,大家都可以看到AI的发展有多快,时代在瞬息万变,我们又为何不给自己多一个选择,多一个出路,多一个可能呢?
与其在传统行业里停滞不前,不如尝试一下新兴行业,而AI大模型恰恰是这两年的大风口,人才需求急为紧迫!
人工智能时代最缺的是什么?就是能动手解决问题还会动脑创新的技术牛人!智泊AI为了让学员毕业后快速成为抢手的AI人才,直接把课程升级到了V6.0版本。
这个课程就像搭积木一样,既有机器学习、深度学习这些基本功教学,又教大家玩转大模型开发、处理图片语音等多种数据的新潮技能,把AI技术从基础到前沿全部都包圆了!
课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!

课程还教大家怎么和AI搭档一起工作,就像程序员带着智能助手写代码、优化方案,效率直接翻倍!
这么练出来的学员确实吃香,83%的应届生都进了大厂搞研发,平均工资比同行高出四成多。
智泊AI还特别注重培养"人无我有"的能力,比如需求分析、创新设计这些AI暂时替代不了的核心竞争力,让学员在AI时代站稳脚跟。
课程优势一:人才库优秀学员参与真实商业项目实训

课程优势二:与大厂深入合作,共建大模型课程

课程优势三:海外高校学历提升

课程优势四:热门岗位全覆盖,匹配企业岗位需求

如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!
·应届毕业生:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
·零基础转型:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
·业务赋能 突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。

智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势,构建起"前沿课程+智能实训+精准就业"的高效培养体系。
重磅消息
人工智能V6.0升级两大班型:AI大模型全栈班、AI大模型算法班,为学生提供更多选择。


由于文章篇幅有限,在这里我就不一一向大家展示了,学习AI大模型是一项系统工程,需要时间和持续的努力。但随着技术的发展和在线资源的丰富,零基础的小白也有很好的机会逐步学习和掌握。
【最新最全版】AI大模型全套学习籽料(可无偿送):LLM面试题+AI大模型学习路线+大模型PDF书籍+640套AI大模型报告等等,从入门到进阶再到精通,超全面存下吧!
获取方式:有需要的小伙伴,可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
来智泊AI,高起点就业
培养企业刚需人才
扫码咨询 抢免费试学
⬇⬇⬇


AI大模型学习之路,道阻且长,但只要你坚持下去,就一定会有收获。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)