一、大语言模型:视觉大模型的基石

        大语言模型是当前人工智能热潮的核心驱动力。它基于海量文本数据训练而成的深度学习模型,不仅能够生成流畅的自然语言文本,还能深入理解文本的语义,从而完成文本摘要、问答、翻译、代码生成等复杂任务。典型的大语言模型包括GPT-3.5、GPT-4、文心一言、通义千问等。这些模型之所以表现出强大的能力,与其庞大的参数量和训练数据规模密切相关。以GPT系列为例,GPT-1参数量仅为1.17亿,学习材料约5GB;GPT-2参数量达到15亿,数据量40GB;GPT-3参数量激增至1750亿,数据量达到45TB;而GPT-4的参数量已经达到万亿级别,训练数据超过100TB。

        大语言模型的运作原理可以形象地理解为“单字接龙”。当给模型一个上文时,它会根据学习到的规律不断预测下一个字。例如,输入“我”,模型可能生成“是”,然后将“我是”作为新的上文,再生成“一”,如此循环往复,最终形成完整的句子甚至长篇文章。这种自回归生成的方式使得模型可以产生任意长度的输出。模型回答问题的方式也十分直接:将用户的问题本身作为上文的一部分,然后基于这个完整的上文继续生成下文,从而得到问题的答案。模型之所以能够给出合理的回答,完全依赖于它在训练阶段从海量学习材料中学到的语言规律和事实知识。

        大语言模型的训练一般分为三个精心设计的阶段。第一阶段是无监督学习,模型在海量的无标注文本资料中自学,目标是掌握语言的表达规律、语法结构和词汇之间的关联。这个阶段通常采用两种预训练技术:一是语言模型预训练,即预测下一个单词的概率;二是掩码语言模型预训练,即根据输入的部分文本预测被掩盖位置的单词。第二阶段是有监督学习,模型开始学习人类整理好的规范问答数据,通过有监督微调技术让模型掌握如何正确回答一个问题。微调技术通常采用梯度下降算法不断调整模型的权重和偏置,以最小化损失函数,从而提高模型在特定任务上的表现能力。第三阶段是强化学习,在这个阶段,研究者会训练一个奖励模型,该模型的任务是评判模型生成的回答质量好坏。具体做法是,给定一个提示,将初始语言模型和当前训练中的语言模型分别生成的回答交给奖励模型打分,通过比较两个回答的得分差值来指导策略模型的参数更新,常用的算法是PPO(近端策略优化)。通过不断迭代,模型的回答水平逐步优化,越来越符合人类的偏好。

二、多模态大模型:从单一语言到多感官融合

        人类感知世界从来不是依靠单一模态,而是综合运用视觉、语言、听觉、触觉等多种信息。随着Transformer等关键技术的提出,以往相对独立的各个研究方向逐渐融合在一起,形成了“多模态”这一新兴领域。多模态大模型的核心思想是“外形多,内在统一”,即围绕一个基础模型,整合不同模态的信息处理能力。视觉大模型是基础模型的重要应用方向,同时也是基础模型不可分割的组成部分。

        随着数据集和模型规模的不断扩大,传统的多模态模型如果从头开始训练,将面临巨大的计算量。一个更加合理且高效的策略是利用已经训练好的单模态基础模型,尤其是大语言模型。大语言模型具有良好的语言生成能力、零样本学习能力和上下文学习能力,而其他模态的基础模型(如视觉特征提取模型)则能够提供高质量的表征。然而,不同模态的模型是分开训练的,如何将它们有效连接起来,实现协同推理,成为了核心挑战。目前的主流解决方案是通过多模态预训练和多模态指令微调,来实现不同模态之间的对齐,以及模型输出与人类意图的对齐。

        在多模态大模型的发展历程中,涌现出了许多知名的模型。OpenAI与微软推出的ChatGPT系列(最新版本ChatGPT-4.5)以及后续的综合模型,谷歌DeepMind推出的Gemini系列(如Gemini 2.5 Pro),Anthropic推出的Claude系列(Claude 4.0在编程方面表现突出),Meta开源的LLaMA系列(LLaMA 4.0在自然语言处理方面实力不俗),马斯克旗下xAI推出的Grok系列(Grok 4综合能力强),以及国内深度求索公司的DeepSeek系列(DeepSeek R1以及后续的R2)和阿里的Qwen系列(Qwen 3在问答和自然语言处理方面表现优异)。这些模型各有侧重,共同推动着多模态技术向更通用、更智能的方向发展。

三、视觉Transformer:将图像视为单词序列

        视觉Transformer(ViT)是视觉大模型发展历程中一个革命性的工作。2020年,Google团队在CVPR上发表了题为“An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale”的论文,首次将Transformer架构直接应用于图像分类任务,并取得了超越传统卷积神经网络的效果。这项工作的核心洞察是:一幅图像可以像一句话一样,被切分成若干个小块(称为图像块或patch),每个图像块扮演着类似于单词的角色。

        ViT的整体架构主要分为三个部分:嵌入层、编码器和MLP头。在嵌入层中,首先将输入图像切分成固定大小的图像块序列。以ImageNet数据集为例,输入图像大小为224×224×3,选择每个图像块的大小为16×16×3,因此每个图像块的维度是768(16×16×3)。图像块的数量为(224/16)×(224/16)= 14×14 = 196个,这196个图像块就构成了一个长度为196的序列,类似于一个句子中的单词个数。接下来,每个图像块被展平并通过一个线性映射层,将其维度映射到指定的嵌入维度(例如768),这与自然语言处理中的词嵌入非常相似。随后,需要向序列中添加位置编码,因为Transformer本身不具备感知顺序的能力。ViT采用了与原始Transformer相同的一维正弦余弦位置编码,虽然图像是二维结构,但实验证明一维编码已经足够让模型学习到图像块之间的空间位置关系。此外,ViT还在序列的开头额外添加了一个特殊的类别标记(class token),这个标记最终的输出将代表整张图像的特征,用于后续分类任务。因此,最终输入Transformer编码器的矩阵维度为197×768。

        编码器部分是ViT的核心,它由多个相同的层堆叠而成。每一层包含层标准化、多头注意力机制和多层感知机。与原始Transformer稍有不同的是,ViT在进入多头注意力之前先进行层标准化。层标准化是一种归一化技术,它对每个样本在特征维度上计算均值和方差,然后进行归一化,再学习适当的缩放和偏移,从而稳定训练过程、提升模型表达能力。多头注意力机制接受查询、键和值三个矩阵,为每个注意力头计算注意力分数,经过缩放和softmax操作后得到注意力权重,再用这些权重对值矩阵进行加权求和,最后将所有注意力头的输出拼接起来得到最终表示。通过多头注意力,模型能够同时关注不同图像块之间的多种关系。多层感知机部分通常采用GELU激活函数,GELU(高斯误差线性单元)通过标准正态分布的累积分布函数对输入进行门控,相比ReLU更加平滑,在许多深度学习任务中表现更好。整个编码器的计算可以概括为:首先将嵌入序列输入多头注意力(前置层标准化)并加上残差连接,然后将结果输入多层感知机(同样前置层标准化)并加上残差连接,如此重复L层。

        在经过所有编码器层之后,提取类别标记对应的输出向量,将其送入MLP头进行分类预测。在预训练阶段(例如在ImageNet-21K或JFT-300M数据集上),MLP头通常由一个线性层、一个tanh激活函数和另一个线性层组成。而在迁移到下游任务进行微调时,MLP头往往简化为一个线性层即可。最终,模型的输出与真实标签计算交叉熵损失,完成训练过程。

        ViT模型提供了不同规模的版本供选择。ViT-Base(基础版)采用16×16的图像块,包含12层编码器,隐藏层维度为768,MLP层内部维度为3072,多头注意力使用12个头,参数量约为8600万。ViT-Large(大号版)同样使用16×16的图像块,包含24层编码器,隐藏层维度为1024,MLP内部维度为4096,16个注意力头,参数量约为3.07亿。ViT-Huge(超大版)使用14×14的图像块,包含32层编码器,隐藏层维度为1280,MLP内部维度为5120,16个注意力头,参数量约为6.32亿。实验结果表明,在ImageNet数据集上,ViT-Huge在JFT数据集上预训练后可以达到88.55%的准确率,在ImageNet ReaL上达到90.72%,在CIFAR-10上达到99.50%,在CIFAR-100上达到94.55%,在Oxford-IIIT Pets上达到97.56%,在Oxford Flowers-102上达到99.68%,在包含19个任务的VTAB基准上达到77.63%。相比之下,当时最先进的卷积神经网络BiT-L(ResNet152x4)在ImageNet上只有87.54%,而Noisy Student(EfficientNet-L2)虽然达到了88.4%到88.5%的水平,但计算开销远大于ViT。值得注意的是,ViT-Huge的训练成本为2.5k TPUv3核心天数,而BiT-L需要9.9k,Noisy Student需要12.3k,这充分体现了ViT在大规模预训练下的效率优势。

四、微调与位置编码的适配

        预训练好的ViT模型是一个强大的特征提取器,但为了适应不同的下游任务,通常需要进行微调。微调时,我们会喂给预训练模型新的数据,同时尽量保持模型主体架构不变,常见做法是固定ViT的大部分参数,只在输出层后接一个新的模型,训练时只更新新模型的参数。这种操作既能利用已有模型的特征提取能力,又能让模型快速适应新任务。

        然而,微调过程中会遇到一个实际问题:下游任务使用的图像分辨率可能与预训练时不同。例如,预训练时使用224×224的图像,而微调时为了获得更好的效果,可能使用1024×1024的高分辨率图像。假设保持图像块大小16×16不变,那么预训练时产生的图像块数量为196个,而微调时产生的图像块数量为4096个。虽然Transformer编码器本身理论上可以处理任意长度的输入序列,但可学习的位置编码却是固定长度的——每个位置对应一个唯一的位置编码,因此预训练的位置编码无法直接适配更长的序列。为了解决这一问题,ViT采用了二维插值的方法:将预训练阶段学习到的位置编码按照新的图像块网格尺寸进行插值,从而生成适配新序列长度的位置编码。这种方法简单而有效,保证了ViT能够灵活地处理不同分辨率的输入图像。

五、CLIP与DINO:视觉大模型的另外两个重要方向

        除了ViT,视觉大模型中还有两个不可忽视的工作:CLIP和DINO。CLIP(通用视觉语言模型)利用海量的图像-文本对进行预训练,学习一个共享的嵌入空间,使得相似的图像和文本在该空间中距离更近。通过这种方式,CLIP可以实现零样本分类,即不需要针对特定类别进行训练,就能直接识别出图像中的物体。CLIP的提出极大地促进了视觉与语言的多模态融合,被广泛应用于图像检索、图像描述生成、视觉问答等任务。DINO则是一种基于知识蒸馏的自监督学习方法。知识蒸馏的核心思想是用一个大型教师模型的输出作为软标签来训练一个小型学生模型,从而将知识从大模型迁移到小模型。DINO在自监督设置下,通过教师-学生架构和精心设计的训练策略,使得Vision Transformer能够在不依赖人工标注的情况下学习到非常强大的视觉特征。DINO的特征不仅在图像分类上表现优异,还展现出了令人惊讶的语义对应能力,例如可以自动发现图像中的物体部位、实现图像分割等。

        回顾视觉大模型的发展历程,可以清晰地看到一条从自然语言处理到计算机视觉的迁移路径。ViT的核心思想是用图像块代替单词,将Transformer架构无缝对接到视觉任务中,证明了Transformer在视觉领域同样具有强大的建模能力。CLIP进一步将视觉与语言结合起来,开启了多模态大模型的新纪元。DINO则展示了自监督学习与知识蒸馏结合的巨大潜力,使得模型可以在无标注数据上高效学习。这三项工作共同奠定了现代视觉大模型的基础,也为后续更强大的多模态大模型(如GPT-4V、Gemini等)铺平了道路。未来,随着模型规模继续扩大、训练数据更加丰富、训练方法不断优化,视觉大模型有望在更广泛的应用场景中发挥关键作用,推动人工智能向更加通用、更加智能的方向迈进。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐