深度学习课程学习报告week4_从大语言模型到视觉Transformer的范式跨越
本周学习总结
本周的课程带领我们实现了从纯粹的自然语言处理(NLP)领域向视觉与多模态领域的范式跨越。我们从大语言模型(LLM)的训练机制出发,最终落脚于彻底改变计算机视觉基本架构的 Vision Transformer (ViT)。结合课堂的推导与应用,本阶段的核心认知可以概括为:
- 大模型的演进与对齐:解构了从无监督预训练到有监督微调(SFT),再到基于人类反馈强化学习(RLHF)的 LLM 训练三部曲。
- 多模态的内在统一:探讨了如何以 LLM 为认知中枢,通过不同的模态编码器(如 ViT、CLIP)和生成器将视觉、听觉等感官信息统一到同一个架构下。
- 视觉 Transformer (ViT) 的重构:打破了传统 CNN 的局部感受野限制,通过将图像切割为 Patch 序列并引入自注意力机制,证明了在大规模数据驱动下,Transformer 架构在视觉任务上的万能逼近与超越能力。
1. 大语言模型 (LLM) 的基础与训练三部曲
大语言模型 (LLM) 是基于海量文本数据训练的深度学习模型,它不仅能够生成自然语言文本,还能深入理解文本含义并处理多种任务。从本质上看,LLM 的核心运作原理是“单字接龙” :给定上文,模型会根据其过去学习的材料,不断预测并生成下一个字。
为了使得这样一个简单的“接龙”系统具备强大的逻辑与认知能力,现代大模型的训练通常被拆解为三个核心阶段:
- 阶段一:无监督预训练 (Pre-training)。这是模型吸收海量知识的过程。给模型海量的学习资料让其自学,掌握语言的表达规律。此阶段主要包含语言模型预训练(预测下一个单词)和掩码语言模型预训练(预测掩码位置上的单词)。
- 阶段二:有监督训练微调 (Supervised Fine-Tuning, SFT)。通过在人为标注的问答数据上进行训练,使模型适应特定任务和场景,掌握如何规范地回答一个问题。
- 阶段三:强化学习优化 (RLHF)。利用强化学习技术不断优化模型的问答水平。首先训练一个奖励模型 (Reward Model, RM),对模型生成的多个回答进行人类偏好打分。随后,结合 RM 的打分信号,利用 PPO 等算法对语言模型策略进行梯度更新,使其输出与人类意图对齐。
2. 多模态大模型 (MM-LLM) 的系统架构
人类通过视觉、语言、声音等多种模态感知世界。随着 Transformer 技术的普及,多模态大模型通过利用现成的单模态基础模型(尤其是 LLM)来整合不同的感知流。
在系统拓扑结构上,多模态大模型通常呈现为一种“外形多,内在统一”的漏斗状架构:
- 模态编码器 (Modality Encoder):如处理图像的 ViT 或 CLIP,将外部非结构化信号提取为高维特征。
- LLM 主干 (Backbone):作为大脑,利用其强大的语言生成、Zero-shot 以及上下文学习 (ICL) 能力提供核心认知。
- 模态生成器 (Modality Generator):如 Stable Diffusion 等,将大模型处理后的隐藏状态还原为对应的图像、视频或声音输出。
核心挑战在于如何通过预训练和指令微调,将分开训练的不同模态连接并对齐,实现协同推理。
3. 视觉 Transformer (ViT) 的重构与数学基础
在 2020 年,Google 团队发表了开创性工作《AN IMAGE IS WORTH 16X16 WORDS》,正式将 NLP 中的 Transformer 标准架构近乎无修改地应用于图像分类任务中。ViT 抛弃了传统的卷积层,其核心逻辑是将图像降维为一维序列。
3.1 嵌入层:从二维图像到 Token 序列
标准的 Transformer 模块要求输入的是二维矩阵形式的 Token 序列。ViT 通过以下步骤完成了从视觉信号到序列的映射:
- 图像切块与展平 (Patch Flattening):对于输入图像 x∈RH×W×Cx \in \mathbb{R}^{H \times W \times C}x∈RH×W×C,设定 Patch 大小为 PPP,则图像被切割为 N=HWP2N = \frac{HW}{P^2}N=P2HW 个 Patch。以 ImageNet 的 224×224×3224 \times 224 \times 3224×224×3 图像为例,若 P=16P=16P=16,则产生 14×14=19614 \times 14 = 19614×14=196 个 Patch。
- 线性映射 (Linear Projection):展平后的每个 Patch 通过一个线性层映射到统一的 Embedding 维度(如 768 维)。
- 位置编码与分类 Token:引入额外的
<cls>Token 附加在序列头部(第 0 位置),最终序列长度变为 197。同时,将 1-D 正余弦位置编码 PE(pos,2i)PE(pos, 2i)PE(pos,2i) 直接相加到特征中,以保留图像的空间相对位置信息。作者实验证明,1-D 位置编码的效果已足够优秀,与 2-D 编码几乎无异。
3.2 编码器:注意力与动力学传递
ViT 的编码器部分继承了标准 Transformer 结构,由多个相同的 Block 组成,但有一个重要的细节差异:ViT 先进行层标准化 (Layer Norm),然后再送入多头注意力机制 (MSA) 和多层感知机 (MLP)。
其前向动力学方程可以表示为:
zl′=MSA(LN(zl−1))+zl−1 z'_l = MSA(LN(z_{l-1})) + z_{l-1} zl′=MSA(LN(zl−1))+zl−1
zl=MLP(LN(zl′))+zl′ z_l = MLP(LN(z'_l)) + z'_l zl=MLP(LN(zl′))+zl′
在非线性表达上,MLP 层弃用了传统的 ReLU,转而使用了 GELU (Gaussian Error Linear Unit) 激活函数。GELU 在 0 点附近的平滑特性,有助于在深层 Transformer 中提供更稳定的梯度反传流动。最终,只有位置 0 对应的 <cls> Token 会被抽取出来,送入 MLP Head 进行分类输出。
4. 规模效应与微调自适应 (Fine-Tuning)
从系统辨识的视角看,多层 Transformer 提供了一个极度庞大的假设空间,但其归纳偏置(Inductive Bias)弱于 CNN,因此极其依赖数据规模。
- 规模壁垒的突破:实验表明,经过如 JFT-300M 这样足够海量的数据预训练后,ViT 的表现全面超越了当时最顶级的基于 ResNet 的 CNN 模型 (BiT)。
- 高分辨率微调 (2D Interpolation):在实际下游任务微调时,为了获得更好的效果,我们往往会输入更高分辨率的图片(如 1024×10241024 \times 10241024×1024)。这导致生成的 Patch 数量远超预训练时的大小(如从 196 增加到 4096)。由于 Transformer 结构对序列长度天然自适应,主要矛盾在于绝对位置编码无法匹配。ViT 给出的工程解法是对预训练的二维位置编码进行 2D 插值 (2D interpolation),从而平滑地适应下游任务。
作为衍生,像 CLIP 利用图文对对比学习进一步拓展了零样本迁移能力;而 DINO 则通过知识蒸馏技术,实现了视觉 Transformer 的高效自监督学习。这标志着视觉大模型彻底进入了基础模型 (Foundation Model) 时代。
5. 编码器内部的动力学细节:MLP 层与 GELU 激活函数
在分析了 ViT 的自注意力机制后,我们需要深入其编码器内部的非线性映射部分——MLP Block。它由线性层、GELU 激活函数以及 Dropout 组成。
5.1 抛弃 ReLU:GELU 的平滑过渡
在早期的深度学习(如传统 CNN)中,ReLU 因其在正半轴导数恒为 1 的特性主导了激活函数的选择。但在 Transformer 以及 ViT 的架构中,模型转而采用了 GELU (Gaussian Error Linear Unit, 高斯误差线性单元)。
从数学定义来看,GELU 结合了以零均值为中心的非线性特性与统计概率分布:
GELU(x)=xΦ(x) GELU(x) = x\Phi(x) GELU(x)=xΦ(x)
其中 Φ(x)\Phi(x)Φ(x) 是标准正态分布的累积分布函数。为了便于工程计算,Φ(x)\Phi(x)Φ(x) 通常利用误差函数 (erf) 进行近似展开:
Φ(x)=12[1+erf(x2)] \Phi(x) = \frac{1}{2}\left[1 + \text{erf}\left(\frac{x}{\sqrt{2}}\right)\right] Φ(x)=21[1+erf(2x)]
erf(x)=2π∫0xe−t2dt \text{erf}(x) = \frac{2}{\sqrt{\pi}}\int_{0}^{x}e^{-t^2}dt erf(x)=π2∫0xe−t2dt
动力学意义:与 ReLU 在 x=0x=0x=0 处直接发生“硬截断”(不可导)不同,GELU 在零点附近提供了一个极其平滑的非线性过渡曲面。在拥有成百上千层、参数量极大的 Transformer 网络中,这种平滑性显著降低了梯度反传时的震荡,使得优化过程在复杂且高维的损失曲面上更加稳定。
6. 模型评估、规模效应与微调策略 (Fine-Tuning)
深度学习的工程实践最终要落实在模型性能与泛化能力上。ViT 的提出不仅仅是架构上的创新,更是“暴力美学”(数据与算力规模效应)的体现。
6.1 规模效应与对 CNN 的超越
ViT 依据隐藏层维度、层数和注意头数的不同,划分为 Base、Large 和 Huge 三个量级:
- ViT-Base:12 层,768 维隐藏层,约 86M 参数量。
- ViT-Huge:32 层,1280 维隐藏层,参数量激增至 632M。
在与当时最先进的 ResNet 变体(如 BiT-L)的对比中,ViT 展现出了强烈的数据饥渴特性。由于移除了卷积操作特有的归纳偏置(如平移不变性和局部感受野),ViT 在中等规模数据集(如 ImageNet)上从头训练时,表现不如 BiT。然而,当模型在包含 3 亿张图像的超大规模数据集 (JFT-300M) 上进行预训练后,ViT 的 Top-1 准确率实现了全面反超。这证明了在绝对的数据规模面前,泛用的 Transformer 架构能够自动学出比人工设计的卷积更加高效的视觉特征表示。
6.2 分辨率提升与 2D 位置编码插值
在实际工程落地中,我们往往使用预训练好的 ViT 作为特征提取器,并在特定下游任务上进行微调 (Fine-Tune)。
为了获得更精细的感知效果,微调阶段通常会输入比预训练阶段(如 224×224224 \times 224224×224)更高分辨率的图像(例如 1024×10241024 \times 10241024×1024)。在保持 Patch 尺寸不变的情况下,序列长度会急剧膨胀(如从 196 增加到 4096)。
由于位置编码 (Positional Embedding) 是与序列长度一一绑定的静态参数,无法直接复用,ViT 采用了一种优雅的数学技巧:2D 位置编码插值 (2D Interpolation)。通过将原有的一维位置编码还原回二维网格空间,进行双线性插值扩展后再重新展平,模型得以在保留预训练空间先验的前提下,平滑过渡到高分辨率输入。
7. 迈向通用视觉:CLIP 与 DINO
ViT 证明了 Transformer 在视觉特征提取上的万能逼近能力,而随后的 CLIP 与 DINO 则彻底打开了视觉大模型的通用化与自监督大门。
- CLIP (Contrastive Language-Image Pretraining):打通了视觉与语言的语义空间。它利用海量的互联网图文对进行对比学习,使得视觉特征直接对齐自然语言描述。这一范式跨越让视觉模型拥有了惊人的 Zero-Shot(零样本)分类与检索能力,成为了现今稳定扩散模型 (Stable Diffusion) 等多模态生成技术的底层语义引擎。
- 知识蒸馏与 DINO:摆脱了昂贵的人工标注依赖。DINO 利用知识蒸馏 (Knowledge Distillation) 的思想,实现了极其高效的自监督学习。它允许模型在没有标签的图像数据上,通过教师网络和学生网络的相互博弈与特征对齐,自主挖掘出物体的语义轮廓,甚至在某些场景下超越了有监督学习的泛化表现。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)