1. 大模型技术概述

1.1. 什么是大语言模型(LLM)

  • 定义:基于海量文本数据训练的深度学习模型,能生成和理解自然语言。

  • 例子:GPT-3.5、GPT-4、文心一言、通义千问。

1.2. 大语言模型原理

  • 单字接龙:根据上文逐步生成下一个字。

  • 回答机制:将问题作为上文的一部分,模型根据学习材料生成回答。

1.3. GPT系列参数对比

模型 参数量 学习材料大小
GPT-1 1.17亿 5 GB
GPT-2 15亿 40 GB
GPT-3 1700亿 45 TB
GPT-4 万亿级别 >100 TB

1.4. 大模型训练三阶段

  1. 无监督学习:模型自学语言规律。

  2. 有监督学习:学习人工标注的问答对。

  3. 强化学习:通过奖励模型(RM)优化回答质量。

2. 多模态大模型技术

  • 多模态定义:融合视觉、语言、声音等多种信息。

  • 核心挑战:如何对齐不同模态的表示。

  • 常用模型:ChatGPT、Gemini、Claude、LLaMA、DeepSeek、Qwen等。

3. 视觉Transformer(ViT)

3.1. ViT概述

  • 提出:Google团队,2020年CVPR论文《An Image Is Worth 16x16 Words》。

  • 核心思想:将图像划分为多个patch,当作“词”输入Transformer。

3.2. 嵌入层(Embedding Layer)

  • 图像切分:输入图像 x∈RH×W×Cx∈RH×W×C,patch大小 pp,得到 N=HWp2N=p2HW​ 个patch。

  • 线性映射:将每个patch展平并映射到固定维度。

  • 位置编码:使用1D正弦余弦编码:

\mathrm{PE}(\mathrm{pos}, 2i) = \sin \left( \frac{\mathrm{pos}}{10000^{(2i / d_{\mathrm{model}})}} \right)

\mathrm{PE}(\mathrm{pos}, 2i+1) = \cos \left( \frac{\mathrm{pos}}{10000^{(2i / d_{\mathrm{model}})}} \right)

3.3. 编码器(Encoder)

  • 每个编码器块包含:

    • Layer Normalization

    • Multi-Head Self-Attention

    • MLP(含GELU激活函数)

ViT前向传播公式

z_0 = [x_{\text{class}}; x_1^p E; \dots; x_N^p E] + E_{\text{pos}}

z_{\ell}' = \text{MSA}(\text{LN}(z_{\ell-1})) + z_{\ell-1}

z_{\ell} = \text{MLP}(\text{LN}(z_{\ell}')) + z_{\ell}'

y = \text{LN}(z_L^0)

3.4. 激活函数:GELU

\mathrm{GELU}(x) = x \Phi(x)

\Phi(x) = \frac{1}{2} \left[ 1 + \mathrm{erf}\left( \frac{x}{\sqrt{2}} \right) \right]

3.5. MLP头(MLP Head)

  • 提取 [CLS] token 作为图像特征。

  • 预训练时使用 Linear + tanh + Linear。

  • 微调时只需一个 Linear 层。

3.6. 模型参数对比

模型 Patch大小 层数 隐藏维度 MLP维度 头数 参数量
ViT-Base 16x16 12 768 3072 12 86M
ViT-Large 16x16 24 1024 4096 16 307M
ViT-Huge 14x14 32 1280 5120 16 632M

3.7. 微调(Fine-Tuning)

  • 问题:更高分辨率图像 → 更多patch → 位置编码长度不匹配。

  • 解决:2D插值位置编码。

4. CLIP模型(Common Language-Image Pre-training)

  • 使用图像-文本对进行预训练。

  • 可实现零样本图像分类、跨模态检索等任务。

5. 知识蒸馏与DINO

  • 知识蒸馏:用小模型模仿大模型输出。

  • DINO:自监督学习 + 知识蒸馏,无需标签即可训练ViT。

6. 总结

  • ViT将图像视为patch序列,借鉴NLP中的Transformer架构。

  • CLIP结合图像和文本,扩展了视觉模型的应用边界。

  • DINO通过知识蒸馏实现高效的视觉自监督学习。

视觉大模型的发展,本质上是NLP思想向视觉领域的迁移与融合。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐