神经网络与深度学习课程笔记(4)
1. 大模型技术概述
1.1. 什么是大语言模型(LLM)
-
定义:基于海量文本数据训练的深度学习模型,能生成和理解自然语言。
-
例子:GPT-3.5、GPT-4、文心一言、通义千问。
1.2. 大语言模型原理
-
单字接龙:根据上文逐步生成下一个字。
-
回答机制:将问题作为上文的一部分,模型根据学习材料生成回答。
1.3. GPT系列参数对比
| 模型 | 参数量 | 学习材料大小 |
|---|---|---|
| GPT-1 | 1.17亿 | 5 GB |
| GPT-2 | 15亿 | 40 GB |
| GPT-3 | 1700亿 | 45 TB |
| GPT-4 | 万亿级别 | >100 TB |
1.4. 大模型训练三阶段
-
无监督学习:模型自学语言规律。
-
有监督学习:学习人工标注的问答对。
-
强化学习:通过奖励模型(RM)优化回答质量。
2. 多模态大模型技术
-
多模态定义:融合视觉、语言、声音等多种信息。
-
核心挑战:如何对齐不同模态的表示。
-
常用模型:ChatGPT、Gemini、Claude、LLaMA、DeepSeek、Qwen等。
3. 视觉Transformer(ViT)
3.1. ViT概述
-
提出:Google团队,2020年CVPR论文《An Image Is Worth 16x16 Words》。
-
核心思想:将图像划分为多个patch,当作“词”输入Transformer。
3.2. 嵌入层(Embedding Layer)
-
图像切分:输入图像 x∈RH×W×Cx∈RH×W×C,patch大小 pp,得到 N=HWp2N=p2HW 个patch。
-
线性映射:将每个patch展平并映射到固定维度。
-
位置编码:使用1D正弦余弦编码:
3.3. 编码器(Encoder)
-
每个编码器块包含:
-
Layer Normalization
-
Multi-Head Self-Attention
-
MLP(含GELU激活函数)
-
ViT前向传播公式:
3.4. 激活函数:GELU
3.5. MLP头(MLP Head)
-
提取
[CLS]token 作为图像特征。 -
预训练时使用 Linear + tanh + Linear。
-
微调时只需一个 Linear 层。
3.6. 模型参数对比
| 模型 | Patch大小 | 层数 | 隐藏维度 | MLP维度 | 头数 | 参数量 |
|---|---|---|---|---|---|---|
| ViT-Base | 16x16 | 12 | 768 | 3072 | 12 | 86M |
| ViT-Large | 16x16 | 24 | 1024 | 4096 | 16 | 307M |
| ViT-Huge | 14x14 | 32 | 1280 | 5120 | 16 | 632M |
3.7. 微调(Fine-Tuning)
-
问题:更高分辨率图像 → 更多patch → 位置编码长度不匹配。
-
解决:2D插值位置编码。
4. CLIP模型(Common Language-Image Pre-training)
-
使用图像-文本对进行预训练。
-
可实现零样本图像分类、跨模态检索等任务。
5. 知识蒸馏与DINO
-
知识蒸馏:用小模型模仿大模型输出。
-
DINO:自监督学习 + 知识蒸馏,无需标签即可训练ViT。
6. 总结
-
ViT将图像视为patch序列,借鉴NLP中的Transformer架构。
-
CLIP结合图像和文本,扩展了视觉模型的应用边界。
-
DINO通过知识蒸馏实现高效的视觉自监督学习。
视觉大模型的发展,本质上是NLP思想向视觉领域的迁移与融合。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)