本人学习大模型技术概述
目录
2.1 大语言模型(LLM, Large Language Model)
2.2 多模态理解模型(Multimodal Understanding Model)
2.3 多模态生成模型(Multimodal Generative Model)
2.4 嵌入模型(Embedding / Representation Model)
2.5 重排序模型(Reranking / Scoring Model)
2.6 分类器 / 评判模型(Classifier / Judge Model)
第一步:SFT(Supervised Fine-Tuning,有监督微调)
第二步:RLHF / RLAIF(基于人类 / AI 反馈的强化学习)
9.3 MCP(Model Context Protocol)
一篇带你全面了解大模型技术体系的入门指南。
一、什么是大模型?
大模型(Large Models) 通常指参数规模达到数十亿(Billion, 10⁹)甚至数万亿级别的人工智能模型。比如我们常听到的 7B、70B、乃至上千亿参数的模型,都属于大模型范畴。
大模型之所以 “大”,主要体现在三个维度:
| 维度 | 含义 | 示例 |
|---|---|---|
| 参数量(Parameters) | 模型中的可学习权重数量 | 7B = 70 亿个参数 |
| 训练数据(Tokens) | 模型见过的训练语料规模 | Qwen3 使用了 36T tokens 训练 |
| 计算量(FLOPs) | 训练所需的浮点运算次数 | 1 PFLOPs = 10¹⁵ 次运算 |
几个核心概念的直观理解:
-
Token:大模型处理文本的最小语义单元,一个 token 约等于 0.3~0.6 个汉字,取决于 tokenizer(分词器)的设计。
-
Transformer 架构:当今几乎所有大模型的底层骨干网络,通过自注意力机制(Self-Attention)捕获长距离依赖关系。
-
Loss Function(损失函数):模型训练时的 “指挥棒”,常见的有 MSE、MAE 以及交叉熵损失,模型通过最小化 Test Loss 来提升预测能力。
二、大模型的分类体系
大模型并非只有 ChatGPT 这样的对话模型。按照功能和应用场景,可以分为以下几类:
2.1 大语言模型(LLM, Large Language Model)
最基础也最核心的一类,专门处理语言 / 文本任务。核心能力是 自回归预测下一个 token,即 P(token | context)。
代表产品:Qwen3、DeepSeek-V3.2、GPT-5、Gemini-3
2.2 多模态理解模型(Multimodal Understanding Model)
不仅能理解文本,还能理解图像、音频、视频等多种模态的输入。
典型能力:VQA(视觉问答)、PDF 解析、图表理解
代表产品:GPT-5、Qwen3-VL、Gemini-3
2.3 多模态生成模型(Multimodal Generative Model)
从一种模态生成另一种模态的内容:
-
Text-to-Image:Stable Diffusion、DALL·E、Nano-Banana
-
Text-to-Video:Sora、Veo
-
TTS(文本转语音)/ 音乐生成:AudioLM、VALL-E
2.4 嵌入模型(Embedding / Representation Model)
将文本转换为稠密向量(dense vector),是 RAG(检索增强生成)的核心基础设施。
代表产品:BGE、E5、GTE
2.5 重排序模型(Reranking / Scoring Model)
对 (query, doc) 对进行打分,在检索结果中选出最相关的内容。
代表产品:BGE-Reranker、Cross-Encoder(如 ms-marco-MiniLM)
2.6 分类器 / 评判模型(Classifier / Judge Model)
用于情感分析、内容审核、Yes-No 判断等任务。早期代表如 BERT 系列模型。
三、开源 vs 闭源:生态博弈
开源阵营
-
DeepSeek 系列:国产开源之光,性价比极高
-
Qwen(通义千问)系列:阿里开源,生态完善
-
Llama 系列:Meta 开源,Llama 4.5 于 2025 年发布
-
Gemma 系列:Google 开源(Gemma 是 Gemini 的开源版本)
闭源阵营
-
GPT 系列(OpenAI):从 GPT-1 到 GPT-5,ChatGPT 引爆 AI 浪潮
-
Gemini 系列(Google):闭源,通过 API 提供服务
-
Claude 系列(Anthropic):强调安全性和对齐
选择策略
| 场景 | 推荐 |
|---|---|
| 研究 / 二次开发 / 私有化部署 | 开源模型 |
| 追求极致性能 / 快速集成 | 闭源 API |
| 混合方案 | 开源做基座 + 闭源做关键链路 |
四、大模型是如何训练的?
大模型的训练分为两个核心阶段:
4.1 预训练(Pre-Training)
在海量无标注语料上进行自监督学习,目标是让模型 学会语言本身——语法、知识、推理模式等。
核心目标函数:最大化对数似然 max Σ log P(xₜ | x_{<t})
这是一个极其消耗算力的过程,需要数百至数千张 GPU/TPU 并行训练,耗时数月。
4.2 后训练(Post-Training)
在预训练完成的基础上,通过有监督数据让模型“对齐”人类偏好,分为两步:
第一步:SFT(Supervised Fine-Tuning,有监督微调)
-
使用高质量的人工标注 “指令 - 回复” 对来微调模型
-
教会模型“按照人类的格式和规范回答问题”
-
数据量通常不大,但质量要求极高
-
常用技术:LoRA(低秩适配),参数量仅原模型的 0.1%~1%,一个 7B 模型的 LoRA 权重仅 4-20MB
第二步:RLHF / RLAIF(基于人类 / AI 反馈的强化学习)
流程如下:
-
训练 Reward Model(RM,奖励模型):让人工标注员对同一 prompt 的多个模型输出进行排序(A > B > C),用排序数据训练 RM
-
PPO(近端策略优化):用 RM 作为奖励信号,通过强化学习优化模型策略
-
KL 散度约束:防止模型过度偏离 SFT 阶段学到的分布,保持输出的自然性和安全性
RLHF 和 RLAIF 的核心区别在于反馈来源:前者来自人类标注,后者用另一个强大的 AI 模型替代人类进行反馈。RLAIF 成本更低,但可靠性略逊。
五、算力与硬件基础设施
5.1 核心芯片类型
| 芯片 | 定位 | 特点 |
|---|---|---|
| CPU | 通用计算 | 擅长复杂逻辑控制,并行计算能力弱 |
| GPU | 图形 / 并行计算 | 拥有大量 CUDA 核心和 Tensor Core,是大模型训练的主力 |
| NPU | AI 推理加速 | 专为神经网络推理设计,功耗低,适合端侧部署 |
| TPU | Google 专有 | 为 TensorFlow 深度定制,Gemini-3 即在 TPU 上训练 |
5.2 关键显存指标
-
HBM(高带宽显存):AI 训练的标配,如 H100 配备 80GB HBM3
-
GDDR:消费级显卡使用,带宽相对较低
主流 GPU 一览:
| 型号 | 架构 | 定位 |
|---|---|---|
| H100 / H800 | Hopper (2022) | 数据中心旗舰 |
| A100 / A800 | Ampere (2020) | 上一代旗舰 |
| V100 | Volta (2017) | 经典入门 |
| RTX 4090 | Ada Lovelace (2022) | 消费级旗舰 |
| RTX 3090 | Ampere (2020) | 消费级 |
5.3 训练 vs 推理
-
训练(Training):计算密集(Compute-bound),瓶颈在 GPU 算力
-
推理(Inference):访存密集(Memory-bound),瓶颈在显存带宽
-
核心概念:KV Cache——推理时缓存 Key 和 Value 矩阵,避免重复计算
-
推理分为 Prefill(预填充) 和 Decode(逐 token 解码) 两个阶段
-
六、提示工程(Prompt Engineering)
6.1 基本技巧
-
Zero-shot Prompting:不给示例,直接提问。适合简单任务。
-
Few-shot Prompting:给出 2-5 个示例后再提问,模型通过上下文学习(In-Context Learning)掌握任务模式。
Q: <示例问题>? A: <示例回答> Q: <示例问题>? A: <示例回答> Q: <实际问题>? A:
-
角色设定(System Prompt):通过系统级提示词定义模型的角色、风格和行为边界。
你是一个资深 Python 工程师,请用简洁清晰的代码回答问题...
-
结构化输出:要求模型返回 JSON、Markdown 等特定格式,便于程序化处理。
-
分步骤思考(CoT, Chain-of-Thought):使用
Let's think step by step引导模型逐步推理。
6.2 高级策略
-
分隔符使用:用
<<< >>>、```等清晰标记不同内容块 -
ToT(Tree of Thoughts):在 CoT 的基础上引入分支和回溯
-
情绪化提示词:如 "This is very important to my career" 在某些场景下能提升输出质量(但需谨慎使用)
6.3 提示词资源
-
PromptGenius — 提示词优化工具
-
LangChain Hub — 提示词模板仓库
-
Awesome ChatGPT Prompts — 开源提示词合集
七、RAG(检索增强生成)
7.1 什么是 RAG?
RAG = Retrieval(检索) + Augmented(增强) + Generation(生成)。在 LLM 生成回答之前,先从外部知识库中检索相关信息,将检索结果拼入 prompt,让模型基于检索到的上下文作答。
7.2 RAG 的标准流程
用户提问
│
▼
Embedding Model → 将问题转为向量
│
▼
向量数据库 → 相似度检索
│
▼
Prompt = 检索到的上下文 + 用户提问
│
▼
LLM → 生成回答
7.3 RAG 的优势
-
有效缓解 幻觉(Hallucination) 问题
-
支持领域知识的持续更新,无需重新训练模型
-
可溯源,每个回答都有对应的文档依据
八、模型微调(Fine-tuning)
8.1 何时需要微调?
-
需要模型掌握特定领域的知识或术语
-
需要模型遵循特定的输出格式或风格
-
RAG + 微调的组合往往能取得最佳效果
8.2 微调方法对比
| 方法 | 参数量 | 显存需求 | 效果 |
|---|---|---|---|
| Full Fine-tuning | 100% | 极高(7B 需 80GB+) | 最佳 |
| LoRA | 0.1%~1% | 极低(4-20MB) | 接近全参微调 |
| QLoRA | 0.1%~1% | 更低(7B 仅需 24GB) | LoRA 的约 90% |
| Adapter / Prefix Tuning / P-Tuning v2 | 少量参数 | 低 | 中等 |
8.3 续训(Continued Training)
对于全新领域的知识(如法律、医学),需要在预训练基础上用领域语料 继续训练,数据量通常为 GB~TB 级别。策略上可以结合 SFT 和 RAG 形成完整方案。
九、AI Agent
9.1 什么是 Agent?
OpenAI 在 2023 年 6 月提出 LLM Agent 概念——让大模型不仅能“说话”,还能 主动使用工具、规划和执行任务。
9.2 Function Call(函数调用)
Agent 的核心能力之一。模型不再只输出文本,而是输出一个结构化的 函数调用指令,由外部系统执行后返回结果,模型再基于结果继续推理。
以 DeepSeek API 为例的 Function Call 流程:
用户: "北京今天天气怎么样?"
│
▼
模型返回: tool_call → get_weather(city="北京")
│
▼
外部系统执行 → 返回 {"temp": "2°C", "wind": "3级"}
│
▼
模型基于天气信息生成最终回复
9.3 MCP(Model Context Protocol)
MCP 由 Anthropic 于 2024 年 11 月推出,被称为 AI 界的 USB-C 接口。它标准化了模型与外部工具 / 数据源的连接方式:
-
Resources(资源):结构化数据
-
Prompts(提示):预定义的交互模板
-
Tools(工具):可执行的操作
相比 Function Call,MCP 的优势在于标准化和生态化——社区已有 8000+ 个 MCP Server,覆盖搜索引擎、数据库、文件系统等各类外部能力。
9.4 Agent 开发框架
-
Dify / Coze:低代码 / 无代码 Agent 构建平台
-
LangChain / LangGraph:Python 生态的 Agent 编排框架
-
更多平台如讯飞 Agent 等也在快速发展中
十、核心挑战与展望
10.1 幻觉问题(Hallucination)
大模型会“一本正经地胡说八道”,这是目前最核心的挑战之一。缓解策略:
-
使用更强的基座模型
-
高质量的训练数据和严格的 RLHF 对齐
-
RAG 提供事实锚定
-
在 Prompt 中明确要求模型“不确定时请说明”
10.2 AIGC → AGI
-
AIGC(AI Generated Content):当前阶段,AI 生成文本、图像、视频等内容
-
AGI(Artificial General Intelligence):终极目标,具备与人类同等乃至更强的通用智能能力。Agent 被视为通向 AGI 的关键路径。
写在最后
大模型技术体系庞大而精深,从底层的 Transformer 架构、GPU 集群训练,到上层的 Prompt Engineering、RAG、Agent 应用,构成了一个完整的技术栈。无论你是开发者、产品经理还是技术决策者,理解这张全景图都有助于在 AI 浪潮中找准自己的定位。
一句话总结:大模型 = 海量数据 × 超大规模参数 × Transformer 架构 × 人类对齐,而 RAG、微调和 Agent 则是让它真正落地产生价值的 “最后一公里”。
本文基于《大模型技术之大模型概述》整理编写,部分案例和表述有补充和扩展。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)