目录

一、什么是大模型?

二、大模型的分类体系

2.1 大语言模型(LLM, Large Language Model)

2.2 多模态理解模型(Multimodal Understanding Model)

2.3 多模态生成模型(Multimodal Generative Model)

2.4 嵌入模型(Embedding / Representation Model)

2.5 重排序模型(Reranking / Scoring Model)

2.6 分类器 / 评判模型(Classifier / Judge Model)

三、开源 vs 闭源:生态博弈

开源阵营

闭源阵营

选择策略

四、大模型是如何训练的?

4.1 预训练(Pre-Training)

4.2 后训练(Post-Training)

第一步:SFT(Supervised Fine-Tuning,有监督微调)

第二步:RLHF / RLAIF(基于人类 / AI 反馈的强化学习)

五、算力与硬件基础设施

5.1 核心芯片类型

5.2 关键显存指标

5.3 训练 vs 推理

六、提示工程(Prompt Engineering)

6.1 基本技巧

6.2 高级策略

6.3 提示词资源

七、RAG(检索增强生成)

7.1 什么是 RAG?

7.2 RAG 的标准流程

7.3 RAG 的优势

八、模型微调(Fine-tuning)

8.1 何时需要微调?

8.2 微调方法对比

8.3 续训(Continued Training)

九、AI Agent

9.1 什么是 Agent?

9.2 Function Call(函数调用)

9.3 MCP(Model Context Protocol)

9.4 Agent 开发框架

十、核心挑战与展望

10.1 幻觉问题(Hallucination)

10.2 AIGC → AGI

写在最后


一篇带你全面了解大模型技术体系的入门指南。


一、什么是大模型?

大模型(Large Models) 通常指参数规模达到数十亿(Billion, 10⁹)甚至数万亿级别的人工智能模型。比如我们常听到的 7B、70B、乃至上千亿参数的模型,都属于大模型范畴。

大模型之所以 “大”,主要体现在三个维度:

维度 含义 示例
参数量(Parameters) 模型中的可学习权重数量 7B = 70 亿个参数
训练数据(Tokens) 模型见过的训练语料规模 Qwen3 使用了 36T tokens 训练
计算量(FLOPs) 训练所需的浮点运算次数 1 PFLOPs = 10¹⁵ 次运算

几个核心概念的直观理解:

  • Token:大模型处理文本的最小语义单元,一个 token 约等于 0.3~0.6 个汉字,取决于 tokenizer(分词器)的设计。

  • Transformer 架构:当今几乎所有大模型的底层骨干网络,通过自注意力机制(Self-Attention)捕获长距离依赖关系。

  • Loss Function(损失函数):模型训练时的 “指挥棒”,常见的有 MSE、MAE 以及交叉熵损失,模型通过最小化 Test Loss 来提升预测能力。


二、大模型的分类体系

大模型并非只有 ChatGPT 这样的对话模型。按照功能和应用场景,可以分为以下几类:

2.1 大语言模型(LLM, Large Language Model)

最基础也最核心的一类,专门处理语言 / 文本任务。核心能力是 自回归预测下一个 token,即 P(token | context)

代表产品:Qwen3、DeepSeek-V3.2、GPT-5、Gemini-3

2.2 多模态理解模型(Multimodal Understanding Model)

不仅能理解文本,还能理解图像、音频、视频等多种模态的输入。

典型能力:VQA(视觉问答)、PDF 解析、图表理解

代表产品:GPT-5、Qwen3-VL、Gemini-3

2.3 多模态生成模型(Multimodal Generative Model)

从一种模态生成另一种模态的内容:

  • Text-to-Image:Stable Diffusion、DALL·E、Nano-Banana

  • Text-to-Video:Sora、Veo

  • TTS(文本转语音)/ 音乐生成:AudioLM、VALL-E

2.4 嵌入模型(Embedding / Representation Model)

将文本转换为稠密向量(dense vector),是 RAG(检索增强生成)的核心基础设施。

代表产品:BGE、E5、GTE

2.5 重排序模型(Reranking / Scoring Model)

对 (query, doc) 对进行打分,在检索结果中选出最相关的内容。

代表产品:BGE-Reranker、Cross-Encoder(如 ms-marco-MiniLM)

2.6 分类器 / 评判模型(Classifier / Judge Model)

用于情感分析、内容审核、Yes-No 判断等任务。早期代表如 BERT 系列模型。


三、开源 vs 闭源:生态博弈

开源阵营

  • DeepSeek 系列:国产开源之光,性价比极高

  • Qwen(通义千问)系列:阿里开源,生态完善

  • Llama 系列:Meta 开源,Llama 4.5 于 2025 年发布

  • Gemma 系列:Google 开源(Gemma 是 Gemini 的开源版本)

闭源阵营

  • GPT 系列(OpenAI):从 GPT-1 到 GPT-5,ChatGPT 引爆 AI 浪潮

  • Gemini 系列(Google):闭源,通过 API 提供服务

  • Claude 系列(Anthropic):强调安全性和对齐

选择策略

场景 推荐
研究 / 二次开发 / 私有化部署 开源模型
追求极致性能 / 快速集成 闭源 API
混合方案 开源做基座 + 闭源做关键链路

四、大模型是如何训练的?

大模型的训练分为两个核心阶段:

4.1 预训练(Pre-Training)

在海量无标注语料上进行自监督学习,目标是让模型 学会语言本身——语法、知识、推理模式等。

核心目标函数:最大化对数似然 max Σ log P(xₜ | x_{<t})

这是一个极其消耗算力的过程,需要数百至数千张 GPU/TPU 并行训练,耗时数月。

4.2 后训练(Post-Training)

在预训练完成的基础上,通过有监督数据让模型“对齐”人类偏好,分为两步:

第一步:SFT(Supervised Fine-Tuning,有监督微调)
  • 使用高质量的人工标注 “指令 - 回复” 对来微调模型

  • 教会模型“按照人类的格式和规范回答问题”

  • 数据量通常不大,但质量要求极高

  • 常用技术:LoRA(低秩适配),参数量仅原模型的 0.1%~1%,一个 7B 模型的 LoRA 权重仅 4-20MB

第二步:RLHF / RLAIF(基于人类 / AI 反馈的强化学习)

流程如下:

  1. 训练 Reward Model(RM,奖励模型):让人工标注员对同一 prompt 的多个模型输出进行排序(A > B > C),用排序数据训练 RM

  2. PPO(近端策略优化):用 RM 作为奖励信号,通过强化学习优化模型策略

  3. KL 散度约束:防止模型过度偏离 SFT 阶段学到的分布,保持输出的自然性和安全性

RLHF 和 RLAIF 的核心区别在于反馈来源:前者来自人类标注,后者用另一个强大的 AI 模型替代人类进行反馈。RLAIF 成本更低,但可靠性略逊。


五、算力与硬件基础设施

5.1 核心芯片类型

芯片 定位 特点
CPU 通用计算 擅长复杂逻辑控制,并行计算能力弱
GPU 图形 / 并行计算 拥有大量 CUDA 核心和 Tensor Core,是大模型训练的主力
NPU AI 推理加速 专为神经网络推理设计,功耗低,适合端侧部署
TPU Google 专有 为 TensorFlow 深度定制,Gemini-3 即在 TPU 上训练

5.2 关键显存指标

  • HBM(高带宽显存):AI 训练的标配,如 H100 配备 80GB HBM3

  • GDDR:消费级显卡使用,带宽相对较低

主流 GPU 一览:

型号 架构 定位
H100 / H800 Hopper (2022) 数据中心旗舰
A100 / A800 Ampere (2020) 上一代旗舰
V100 Volta (2017) 经典入门
RTX 4090 Ada Lovelace (2022) 消费级旗舰
RTX 3090 Ampere (2020) 消费级

5.3 训练 vs 推理

  • 训练(Training):计算密集(Compute-bound),瓶颈在 GPU 算力

  • 推理(Inference):访存密集(Memory-bound),瓶颈在显存带宽

    • 核心概念:KV Cache——推理时缓存 Key 和 Value 矩阵,避免重复计算

    • 推理分为 Prefill(预填充)Decode(逐 token 解码) 两个阶段


六、提示工程(Prompt Engineering)

6.1 基本技巧

  1. Zero-shot Prompting:不给示例,直接提问。适合简单任务。

  2. Few-shot Prompting:给出 2-5 个示例后再提问,模型通过上下文学习(In-Context Learning)掌握任务模式。

Q: <示例问题>? A: <示例回答>
Q: <示例问题>? A: <示例回答>
Q: <实际问题>? A:
  1. 角色设定(System Prompt):通过系统级提示词定义模型的角色、风格和行为边界。

你是一个资深 Python 工程师,请用简洁清晰的代码回答问题...
  1. 结构化输出:要求模型返回 JSON、Markdown 等特定格式,便于程序化处理。

  2. 分步骤思考(CoT, Chain-of-Thought):使用 Let's think step by step 引导模型逐步推理。

6.2 高级策略

  • 分隔符使用:用 <<< >>>``` 等清晰标记不同内容块

  • ToT(Tree of Thoughts):在 CoT 的基础上引入分支和回溯

  • 情绪化提示词:如 "This is very important to my career" 在某些场景下能提升输出质量(但需谨慎使用)

6.3 提示词资源


七、RAG(检索增强生成)

7.1 什么是 RAG?

RAG = Retrieval(检索) + Augmented(增强) + Generation(生成)。在 LLM 生成回答之前,先从外部知识库中检索相关信息,将检索结果拼入 prompt,让模型基于检索到的上下文作答。

7.2 RAG 的标准流程

用户提问
   │
   ▼
Embedding Model → 将问题转为向量
   │
   ▼
向量数据库 → 相似度检索
   │
   ▼
Prompt = 检索到的上下文 + 用户提问
   │
   ▼
LLM → 生成回答

7.3 RAG 的优势

  • 有效缓解 幻觉(Hallucination) 问题

  • 支持领域知识的持续更新,无需重新训练模型

  • 可溯源,每个回答都有对应的文档依据


八、模型微调(Fine-tuning)

8.1 何时需要微调?

  • 需要模型掌握特定领域的知识或术语

  • 需要模型遵循特定的输出格式或风格

  • RAG + 微调的组合往往能取得最佳效果

8.2 微调方法对比

方法 参数量 显存需求 效果
Full Fine-tuning 100% 极高(7B 需 80GB+) 最佳
LoRA 0.1%~1% 极低(4-20MB) 接近全参微调
QLoRA 0.1%~1% 更低(7B 仅需 24GB) LoRA 的约 90%
Adapter / Prefix Tuning / P-Tuning v2 少量参数 中等

8.3 续训(Continued Training)

对于全新领域的知识(如法律、医学),需要在预训练基础上用领域语料 继续训练,数据量通常为 GB~TB 级别。策略上可以结合 SFT 和 RAG 形成完整方案。


九、AI Agent

9.1 什么是 Agent?

OpenAI 在 2023 年 6 月提出 LLM Agent 概念——让大模型不仅能“说话”,还能 主动使用工具、规划和执行任务

9.2 Function Call(函数调用)

Agent 的核心能力之一。模型不再只输出文本,而是输出一个结构化的 函数调用指令,由外部系统执行后返回结果,模型再基于结果继续推理。

以 DeepSeek API 为例的 Function Call 流程:

用户: "北京今天天气怎么样?"
   │
   ▼
模型返回: tool_call → get_weather(city="北京")
   │
   ▼
外部系统执行 → 返回 {"temp": "2°C", "wind": "3级"}
   │
   ▼
模型基于天气信息生成最终回复

9.3 MCP(Model Context Protocol)

MCP 由 Anthropic 于 2024 年 11 月推出,被称为 AI 界的 USB-C 接口。它标准化了模型与外部工具 / 数据源的连接方式:

  • Resources(资源):结构化数据

  • Prompts(提示):预定义的交互模板

  • Tools(工具):可执行的操作

相比 Function Call,MCP 的优势在于标准化和生态化——社区已有 8000+ 个 MCP Server,覆盖搜索引擎、数据库、文件系统等各类外部能力。

9.4 Agent 开发框架

  • Dify / Coze:低代码 / 无代码 Agent 构建平台

  • LangChain / LangGraph:Python 生态的 Agent 编排框架

  • 更多平台如讯飞 Agent 等也在快速发展中


十、核心挑战与展望

10.1 幻觉问题(Hallucination)

大模型会“一本正经地胡说八道”,这是目前最核心的挑战之一。缓解策略:

  1. 使用更强的基座模型

  2. 高质量的训练数据和严格的 RLHF 对齐

  3. RAG 提供事实锚定

  4. 在 Prompt 中明确要求模型“不确定时请说明”

10.2 AIGC → AGI

  • AIGC(AI Generated Content):当前阶段,AI 生成文本、图像、视频等内容

  • AGI(Artificial General Intelligence):终极目标,具备与人类同等乃至更强的通用智能能力。Agent 被视为通向 AGI 的关键路径。


写在最后

大模型技术体系庞大而精深,从底层的 Transformer 架构、GPU 集群训练,到上层的 Prompt Engineering、RAG、Agent 应用,构成了一个完整的技术栈。无论你是开发者、产品经理还是技术决策者,理解这张全景图都有助于在 AI 浪潮中找准自己的定位。

一句话总结:大模型 = 海量数据 × 超大规模参数 × Transformer 架构 × 人类对齐,而 RAG、微调和 Agent 则是让它真正落地产生价值的 “最后一公里”。


本文基于《大模型技术之大模型概述》整理编写,部分案例和表述有补充和扩展。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐