大模型是怎么训练出来的
文章详细介绍了大模型(LLM)训练的三级跳过程:首先通过预训练,让模型在海量无标注文本中学习词向量、语法语序和常识;接着进行有监督微调(SFT),让模型学会识别人类指令、角色定位和按格式输出;最后通过强化学习(RLHF)或直接偏好优化(DPO)进行偏好对齐,进一步提升模型逻辑性、安全性和对齐人类偏好。全文以生动的比喻和清晰的流程图,帮助读者轻松理解大模型训练的精髓。
大模型训练三级跳
预训练 → 有监督微调 → 偏好对齐
LLMRLHFDPO
1预训练(Pre-training)
海量无标注文本,自回归预测,学好词向量、语法语序、通识常识
2有监督微调(SFT)
人工整理问答数据,学会识别人类指令、角色定位、按格式输出
3偏好对齐(RLHF / DPO)
择优提纯、压制幻觉、逻辑对齐、安全对齐
壹 · 预训练
自回归预测 / 遮词预测
📚 数据用什么数据?
海量无标注通用文本:全网网页、书籍、文章、百科、新闻、小说、维基百科……
不需要人给标注、不需要给答案,纯自然语句就行
🎯 任务用什么任务练?
就一个核心任务:自回归预测 / 遮词预测
一句话挖掉几个字,让模型猜该填什么字
🎯 预训练的核心目的(4条记牢)
① 学好词向量
把一开始随机的数字,练出真实语义、词语关联、远近关系
② 学好人类语法语序
学会主谓宾、句式、怎么通顺说话,不胡言乱语
③ 灌入全网通识常识
地理、历史、科学、生活常识、逻辑因果,全都默默学进参数里
④ 把 Transformer 所有参数练到位
自注意力、前馈、层归一化、残差里所有权重,从随机乱数练成能理解语言的有效参数
贰 · 有监督微调(SFT)
Supervised Fine-Tuning
💡 核心理解
预训练只会「往下接着写文字」,不会「听指令、当助手、好好回答人问题」;
有监督微调,就是把一个只会续写文章的书呆子,调教成会听话、会问答、懂礼貌的智能助手。
📊预训练完的模型是什么水平?
✅ 模型已经会:
• 懂词义、懂语法
• 懂百科常识、历史地理生活知识
• 能续写文章、接着往下造句
❌ 但有三个致命缺点:
• 只会顺着文本往后续写,不会理解「你在问我问题」
• 不懂角色:不知道自己是 AI 助手,不会礼貌回答
• 不会按指令办事:让它总结、翻译、写文案,它会乱续写
📌 打个比方
预训练完 = 一个博览群书、满腹学问的书呆子,但不会聊天、不会听话、不会按要求回答问题。
🔧有监督微调(SFT)是干什么的?
用人工精心整理好的数据:
用户提问 → [ 人类标准优质回答 ]
喂给模型学:人怎么问,助手应该怎么答,什么问题该什么语气、什么结构、什么内容
🎯 SFT的核心目的(4个)
①
学会识别人类指令 — 分得清:提问、总结、翻译、写作文、编故事……
②
学会角色定位 — 知道自己是 AI 助手,语气礼貌、不胡说、有边界
③
学会按格式、按要求输出 — 你让分点就分点、让精简就精简,不再乱续写
④
修正胡说八道、乱编逻辑 — 用人的标准答案矫正,把乱编、跑偏的地方拉回来
💭 最形象的比喻帮你记死
**预训练:**把小孩送进图书馆读万卷书,学问学满了,但不会跟人对话、不会听话办事。
**有监督微调(SFT):**专门请老师一对一教礼仪、教问答、教怎么听懂指令、怎么得体回答。
只读书不教社交,成不了 AI 助手;必须加一轮有监督微调(SFT)。
叁 · 强化学习(RLHF)
Reinforcement Learning from Human Feedback
💡 核心理解
SFT 只能做到「模仿人类好好说话、格式对、不乱答」;
但做不到「更聪明、更靠谱、更诚实、更有逻辑、更有帮到人」
强化学习用来:择优、提纯、拔高、纠正毛病、越答越好
🔄 RLHF 流程(三步)
Step 1
模型对同一个问题,生成多个不同回答
Step 2
人给回答排序打分,训出奖励模型 RM
Step 3
强化学习倒逼模型:多生成高分回答,远离低分烂回答
🏆 Reward Model(奖励模型)打分标准
✅ 逻辑好✅ 简洁真实✅ 有礼貌✅ 不瞎编✅ 帮到人
❌ 啰嗦❌ 矛盾❌ 瞎编❌ 态度差❌ 答非所问
🎯 强化学习解决的5个核心问题
① 择优提纯 — 不只模仿,专门往「最优回答」靠拢,越答越精炼
② 压制幻觉 — 把乱编的回答打成低分,模型慢慢就不敢乱编了
③ 贴合人类偏好 — 懂你要简洁、要分点、要通俗、要专业
④ 逻辑严谨 — 奖励模型偏爱逻辑通顺的,模型养成严谨表达习惯
⑤ 安全对齐 — 把有害、偏激的回答压低,学会守边界、不乱说话
肆 · DPO vs RLHF
直接偏好优化 — 一步到位的新方案
📌 RLHF(基于人类反馈的强化学习)
**SFT:**先训一个会正常回答的模型(60分)
**RM训练:**让人给不同回答打分,训出自动打分器
**PPO强化:**模型生成回答 → RM打分 → 强化学习倒逼模型
⚠️ 特点:效果强、对齐准(能到90分),但复杂、不稳定、贵、易"作弊"(为拿高分说废话)
📌 DPO(直接偏好优化)
**核心:**跳过奖励模型(RM)和强化学习,直接用「好/坏回答对」训模型
**输入:**同一问题的一对回答(y⁺ 好、y⁻ 坏)
**目标:**直接让模型提高好回答概率、降低坏回答概率(用对比损失)
✅ 简单稳定
不用调 PPO,不容易崩
✅ 省钱省卡
不用训 RM,算力减半
✅ 效果接近
能到 85–90 分,够用
❌ 灵活性弱
没法做复杂奖励
🎯 一句话说清区别
**RLHF:**像高考 + 复试 + 专家面试,层层筛选,最优但麻烦
**DPO:**像直接按标准答案对比批改,简单高效,接近最优
📋 训练流程总结
| 阶段 | 核心任务 | 数据 |
|---|---|---|
| 预训练 | 遮词预测 | 无标注文本 |
| SFT | 模仿优质回答 | 问答对 |
| RLHF/DPO | 偏好对齐 | 偏好排序 |
2026年AI行业最大的机会,毫无疑问就在应用层!
字节跳动已有7个团队全速布局Agent
大模型岗位暴增69%,年薪破百万!
腾讯、京东、百度开放招聘技术岗,80%与AI相关……
如今,超过60%的企业都在推进AI产品落地,而真正能交付项目的 大模型应用开发工程师 **,**却极度稀缺!
落地AI应用绝对不是写几个prompt,调几个API就能搞定的,企业真正需要的,是能搞定这三项核心能力的人:
✅RAG:融入外部信息,修正模型输出,给模型装靠谱大脑
✅Agent智能体:让AI自主干活,通过工具调用(Tools)环境交互,多步推理完成复杂任务。比如做智能客服等等……
✅微调:针对特定任务优化,让模型适配业务
目前,脉脉上有超过1000家企业发布大模型相关岗位,人工智能岗平均月薪7.8w!实习生日薪高达4000!远超其他行业收入水平!
技术的稀缺性,才是你「值钱」的关键!
具备AI能力的程序员,比传统开发高出不止一截!有的人早就转行AI方向,拿到百万年薪!👇🏻👇🏻

AI浪潮,正在重构程序员的核心竞争力!现在入场,仍是最佳时机!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

⭐️从大模型微调到AI Agent智能体搭建
剖析AI技术的应用场景,用实战经验落地AI技术。从GPT到最火的开源模型,让你从容面对AI技术革新!
大模型微调
-
掌握主流大模型(如DeepSeek、Qwen等)的微调技术,针对特定场景优化模型性能。
-
学习如何利用领域数据(如制造、医药、金融等)进行模型定制,提升任务准确性和效率。
RAG应用开发
- 深入理解检索增强生成(Retrieval-Augmented Generation, RAG)技术,构建高效的知识检索与生成系统。
- 应用于垂类场景(如法律文档分析、医疗诊断辅助、金融报告生成等),实现精准信息提取与内容生成。
AI Agent智能体搭建
- 学习如何设计和开发AI Agent,实现多任务协同、自主决策和复杂问题解决。
- 构建垂类场景下的智能助手(如制造业中的设备故障诊断Agent、金融领域的投资分析Agent等)。

如果你也有以下诉求:
快速链接产品/业务团队,参与前沿项目
构建技术壁垒,从竞争者中脱颖而出
避开35岁裁员危险期,顺利拿下高薪岗
迭代技术水平,延长未来20年的新职业发展!
……
那这节课你一定要来听!
因为,留给普通程序员的时间真的不多了!
立即扫码,即可免费预约
「AI技术原理 + 实战应用 + 职业发展」
「大模型应用开发实战公开课」
👇👇

👍🏻还有靠谱的内推机会+直聘权益!!
完课后赠送:大模型应用案例集、AI商业落地白皮书
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)