SFT、RLHF、DPO、RL 的区别与选择
RAG解决外部知识进入上下文的问题,微调解决模型行为模式被参数吸收的问题。
SFT,全称是 Supervised Fine-Tuning,监督微调。一句话解释:SFT 就是给模型看“输入应该怎么对应输出”的高质量示范,让模型模仿这种回答方式。
RLHF,全称 Reinforcement Learning from Human Feedback,基于人类反馈的强化学习。一句话解释:RLHF 不是给模型一个标准答案,而是告诉模型:多个候选答案里,人类更喜欢哪一个。
DPO,全称 Direct Preference Optimization,直接偏好优化。一句话解释:DPO 直接用“好回答 vs 差回答”的偏好对训练模型,让模型更倾向于好回答,不再单独训练 Reward Model,也不走复杂 PPO 流程。
RLHF 先把人类偏好学成 Reward Model,再通过 PPO 优化模型;DPO 直接从偏好对更新模型。两者都依赖偏好数据,区别在于中间有没有单独的奖励模型和强化学习阶段。
RL 是让模型在环境里做动作,环境给奖励,模型学会让长期奖励更高。它不一定要人类偏好。只要 reward 能定义,就可以有 RL。
总结:SFT 本质是监督微调,适合让模型学习高质量示范。它更适合固定输出格式、固定任务流程、工具调用范式、行业话术和小模型蒸馏,不适合把频繁变化的业务知识硬塞进模型。动态知识优先用 RAG 或工具查询。
RLHF 解决的是偏好对齐问题。它不是给模型唯一标准答案,而是通过人类偏好让模型知道多个候选答案里哪个更符合人类或业务偏好。传统流程通常会训练 Reward Model,再用 PPO 这类强化学习算法优化模型。DPO 也是偏好优化,但工程路径更轻。它直接用 chosen/rejected 这种偏好对训练模型,省掉单独训练 Reward Model 和 PPO 的复杂流程。所以如果团队已经有高质量偏好数据,优先考虑 DPO,而不是一上来做完整 RLHF。
更广义的 RL 只有在 reward 清楚时才值得做,比如代码单测、数学答案、Agent 工具调用成功率、任务完成率这类可验证目标。reward 模糊时强行上 RL,很容易训歪。
基模越来越强后,低质量垂类微调确实容易被抹平,但控行为、控偏好、控成本、控风险仍然有价值。最后是否值得做,要看评测集、线上指标、成本收益和风险指标,而不是靠主观感觉。”
GPT核心四步骤
1.预训练阶段
模型初始学习人类语言和知识
- 使用纯文字段落数据
- 通过预测下一个字学习
- 计算段落联合概率评估学习效果
2.有监督微调(SFT)
训练模型执行具体任务
- 使用人工撰写的一问一答数据
- 学习对话、分类等任务能力
- 数据量级远小于预训练
3.奖励模型训练
创建评估回答质量的"教练"模型
- 基于人类标注的偏好数据
- 学习给不同回答打分
- 用于指导强化学习
4.强化学习(PPO)
优化模型回答质量
- 模型生成多种回答方案
- 奖励模型提供反馈评分
- 通过迭代提高回答质量
Post-Training 是个上位概念,指的是 SFT 之后所有继续提升模型质量的训练阶段。
它不是一个单一方法,而是一族方法的总称。SFT 让模型学会「按指令格式回答」,但 SFT 后的模型还有两个问题没解决。第一,回答可能有害、不符合人类价值观;第二,同一个问题的多种合格回答里,模型不知道哪个更受人类欢迎。这就是 Post-Training 要补的课。
主流的 Post-Training 方法有五大类。
RLHF(Reinforcement Learning from Human Feedback) 是最经典的方案。流程是先用人类对回答的排名训练一个奖励模型,再用 PPO 算法让大模型生成的回答尽量得高分。同时维护一个参考模型用 KL 散度约束,防止主模型「钻空子」。优点是效果上限高,缺点是流程复杂、要同时维护 4 个模型、训练不稳定。
DPO(Direct Preference Optimization) 是 RLHF 的简化版。核心洞见是 RLHF 的优化目标可以推导成一个等价的监督学习损失,绕过显式奖励模型,直接拿(提示,好回答,差回答)三元组训练。优点是只需 2 个模型、训练稳定、实现简单。缺点是效果上限依赖偏好数据质量,探索能力不如精心调过的 RL。很多开源 Instruct 模型会用 DPO 或 DPO 的变体做偏好对齐,但不能把 Llama 2-Chat 也说成 DPO 路线,它公开论文里的关键对齐方法是拒绝采样和 PPO/RLHF。GRPO(Group Relative Policy Optimization) 是 DeepSeek 在 2024 年提出的 PPO 改进版。核心思路是砍掉 PPO 的 Value Model,改用「同一问题采样 G 个回答、用组内相对排名作为基线」估计优势函数。这样省掉 Value Model 的训练成本,显存减半。DeepSeek R1、DeepSeek-Math、Qwen 系列推理模型都用 GRPO,是 2026 年最热的对齐方案。
拒绝采样(Rejection Sampling Fine-tuning) 是个简单粗暴的方法。让模型对每个 Prompt 生成多个回答,用奖励模型筛出高分的,然后再做一轮 SFT。流程上没有 RL,就是「生成 -> 筛选 -> 再 SFT」循环。Llama 2 的对齐流程里就用了这个。
RLAIF(Reinforcement Learning from AI Feedback) 是用强 AI 模型代替人类标注偏好。Anthropic 的 Constitutional AI、Google 的相关工作里都有 RLAIF 的影子。优点是可以批量生成偏好数据、标注成本低,缺点是依赖一个更强的「教师 AI」。最关键的认知是这五类方法不是互相替代,真实的对齐流程通常是组合使用的。比如 Llama 2-Chat 公开流程里用了 SFT、拒绝采样和 PPO/RLHF;DeepSeek R1 用了「SFT 冷启动 + GRPO 多轮迭代 + 拒绝采样筛数据」这一类组合路线。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)