Nemotron 3 Super 后训练全流程解析:面向智能体能力的多阶段对齐体系

摘要

Nemotron 3 Super 作为 NVIDIA 推出的 Mamba+LatentMoE 混合架构千亿级大模型,除了创新的模型架构与低精度预训练方案外,其后训练流水线是模型具备长链路工具调用、软件工程、终端交互等高阶智能体能力的核心支撑。本文基于官方技术报告,完整拆解该模型从监督微调、多阶段强化学习到专项修复的全后训练流程,梳理各阶段目标、数据设计、算法选型与工程实现方案,为同类智能体大模型的对齐训练提供可落地的参考范式。

一、整体后训练架构总览

Nemotron 3 Super 延续并升级了 Nemotron 3 系列的后训练框架,整体围绕智能体能力强化为核心设计,整套流程分为四大核心环节:双阶段监督微调(SFT)、三轮递进式强化学习(RLVR → SWE-RL → RLHF)、MTP 多头预测专项修复训练。
全流程累计使用超百亿级训练 Token,配套大规模异步强化学习集群与多样化任务环境,同时针对长轨迹交互、代码工程、人类偏好等不同场景做定制化优化,最终实现模型在指令跟随、多步工具调用、真实软件工程、终端操作等场景的能力跃升。
在这里插入图片描述

整套流程存在严格执行顺序,不可颠倒:先通过 SFT 完成基础指令与智能行为对齐,再借助分层 RL 深度优化专项能力与人类偏好,最后修复强化学习带来的 MTP 能力退化,保障推理加速特性不丢失。

二、双阶段监督微调(SFT):解决长短输出能力失衡

单一阶段监督微调容易出现“模型偏好长文本输出、短指令响应能力退化”的问题,因此 Nemotron 3 Super 创新性采用双阶段损失函数设计,结合差异化序列长度与训练配置,兼顾复杂长任务与常规指令场景。

2.1 阶段一:全局Token级损失训练

本阶段以强化长文本推理、多步复杂任务能力为目标,采用全局Token平均损失。计算逻辑为对批次内所有对话的输出Token损失做整体平均,引导模型学习超长上下文、复杂逻辑、多轮交互等能力。
训练配置:序列打包长度 256K Token,全局批次大小 64,固定学习率 1e-5,并设置 3 万样本的学习率预热。训练过程中保留 MTP 多头预测分支,MTP 辅助损失系数维持 0.3,保证多Token预测能力持续生效。

2.2 阶段二:样本级损失训练

为修复长输出带来的短指令能力衰减,第二阶段切换为单对话归一损失:先对单条对话的所有输出损失取平均,再在批次内做全局平均。该设计弱化长输出样本对整体损失的主导作用,平衡长短任务的训练权重。
训练配置升级为 512K 超长序列打包,纳入海量长上下文样本,批次大小调整为 32,学习率保持不变。

2.3 SFT 数据集与推理模式设计

数据集方面,团队大幅扩充智能体相关训练数据,覆盖软件工程、终端命令行交互、通用工具调用、长文档多跳推理、金融分析、SQL 查询、多语言翻译、安全对齐等十余类场景,同时复用并迭代前代模型的对话、形式证明类数据。
针对线上多样化部署需求,模型在 SFT 阶段预置三种推理模式

  1. 标准推理模式:完整输出思考链路,主打高精度;
  2. 低开销推理模式:精简推理步骤,平衡精度与延迟,该类样本占总数据 2%;
  3. 无推理模式:直接输出答案,追求极致吞吐,样本占比 3%。
2.4 智能体专项数据构建

为适配 CLI 终端、代码工程等长轨迹智能任务,NVIDIA 搭建完整合成与轨迹采集流水线:基于动作分类生成终端任务、依托真实 GitHub 问题构建软件工程样本、借助知识图谱生成搜索交互数据,并通过大模型蒸馏、轨迹过滤、格式归一化等手段,产出百万级高质量工具调用样本,为模型智能体行为打下基础。
在这里插入图片描述

三、多阶段强化学习(RL):分层优化专项能力

完成 SFT 基础对齐后,模型进入三阶强化学习流程,采用分场景训练策略:通用多环境优化、软件工程专项训练、人类偏好对齐,同时搭配异步训练架构与创新算法,解决长轨迹任务训练成本高、域外能力退化等行业痛点。

3.1 第一阶段:多环境验证奖励学习(RLVR)

作为强化学习核心主阶段,该阶段整合 21 大类、37 套差异化任务环境,涵盖数学、代码、科学、安全、长上下文、工具调用等全场景,采用混合环境联合训练,避免单任务训练导致模型整体能力退化。
训练采用课程学习策略,过滤 SFT 阶段模型已完全答对的简单样本,聚焦中高难度任务。同时纳入低开销推理样本,初期占比 2%(数学、编码类任务),后期缩减至 1%,在训练模型核心能力的同时,持续优化轻量化推理行为。
工程上采用异步 GRPO 算法,将样本生成与参数更新解耦,支持千卡 GPU 集群大规模训练,允许权重热更新,大幅提升集群利用率。

3.2 第二阶段:软件工程专项强化(SWE-RL)

代码类任务交互链路长、单样本执行耗时久,若与通用任务混合训练会拖慢整体吞吐,因此单独拆分出 SWE-RL 专项阶段。
该阶段基于 Apptainer 容器构建隔离沙箱,复刻 OpenHands、OpenCode、Codex 三类主流代码智能体运行环境,以 GitHub 真实 Issue 修复、代码补丁生成为训练目标,将单元测试通过率作为二值奖励信号,定向强化模型工程代码能力。同时配套内存守护、危险命令拦截等防护机制,保障容器集群稳定运行。

3.3 第三阶段:人类偏好对齐(RLHF)

依托专门训练的 GenRM 奖励模型开展 RLHF 训练,奖励模型基于千亿级基座模型初始化,融合 Helpsteer3、人工偏好、安全合规类数据集。该阶段聚焦优化对话流畅度、指令遵循能力、价值观与安全对齐,打磨模型面向人类交互的综合体验。

3.4 核心算法:PivotRL 支点强化学习

针对终端、工具调用、代码等长轨迹智能任务,团队采用 PivotRL 算法。该算法复用 SFT 阶段离线优质轨迹,仅对交互流程中的**关键决策节点(支点)**做强化学习,无需对整条轨迹做全量优化。在大幅降低训练算力开销的同时,有效规避纯 RL 训练带来的域外能力退化问题,是长链路智能体训练的核心创新。

四、MTP 专项修复训练(MTP Healing)

MTP 多头预测是模型原生投机解码、提升推理吞吐的核心能力,但经过多轮 RL 训练后,模型主干网络特征分布发生偏移,会导致 MTP 预测精度、草稿通过率下降。
为此在 RL 全部结束后增设独立修复阶段:冻结模型主干所有层,仅微调 2 层共享权重的 MTP 预测头。训练数据复用 RLVR 阶段的提示词,损失函数沿用预训练与 SFT 阶段的 NLL+MTP 组合损失(系数 0.3),总训练 Token 为 180 亿。
该阶段在不改动智能体、对话等核心能力的前提下,恢复 MTP 解码性能,让模型推理加速能力回归最优水平。

五、总结

Nemotron 3 Super 的后训练体系形成了**“双阶段SFT打底 + 分层RL深耕 + 专项修复兜底”的完整闭环。通过分层损失解决长短输出矛盾、多环境RL保障全场景能力、专项RL攻克代码工程难点、PivotRL降低长轨迹训练成本,再搭配MTP修复保障推理效率。
整套方案充分结合数据设计、算法创新与工程优化,为大模型向
实用型智能体**演进提供了成熟的工业化训练范式,尤其适合MoE+Mamba混合架构、主打工具调用与长上下文的大模型团队参考落地。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐