三万字详解,一文讲清楚Qwen系列,看这一篇就够了!
本文讲介绍qwen1/1.5,qwen2,qwen2.5,qwen3 架构/训练/部署的技术细节

1、Qwen 1 / 1.5 系列模型技术解析
qianwen-res.oss-cn-beijing.aliyuncs.com

1.1模型架构设计
通义千问(Qwen)1 系列模型采用经典的 Transformer 解码器架构,是标准的自回归大语言模型框架。在此基础上,Qwen 引入了一些改进和定制设计:
-
Transformer Decoder 架构:Qwen 是纯解码器的大模型(即 GPT 类架构),堆叠多层自注意力和前馈网络组成。这种架构善于处理生成类任务。
-
分组查询注意力(Grouped Query Attention, GQA):模型的多头注意力采用分组查询机制,共享一部分 Key/Value 头,从而降低大模型推理的显存和计算开销,提高推理效率。例如,Qwen1.5-110B 模型使用了 GQA,使得在不损失性能的前提下大幅优化了推理速度。
-
位置编码方式: Qwen 使用旋转位置编码 RoPE(Rotary Position Embedding)来引入位置信息。RoPE 在诸多大模型中已被验证有效(如 PaLM、LLaMA 等),可以使模型具备相对位置感知能力。特别地,Qwen 在实现中使用了 FP32 精度 来计算 RoPE 的频率矩阵,以确保在长上下文情况下的数值稳定性和精度。这为后续扩展上下文长度打下基础。
-
权重解耦(Untied Embeddings):与部分 Transformer 实现将词嵌入层和输出投影层权重绑定不同,Qwen 选择了解耦的词表嵌入设计,即输入嵌入矩阵和输出投影矩阵分开,不共享参数。实验发现这可以提升模型效果,但代价是略增内存消耗。
-
去 Bias 处理:受 PaLM 等模型经验影响,Qwen 去除了大部分线性层中的偏置项,以简化模型和提高训练稳定性。但有所不同的是,在注意力层的 Q、K、V 投影中保留了偏置。研究表明,在 QKV 添加偏置有助于增强模型长上下文外推能力(即在上下文长度超出训练范围时保持稳定的注意力分布)。
-
预归一化与 RMSNorm:Qwen 采用 Pre-Norm 架构,即在每个子层(注意力或前馈)之前执行归一化。归一化层则使用 RMSNorm 而非传统 LayerNorm。RMSNorm通过仅使用均方根统计量归一化向量,提高了运行效率,并且经验证性能与 LayerNorm 相当。Pre-Norm 的使用结合 RMSNorm,有利于提升深层网络的训练稳定性。
-
激活函数与前馈结构:Qwen 的前馈网络激活函数采用 SwiGLU。SwiGLU 是 Swish 与门控线性单元 (GLU) 的结合,近期在 PaLM 等模型中被证明效果优于传统的 GeLU 等激活函数。同时,Qwen 将前馈层隐藏单元维度从传统的4倍隐藏规模缩减为约3倍,以配合GLU的门控机制减少参数量,但性能无明显损失。
-
上下文长度扩展机制:针对长上下文需求,Qwen 的架构特别融入了长序列支持机制。虽然预训练时上下文长度通常为2048(部分新版小模型已扩展至8192),但 Qwen 在推理阶段通过无需重新训练的技巧实现了长上下文扩展。具体来说,Qwen结合了 NTK 插值方法和窗口化注意力策略:
-
利用 NTK-aware缩放插值 技术,对位置编码进行缩放插值,以减缓长距离位置上高频信息随长度增加而衰减的问题。动态的 NTK 插值会根据不同段落(chunk)自适应调整缩放比例,避免上下文特别长时性能急剧下降。
-
引入LogN Scaling 以及 分层窗口注意力策略,模拟长序列Transformer。如在底层层采用较小窗口限制注意力范围,在高层则逐渐增大窗口直至全局注意力。通过对低层和高层使用不同的注意力窗口,模型在不增加计算量的情况下掌握长程依赖,同时确保训练稳定。
😎得益于上述设计,Qwen1.5 全系列模型均支持最长 32768 个 token 的上下文(32K tokens,相比常规模型的2K或4K长度有数量级提升),在处理长文档时具备显著优势。此外,还有专门的超长版本 Qwen-Long,可将上下文扩展到百万级别,通过检索式分块实现更长上下文处理(此为产品化的拓展)。总的来说,Qwen 架构在保持 Transformer 主干的同时,通过RoPE位置编码、预归一化、RMSNorm、SwiGLU激活等当前先进配置,并辅以针对长上下文和高效推理的创新(如GQA和NTK插值),打造了性能与效率兼顾的模型架构。
1.2 模型规模与参数配置
阿里云针对不同应用场景,发布了 Qwen1 系列的大模型家族,涵盖多种参数规模:

- Qwen1.0 系列(初代发布)包括约 7B(70亿)参数和 14B(140亿)参数两个主力模型,以及一个小模型 1.8B(18亿)。其中 Qwen-7B 和 Qwen-14B 是基础模型版本,分别还有对齐人类指令的聊天版本 Qwen-7B-Chat 和 Qwen-14B-Chat。1.8B 模型则作为轻量级模型,同样提供 Base 和 Chat 版本供社区试验使用。这些模型的层数和隐藏维度随参数规模增加:例如 Qwen-7B 大约使用了 32 层 Transformer、每层隐藏尺寸4096、注意力头数32;Qwen-14B 使用40层、隐藏尺寸5120、注意力头数40;而 Qwen-1.8B 使用24层、隐藏2048、注意力头数16。所有模型的注意力头维度均为128,使架构在不同规模上保持一致的相对维度配置。
- Qwen1.5 系列(进阶改进版)在1.0基础上进一步丰富了模型规模,从 0.5B(5亿) 超小参数模型到 72B(720亿) 超大模型,共覆盖 0.5B、1.8B、4B、7B、14B、72B 六种规模。每种规模皆提供基础 Base 模型和对话 Chat 模型,以满足不同算力和应用需求。尤其值得一提的是,Qwen1.5 新增了0.5B微型模型,方便边缘设备或移动端部署;同时上新了72B巨模型,在复杂任务上获得更强性能。Qwen-72B 是该系列中预训练规模最大的模型之一,其参数量达到 LLaMA2-70B 级别,但通过更多训练数据和优化实现了更高的基准表现。在 Qwen1.5 后续更新中(2024年初),阿里还开源了首个千亿级模型 Qwen1.5-110B,参数规模达到 1100 亿,这是 Qwen 系列首度迈过千亿门槛。110B 模型在零样本/N-shot任务和对话能力上均进一步提升,在部分评测中可比肩甚至超越同时期Meta的70B级模型。
各规模模型的具体参数配置(层数、隐藏维度、注意力头等)随公开技术报告释出【上图】。例如,Qwen-7B 为32层Transformer、隐藏维度4096,Qwen-14B为40层5120维,Qwen-72B则更深更宽(模型报告称其也采用了基于128维/头的配置)。所有模型均采用了相同的架构优化(RoPE、RMSNorm等)。需要注意的是,随着参数规模增长,Qwen 模型的上下文长度支持也有所扩展:早期7B/14B模型训练时上下文长2048,后续新版通过额外训练和插值技术扩展到8192;而Qwen1.5系列全规模均宣布支持到32K长度(通过前述架构扩展方案实现)。这种一致的长文本支持在大小模型上都具备,体现了架构设计的可扩展性。
总结来说,Qwen1 系列提供了从5亿到千亿级的完整参数谱系,在模型深度和宽度上与主流开源模型接轨,并通过系列化的 Base/Chat 版本方便用户根据算力和应用选择合适的模型。这种多尺寸布局满足了不同场景对模型能力和资源的平衡需求。
1.3训练数据
海量高质量语料是通义千问系列性能突出的重要基础。根据阿里云官方报告,Qwen 模型使用了高达 3 万亿(3 trillion)tokens 的超大规模训练语料库。这一数据规模在开源模型中处于领先地位(例如 LLaMA2-70B 使用约2万亿tokens),为模型的知识储备和多样性提供了保证。
数据来源与构成方面,Qwen 的预训练语料非常多元,覆盖了广泛的领域和语言类型:
- 通用网络文本:大量爬取的互联网文本语料,经过严格的质量过滤。这包括百科、新闻、论坛问答、社交媒体等各类中文和英文网页内容,保证模型对开放域知识的覆盖。
- 专业书籍文档:一批专业领域的电子书、文档资料,用于增强模型在法律、医学、金融、科技等专门领域的知识和语调。高质量的书本内容提供了比网络文本更权威详实的信息来源。
- 代码数据:Qwen 语料中特别加入了 代码 数据,包括多种编程语言的源代码仓库、编程问答等。这使模型具备一定的编程理解和生成能力,为后来推出的代码专版模型(Code-Qwen)打下基础。训练中还对数字和代码片段做了特殊处理,例如将长数字拆分为单个数字Token等。
- 数学与公式:数据中包含数学领域的文本,如Math教程、公式证明、竞赛题解等,以及模型生成数学推理需要的格式数据。这使得模型在数学推算、公式格式化方面有更好的表现,相对于纯通用语料训练的模型是一大优势。
- 多语言语料:通义千问强调中英双语并重,尤其注重中文能力,同时扩展支持多达 27 种语言。除中英文外,训练数据中涵盖了法语、西班牙语、德语、俄语、日语、韩语、越南语、阿拉伯语、泰语、土耳其语、意大利语等主要语种。为了兼顾多语言,Qwen 团队通过大量实验优化了不同语种数据在总语料中的比例。中文和英文仍占主要份额(据称“当前以中文和英文为主”),但也确保模型对其他语种有基本的理解和生成能力,不至于出现词表未涵盖或编码效率低的问题。事实上,Qwen 使用了一个超大词表来支持多语言(下文详述),保证了非中英语言的词汇不会被过度切分,从而提高多语言的表示效率。
- 数据清洗与预处理:阿里云团队对语料进行了严格的质量控制。例如过滤低质量、重复、违禁内容;对文本进行分句、去除乱码和HTML标签等清洗;对中英文进行平衡采样等。同时,他们通过大量对比实验优化了训练语料的分布。这意味着在3万亿Token的规模下,不同来源、不同语言的数据占比是精心调优的,既让模型广泛涉猎知识,又避免某类数据过多导致的偏差或过拟合。这种数据配比的优化在技术报告中有所提及,说明了数据工程在大模型训练中的重要性。
分词与词表:为了高效利用上述多语种数据,Qwen 定制了自己的 Tokenizer。其词表大小约为 152K(十五万)词元。相比大多数开源模型常用的3万~5万词表(往往只针对中英),Qwen的词表要大得多。这一设计有以下考虑:
- 对于中文,Qwen词表中不仅包括常用汉字,还收录了一些高频词汇(短词)。传统BPE对中文常以字为基本单元,而15万词表允许模型直接使用一些中文常用词作为Token,从而减少中文文本长度,提高生成效率。
- 对于英文及其他拉丁语系语言,词表容量充足意味着可以覆盖更多的完整单词或短语,而不必切分为过多子词。这样处理英文时的token效率与英文专用模型相当。
- 对于多语种,152K的词表可以囊括许多小语种的基础词汇和字符集(如西文变音字符、阿拉伯字母等),显著降低它们的词分割粒度。实践表明,Qwen 在多种语言上的压缩率(平均每个字/词对应的token数量)都很高,即 同样一句话,Qwen 编码所需的 token 数往往更少。这不仅提升了训练和推理效率,也意味着模型具备更强的多语言扩展性。
总体而言,Qwen 的训练数据既“广”且“精”——拥有海量规模涵盖百科到代码的广泛知识,又通过精细清理和词表优化保证了数据质量和多语言支持。这为模型提供了坚实的语料基础,使其在各类下游任务中都能有出色表现。据介绍,Qwen-7B等模型在常识问答、专业知识、代码理解、数学推理等基准上,相比同规模开源模型显著超越。可以说,大规模高质量的训练语料是 Qwen 系列能够“底盘扎实”的关键原因。
1.4训练方法与策略
预训练阶段:Qwen 模型的预训练采用传统的自回归语言模型目标(Auto-regressive LM)。也就是给定前文预测下一个token的标准方法,与 GPT 等模型一致。训练过程中并没有使用额外的自监督任务(如填空、排序等),而是专注于next-token预测这一单一目标,从而让模型充分学习大规模语料的统计规律和语义关联。
在优化算法上,Qwen 使用 AdamW 优化器 (β1=0.9, β2=0.95) 并配合 余弦退火学习率调度。训练采用混合精度(BFloat16)以平衡效率和稳定性。此外,通过Flash Attention等高效算子加速注意力计算,并利用深度并行技术(如张量模型并行、流水线并行)在多卡集群上训练超大模型。这使得像72B、110B这样规模的模型在阿里云强大的计算集群支持下完成了预训练。训练batch累积达到数百万tokens(报告中提到4M tokens每步的全局Batch),这意味着在2048序列长度下,每步并行处理约2000条样本,充分利用了算力资源。
有监督微调 (SFT):在得到预训练的Base模型后,阿里云团队进行了监督微调,以使模型能够更好地遵循指令、进行对话。这一步通常是构造一批高质量的指令-回答示例数据进行微调。据报道,阿里收集并标注了多种风格、多轮次的对话数据,以及角色扮演、工具使用等场景的数据。特别地,考虑到中英文及多模态需求,SFT 数据涵盖了中英双语的指令,还有助于模型理解图片/代码等说明(比如 Qwen-VL、Code-Qwen 等衍生模型会用到的指令)。由于公众开源的中文多轮对话数据相对有限,阿里团队应当投入了人工标注来补足这一部分。此外,他们非常重视安全相关的指令微调:针对可能的有害内容(暴力、色情、歧视等),专门标注了这类请求及拒绝回答的范例数据,以训练模型在遇到不当请求时能礼貌拒绝或给出安全提示。通过SFT,得到的 Qwen-Chat 模型在遵从用户指令、控制回答风格和内容安全上比基座模型有大幅提升。
对齐与强化学习 (RLHF):Qwen-Chat 模型进一步采用了 人类反馈强化学习 来优化回答的质量和对齐人意程度。具体流程与 OpenAI 的 InstructGPT / ChatGPT 类似,包括训练一个奖励模型来评分模型输出,然后使用 PPO(近端策略优化) 算法微调语言模型策略。技术报告中显示,他们训练了一个 Qwen-RM(Reward Model)用于评判对话回答的好坏,并通过与人类偏好数据对比训练,使RM能近似模拟多数人偏好。接着,以预训练模型为初始策略、SFT模型输出为参考,通过 PPO 优化语言模型,使其生成的回答能够获得更高的奖励模型评分,即更符合人类偏好。人类评估结果表明,引入 RLHF 后的 Qwen-Chat 相比仅SFT的版本输出质量明显提升,在对话自然度、有用性方面更接近人类期望。阿里的实验显示,Qwen-14B-Chat (RLHF) 在复杂对话中的表现仅略逊于 GPT-4,优于没有RLHF的模型许多。
值得一提的是,在 Qwen1.5 系列中,**团队还探索了新的对齐算法DPO(直接偏好优化)。**DPO是一种不通过显式奖励模型、直接优化策略以匹配人类偏好的方法,可视为RLHF的变体。官方介绍中提到 Qwen1.5 采用了 DPO 和 PPO 相结合的技术来增强模型对人类偏好的对齐度。这意味着除了常规的PPO训练,他们可能尝试用DPO损失直接优化SFT模型,使其输出排序更符合人类排名。这在学术上是一个新兴方向,阿里将其引入实际大模型训练,体现了前沿性。通过综合这些对齐手段,Qwen-Chat 模型在 遵循指令、内容安全 和 用户偏好 等方面达到业界先进水平。它不仅能准确回答问题,还学会了在不当请求时拒答,在需要一步步推理或工具查询时按合理步骤执行,这些都是人类偏好对齐训练带来的能力。
蒸馏与小模型训练:对于Qwen系列的小参数模型(如0.5B、1.8B),虽然主要也是通过预训练获得,但推测阿里可能采用了一些知识蒸馏或迁移学习策略来提升其效果。公开信息中未明确提及蒸馏过程,但社区有相关探索。例如,有技术爱好者使用更大的Qwen模型生成数据,再微调小模型,以提高小模型的性能。官方则更多是通过同样的大规模数据直接训练小模型,并适当增加训练轮次来弥补容量不足。从结果看,Qwen-1.8B 在多个任务上已经超越同期同规模模型,甚至某些指标上接近于更大模型。这说明阿里在小模型训练上也下了功夫,可能通过更长训练、调节正则等方法,以及得益于大词表带来的效率,使得小模型也拥有不俗实力。
总之,Qwen1 系列在训练方法上遵循“大规模预训练+对齐微调”的范式,充分利用 SFT 和 RLHF 来提升模型实用性和安全性。同时,灵活运用了前沿的优化策略(如 DPO)和工程技巧(如 FlashAttention、混合精度)来在实际算力下训练超大模型。多管齐下的训练策略造就了 Qwen 模型在性能和对齐上的全面领先。
1.5 推理与部署优化技术
阿里云在 Qwen 模型的推理部署上亦提供了多项优化手段,旨在降低使用门槛、提高运行效率:
- 高效分词器设计:前文提到,Qwen 采用了约152k规模的大词表。这在推理阶段的直接效果是单词平均 token 数更少,等于减少了需要处理的序列长度。例如,同样一段中文或法文文本,Qwen 切分出的 Token 数比使用常规词表的模型少很多。因此,在生成同样内容时,Qwen 实际处理的步数更少,推理速度相对更快。此外,大词表也降低了罕见词被拆分的几率,提高生成的连贯性。这些都属于“以空间换时间”的优化——虽然词表大幅增加了embedding层参数和显存占用,但换来了推理效率和多语言性能的提升。
- 缓存与长上下文推理:Qwen 在解码生成时充分利用了 KV Cache(键值缓存)技术。也就是对于每一步生成,将Transformer每层的 Key/Value 隐状态缓存下来,下一步生成时重复利用,而不必每次重新计算前序token的注意力。这是Transformer加速的常规手段,Qwen 的实现中对此进行了优化,使其在长上下文(如上万token)情况下仍能高效读取缓存、计算增量推理。而且,正如官方指出的,Qwen 还支持KV缓存的量化存储。也就是说,将缓存的张量用更低精度(如 int8)表示,以减少超长对话时内存占用和带宽开销。这对32K这样长度的推理非常有帮助。通过缓存量化,长上下文推理既保证速度又缓解了显存压力。
- 模型量化支持:为了方便不同设备部署,Qwen 官方提供了多种模型量化版本。包括 8比特 (Int8) 量化和 4比特 (Int4) 量化的权重文件。量化模型极大降低了显存占用:据介绍,Qwen-1.8B 的 Int4 模型推理显存需求不到2GB,生成2048 token的过程中峰值也仅约3GB。如此一来,即使消费级显卡乃至部分CPU设备也能运行小模型。即便是中大型的Qwen-7B、14B,使用8bit量化后在单卡16GB显存上即可跑通7B推理,在多卡上也能负担14B。这为社区用户大幅降低了使用门槛。值得强调的是,Qwen 提供的量化采用了先进的 GPTQ 算法等,能在尽可能降低精度损失的同时将权重压缩。实际基准测试表明,Qwen-7B 4bit量化模型在大多数任务上与全精度模型只有微小差距,却将推理速度提高了近一倍。这种性能/效率比令人印象深刻。
- 并行和分布式支持:对于超大模型(如72B、110B),Qwen 提供了完备的并行推理支持。在多GPU环境下,可以通过 张量并行(Tensor Parallelism)将模型权重按张量维度切分到多卡计算;结合 流水线并行 将不同层分配到不同卡顺序执行,从而实现多卡协同推理。这套并行机制源自Megatron-LM等开源框架,阿里云在其代码中集成了这些能力,使得部署 70B+ 模型成为可能。此外,Qwen 兼容一些高性能推理引擎,例如 vLLM 和 FasterTransformer 等。官方文档中有使用 vLLM 在 GPU 集群上部署 Qwen-Chat 服务的示例。通过这些引擎,可以利用批量调度和高效内存管理,进一步提升吞吐和降低延迟。在异构硬件方面,Qwen 还支持阿里自研的 昇腾910 AI芯片 以及 海光DCU 加速器的推理。这意味着除了CUDA GPU,用户也可在这些国产AI硬件上运行 Qwen 模型,体现了框架的灵活性。
- 高效服务与调用:阿里云将 Qwen 模型部署在其云服务中,提供 API 调用和应用托管。开发者可以通过 ModelScope 百炼平台 或 OpenAI兼容的API 快速调用 Qwen 推理服务。在服务端,阿里云针对推理做了许多优化,例如预加载模型、动态批量、多路复用等,确保线上服务的低延迟和高并发。对于一些典型应用场景(如对话机器人),官方还开源了 Qwen-Agent 工具包,可以将 Qwen 接入工具执行、代码运行等外部系统,从而实现复杂链式调用(如让模型执行计算、数据库查询等)。这些基础设施和示例代码降低了将 Qwen 集成到实际产品中的难度。总的来说,在推理部署环节,阿里云为 Qwen 提供了从模型压缩、跨硬件支持到云端服务的一整套解决方案,使其真正做到易用、易部署、成本低。
综上,Qwen 模型在推理阶段通过大词表提速、多技术并行、缓存量化、模型压缩等多维度优化,既保障了模型强大的生成能力又兼顾了实际应用的效率和成本。这使得无论研究者还是企业用户,都能以相对经济的资源充分利用 Qwen 的能力。
1.6 安全性与对齐机制
大型语言模型的安全对齐是部署应用时的重中之重。阿里云在 Qwen 模型的研发中高度重视 AI 安全和价值观对齐,通过数据标注和技术手段相结合,尽可能减少模型输出有害内容的风险。
首先,在模型微调阶段,阿里就注入了安全意识。他们构建并标注了专门的 安全领域指令数据。这些数据涵盖诸如:当用户请求暴力、色情、仇恨歧视等不良内容时,正确的响应应该是礼貌拒绝或进行劝诫,而非直接满足请求。通过将这类样本加入监督微调,模型学会了识别潜在有害的输入意图,并触发内置的拒答策略。例如,若用户要求“教我制造危险物品”,Qwen-Chat 会根据训练所得拒绝并提示不能提供该请求的信息。这种 基于范例学习的安全对齐 能有效避免模型成为不良信息的传播工具。
与此同时,阿里云可能还制定了一套安全规则和过滤词库来辅助手段。在 Qwen 的对话系统实现中,若检测到输出中含有违禁词或敏感话题,系统层面可以截断或替换回答。这类后处理过滤在业界应用较普遍,结合模型自身的价值观对齐,可提供双重保障。考虑到监管要求,通义千问在面向公众提供服务前需通过中国网信办的安全评审,因此阿里内部应有一整套内容审核机制集成于 Qwen API,确保输出符合法规和伦理规范。
从技术报告来看,团队特别强调了偏见与公平性问题。他们在训练数据和对齐过程中有意识地减少模型在种族、性别等方面的偏见。通过平衡数据分布以及在人类反馈环节关注模型回答中的歧视性内容,Qwen 尽量避免输出刻板印象或冒犯特定群体的言论。这体现了模型伦理道德准则的融入。此外,对于谣言、虚假信息等,模型在RLHF阶段也可能被要求拒绝猜测、不确定就不胡乱编造(减少“Misinformation”)。官方未公开细节,但这些通常是RLHF奖励模型的评价维度之一。
值得一提的是,Qwen-Chat 展现出了工具使用和规划能力。这意味着模型在对话中可以做中间推理、调用外部API等。为了安全,模型在这些场景下需要受到严格限制,防止滥用工具。因此,Qwen-Agent框架中 likely 实现了沙盒机制,只允许模型执行白名单内的操作,并对输出进行监控。
总体而言,阿里通过**“预防+干预”并举的方式保障 Qwen 模型安全:一方面利用 RLHF 等对齐技术从模型层面减少不当回答;另一方面结合系统层内容审核**拦截残余的违规输出。通义千问模型因此能够在避免政治违规、隐私侵犯等风险的前提下,为用户提供有用的答案。这种平衡安全与实用的设计,使 Qwen-Chat 在国内外评测中被认为是 对齐良好、响应稳健 的大模型之一。
当然,再完善的对齐也不可能百分百杜绝问题。所以阿里云在开源许可和使用协议中也注明了不得将 Qwen 用于非法用途等条款,提醒用户负责任地使用模型。在实际应用中,持续的人工监测和反馈迭代也很必要。阿里方面也在不断更新 Qwen 的安全策略(例如增加新违禁话题、优化拒答话术等)。随 Qwen2.5、Qwen3 等版本迭代,安全对齐能力预计会进一步增强。安全是 AI 应用的底线,通义千问系列在这方面的投入为业界树立了一个正面典范。
2、Qwen2 大模型技术说明
https://ar5iv.labs.arxiv.org/html/2407.10671#:~:text=et%C2%A0al,enhancing%20overall%20performance%20and%20adaptability

2.1 模型架构与核心设计
参数规模与模型系列: Qwen2 系列包括多种规模的纯解码式 Transformer 模型,从 5 亿到 72 亿参数不等,并提供对应的基础模型和指令对齐(聊天)模型。具体而言,Qwen2 共发布了五种参数规模的模型:0.5B、1.5B、7B、57B-A14B(混合专家模型)和 72B。下表列出了各模型版本的参数规模:
上述 “57B-A14B” 为 Qwen2 的混合专家模型,表示模型总参数约57B,其中每个 token 在推理时仅激活约14B参数。这一 MoE(Mixture-of-Experts)架构用多个专家全连接层替代原始的前馈层:模型在每层通过门控路由网络将每个 token 分配给若干专家 FFN 计算,从而大幅增加模型容量。Qwen2-MoE 采用了细粒度专家设计,即使用较多的小型专家并同时激活更多专家(每个 token 激活8个专家)。此外还结合共享专家与路由专家的机制,使部分专家在所有路由情况下共享使用,部分专家针对特定输入选择,从而提升专家利用的多样性和模型性能。
Transformer 架构改进: Qwen2 模型基于标准 Transformer 解码架构,并针对大模型进行了多项改进:使用 SwiGLU 激活函数替代传统的ReLU;在注意力计算中引入 QKV 偏置(即为 Query/Key/Value 各自的线性变换添加偏置项);采用 RMSNorm 层归一化及 Pre-Norm 架构以保证训练稳定性。所有模型均应用分组查询注意力(Group-Query Attention, GQA)机制。GQA 属于多查询注意力的范畴,它将多头注意力中的 Key/Value 头分组共享,从而减少注意力缓存占用并提升推理效率(例如 Qwen2-7B 将 28 个注意力头分为4组共享K/V)。与前代版本相比,Qwen2 将 GQA 普及到所有模型规模,使得即便小模型也能在推理时享受更快速度和更低显存占用。值得一提的是,小规模模型(0.5B和1.5B)由于嵌入矩阵占比高,仍采用了Embedding权重共享(输出层与输入Embedding共用)来减少参数,中等以上模型则不共享以保证表达能力。
上下文长度与解码: Qwen2 是自回归语言模型,主要用于文本生成。其基础模型在预训练阶段采用 Next-Token Prediction(下一个词预测)的解码方式训练。默认情况下,Qwen2 基础模型使用相对位置编码方式 RoPE(旋转位置编码),并在预训练末段将支持的上下文长度显著扩展到 32K tokens。特别地,为提升长上下文表现,Qwen2 将 RoPE 基础频率从 1e4 调整为 1e6,以便编码更长的序列而不损失精度。经过特殊设计,Qwen2 的大模型(例如72B)在生成时最大可支持 128K 长度的上下文,即可记忆和处理多达 131,072 个 token 的输入。这样的超长上下文能力得益于预训练期间的长序列训练和后续的扩展策略(详见下文“RoPE与长上下文”部分)。对于混合专家模型 Qwen2-57B-A14B,其上下文长度在指令微调后测试可稳定支持到约64K。Qwen2 使用改进的 多语言多模态自适应分词器,词汇表大小约为 151,646,涵盖了多种语言词片和代码标记,使其能够更有效地表示多语言文本和代码片段。
2.2 训练数据来源与训练策略
预训练语料与数据规模: Qwen2 预训练采用了阿里巴巴自建的超大规模多语言语料库。相比前代 Qwen1.5,Qwen2 的预训练数据在规模、质量和多样性上均有大幅提升。数据来源涵盖广泛的领域和语言,包括常见中英文,以及额外 27 种语言(覆盖西欧、东欧、中东、南亚、东南亚等地区语言,如德语、法语、西班牙语、俄语、阿拉伯语、韩语、日语、泰语、印尼语、印地语等)。下表列出官方提及的部分新增语言:
为提升多语言能力,Qwen2 明确增加了代码混杂(code-switching)场景的数据覆盖,在训练语料中注入不同语言交替出现的样本,从而显著降低模型在多语言混合场景下产生错误的几率。
Qwen2 预训练数据还大幅扩充了编程代码和数学领域的比例,以增强模型在代码生成和数学推理方面的能力。同时,通过改进的数据过滤与生成策略来保证质量:引入了强化的数据过滤算法,结合启发式规则和模型筛选(甚至直接利用预先训练的 Qwen 模型过滤低质文本),并自动合成部分高质量文本以充实语料。在数据混合上,研究团队通过小模型实验调整了不同来源数据的混合比例,使训练分布更符合模型“人类般”习得知识的节奏。
训练 token 数量与阶段: 得益于上述更大的语料库,Qwen2 的训练 token 总量相较前代显著增加。从 Qwen1.5 的约 3 万亿(3T)token 提升到了 7 万亿 token 的高质量数据用于Qwen2 的大模型训练。研究人员曾尝试放宽质量标准构建一个 12 万亿 token 数据集,但发现相较7T数据并未带来明显收益,推测纯粹增加低质数据量对模型益处有限,最终选择质量更高的 7T 数据作为主要训练集。具体来说,除最小的 Qwen2-0.5B 外,其余 Qwen2 稠密模型均在约 7 万亿 token 数据上完成预训练。唯一的例外是 Qwen2-0.5B 小模型反而使用了完整的 12T 数据集进行训练(可能因为小模型参数少,可以利用更大量数据)。对于 混合专家模型 Qwen2-57B-A14B,采取了“上循环(upcycling)”策略:先以稠密模型训练,再切换为 MoE 架构继续训练额外 4.5 万亿 token。也就是说,Qwen2-MoE 模型在7T基础语料上预训练后,又接受了约4.5T的附加训练,从而充分发挥MoE更大容量的优势。
长上下文训练策略: 在预训练后期,Qwen2 专门增加了长上下文训练阶段。起初模型使用标准的 4096 长度上下文进行训练,随后在最后阶段将上下文长度扩展至 32,768 token。为支撑如此长序列训练,研究团队:(1) 投入了大量高质量的长文档数据,确保模型在长上下文下看到足够丰富的实例;(2) 调整了 RoPE 位置编码参数,将频率基数从104扩展到106,以便编码32K长度时保持良好表现;(3) 引入了Dual Chunk Attention (DCA) 等高效长程注意力机制。DCA可以理解为滑动窗口注意力与全局注意力的混合策略:将序列划分为若干区块,在局部窗口内计算细粒度注意力,同时定期进行全局交互,从而用较低计算成本近似全长注意力。通过混合局部-全局的方案,模型能在计算开销可控的情况下学习长距离依赖,这对应 Medium 博文所述的“滑窗注意力与全域注意力相结合”的方法。在长上下文训练基础上,研究人员还利用 YaRN 方法对模型进行上下文窗拓展微调。YaRN(Yet another RoPE extension)是一种高效扩展上下文窗口的技巧,通过重新缩放 RoPE 权重并少量训练,使模型能跨越训练长度进行泛化。综合采用 RoPE高基数、DCA 和 YaRN 后,Qwen2 模型在内部实验中可以将上下文长度 extrapolate 到 128K,而困惑度只出现极小幅度的上升。这为后续指令微调阶段支持超长输入打下基础。需要强调的是,虽然基础模型在困惑度评估上可外推至128K,但在指令微调时团队还专门设计了评测(如“大海捞针”Needle in a Haystack测试)确保模型真正理解并利用超长上下文。结果显示,经过YaRN增强的 Qwen2-7B-Instruct 和 72B-Instruct 可以在整段128K上下文中无遗漏地检索出目标信息,证明了模型的长文本实用能力。
训练流程与优化策略: Qwen2 的训练过程可以分为预训练和后训练(微调)两个阶段。在预训练阶段,模型主要使用自监督的下一个词预测任务在海量语料上训练。官方未明确披露优化器细节,但通常此类大模型采用 AdamW 优化器配合张量并行、流水线并行等分布式训练技术,以及混合精度训练来提升效率。为加速注意力计算、降低显存占用,Qwen2 的实现中也借助了FlashAttention 等高效注意力内核。FlashAttention 是一种针对 GPU 优化的注意力算法,通过减少显存读写和并行计算,实现近乎零开销的长序列注意力。这在 Qwen2 32K甚至128K长度的训练中至关重要,使长上下文训练成为可能。另外,阿里云在训练中应用了自研的分布式训练优化方法(例如 优化的计算并行 和 高效调度 等)以充分利用算力。总的来看,Qwen2-72B 等大模型的预训练是一个耗费巨量算力的工程,训练总步数和时间未公开,但通过数据量和参数规模可以推测,其规模相当于 LLaMA2-70B(2T数据)训练的数倍。阿里巴巴利用强大的云计算集群完成了这一训练,并在训练中注重安全控制(如过滤违规内容)以确保模型基础行为的安全。
在模型预训练完成后,团队进行了大规模的指令微调和对齐调优(即“后训练”阶段)。这一过程在下节详细介绍。
2.3 关键技术与创新
2.3.1 RoPE位置编码与长上下文支持
Qwen2 沿用了 RoPE(Rotary Position Embedding,旋转位置编码) 来为Transformer提供相对位置信息。RoPE通过在 Self-Attention 计算中引入旋转矩阵,将位置以相对相位编码的形式加入,这种方法已被证明可以有效扩展 Transformer 的位置泛化能力。Qwen2 针对超长上下文,对 RoPE 做了两个改进:首先,将 RoPE 基频从原始的 10,000 调整为 1,000,000,扩大旋转频谱以覆盖更长序列;其次,在需要支持超过训练长度(32K)时,引入 YaRN 方法对 RoPE 权重进行再标定,使模型能高效extrapolate到更长窗口。在指令微调的评测中,使用 YaRN 的 Qwen2 模型可成功在128K上下文中找到目标答案,表现远优于未扩展的模型。
此外,Qwen2 结合了 Dual Chunk Attention (DCA) 等长距离注意力机制。DCA本质上是一种滑动窗+全局相结合的注意力:模型将长序列划分为若干chunk,在每个chunk内执行局部自注意力计算,并通过少量跨chunk全局注意力来传递长程依赖信息。这种混合策略在保证长程信息获取的同时,将注意力计算复杂度从 O(n^2) 有效降低,便于在预训练中使用 32K 这样长度的序列进行训练。通过 RoPE 调优和 DCA 训练,Qwen2 的基础模型在32K范围内已经掌握了长距依赖;再配合指令微调阶段的 YaRN增强,最终模型具备处理128K超长输入的能力。
2.3.2 FlashAttention 与高速推理
面对超长序列训练和大模型推理,效率是必须解决的关键问题。Qwen2 模型在实现上应用了 FlashAttention 等高性能算子来优化注意力计算。FlashAttention通过将注意力计算重构为按块访存和计算,在保证数值等价的情况下极大降低显存读写开销,实现了接近理论带宽上限的效率。对于 Qwen2-72B 这类需要处理上百K长度上下文的模型,没有FlashAttention几乎难以完成训练和推理。在实际效果上,引入 FlashAttention 可在相同硬件上将长上下文推理速度提升数倍,并减少显存占用。
除了FlashAttention,Qwen2普遍采用的 Group-Query Attention (GQA) 也是提升推理性能的重要设计。在传统多头注意力中,每个注意力头都有自己完整的一套 K/V 矩阵,这在长序列缓存时非常耗存储。GQA则让多个注意力头共享键和值投影,从而将缓存大小按共享组数成比例地降低。例如 Qwen2-7B 将28个注意力头分成4组共享,这使得注意力状态缓存减少到原来的1/4。官方报告称,由于引入 GQA,Qwen2 推理速度更快,显存占用更低,性能与效率达到平衡。实际上,GQA 可以视为 Multi-Query Attention 的推广,已在 Qwen1.5 的部分大模型上验证有效,在 Qwen2 中被全面采用。
综合来看,Qwen2 在软硬件结合上做了多层次优化:模型结构层面有 GQA 减少计算冗余,实现层面有 FlashAttention 等Kernel提升算速,再加上阿里巴巴自研的框架优化和 GPU 集群并行,这使得如此大规模模型的训练与部署成为可能。
2.3.3 混合专家 (MoE) 架构
Qwen2 系列中包含一个混合专家模型 Qwen2-57B-A14B,这是一种引入 Mixture-of-Experts 的变种 Transformer。其架构与阿里巴巴此前发布的 Qwen1.5-MoE-A2.7B 类似。MoE 模型在若干 Transformer 层将单一的前馈网络 (FFN) 替换为多个并行的专家 FFN。每个 token 经过一个门控路由网络,根据内容动态选择一定数量的专家来计算。Qwen2-MoE 的特殊之处在于采用了细粒度专家 + 多专家激活策略。具体而言,它在每个 MoE 层设置了 64 个专家,其中 8 个为“共享专家”(在所有路由场景下总是参与计算),其余为特定路由的专家,共同构成模型总参数约57B。每个 token 输入时,经过路由会激活 8 个专家(不包括总是启用的共享专家)为其服务。这样每个 token 实际经过的参数约等价14B(8个专家的参数总和),显著小于模型总参数,但又由于专家组合的多样性,模型可以学习到比稠密模型更丰富的表示。
这种设计相较传统“大专家+少激活”方案(例如 Mistral-7B 转换为 8个专家激活2个)有所不同。细粒度专家意味着每个专家参数量较小,但一次性激活更多,使得在总参数相近的情况下,可以组合出更多专家参与,这被认为有助于提升模型表达能力和泛化性。另外引入共享专家可确保模型保留一些通用能力的专家,在任何路由情况下都能提供基础知识;而其他专家则可以专攻某些子任务或特定模式的输入,提高针对性的表现。Qwen2-MoE 在预训练时遵循“先稠密后MoE”的方案:先训练对应架构的稠密模型(7B规模),然后扩展为MoE并继续训练额外数据(4.5T)以充分发挥专家作用。这种 upcycling 方法节约了训练成本,同时利用了稠密模型已有的通识能力作为专家初始点。
2.3.4 指令微调与对齐技术
在经过海量语料的预训练后,Qwen2 还进行了大规模的指令精调(Instruction Tuning)和对齐调整(Alignment),使模型能够更好地遵循人类指令并输出安全、有益的内容。这一阶段可以细分为**监督微调(SFT)和人类反馈对齐(RLHF/DPO)**两步。
监督微调 (SFT): 阿里巴巴准备了一个包含 50万+ 条指令-响应示例的大规模指令数据集。这些示例涵盖了广泛的技能和场景,包括:一般任务的指令遵循、代码生成与调试、数学问答与推理、逻辑推理、多轮对话和角色扮演、多语言指令以及安全相关指令等。数据来源部分依赖人工整理,部分借助模型自动生成(详见下文),确保覆盖丰富且复杂的指令类型。在微调过程中,模型学习以指令作为输入,输出符合人类期望的回答。训练采用监督学习方式:对于每个指令,使用高质量响应作为模型的参考输出(即“示范数据”)进行训练。Qwen2 使用上述 500K 指令数据对预训练模型进行 2 个 epoch 的微调训练,序列长度仍设为32K以保持长上下文能力。在优化上,采用了余弦退火等学习率调度将学习率从初始值平滑降至极低值,以及权重衰减(0.1)和梯度裁剪(阈值1.0)来防止过拟合和梯度爆炸。经过SFT,模型已经能够较好地理解指令并给出合理回答。
偏好优化与人类反馈 (RLHF): 在监督微调奠定基础后,Qwen2 进一步通过人类偏好对齐来提升回答令用户满意的程度。阿里采用了当前先进的 DPO (Direct Preference Optimization,直接偏好优化) 方法来替代传统的策略梯度RLHF。整个对齐训练分为离线和在线两阶段:
- 离线阶段:团队构建了一个偏好数据集,其中每条数据包括同一指令下模型的两个响应,以及人工偏好的优劣标记(哪个更好)。利用该数据,采用 DPO 方法调整模型参数——具体做法是最大化人类偏好回答的概率、最小化劣质回答概率的差距。DPO不需要显式地构造奖励模型进行策略梯度,而是通过修改交叉熵损失直接嵌入偏好信息,实践中更稳定高效。
- 在线阶段: 在离线调优后,阿里还进行了在线RLHF循环训练。这里引入一个训练中的奖励模型对模型新输出进行即评即教。具体而言,对于当前策略模型给定指令采样出多个候选响应,由奖励模型挑选其中“最优”和“最劣”两个响应形成一对偏好样本,然后再次使用 DPO 方法在模型上做一步更新。这种循环相当于不断地边生成新数据边训练,使模型逐步朝着提升人类偏好评分的方向优化。为减轻对齐过程可能引发的“对齐代价”(alignment tax,即模型对齐人类偏好后在客观性能上的退化),训练中还融合了 **在线合并优化器 (Online Merging Optimizer)**方法。该方法会将语言模型原本的任务损失和人类偏好损失进行加权平衡,避免模型一味迎合人类偏好而忘却原有知识。经过上述 RLHF 过程,Qwen2 模型在对话连续性、遵从指令和内容安全性方面有了显著提升。
数据构造与对齐策略: 为了支撑如此规模的指令微调和偏好数据,阿里采用了“人工标注 + 自动生成”相结合的办法:
- 首先,人工标注团队在大量指令语料的基础上提炼出了一个指令任务本体 (ontology),即对可能的指令类型和要求进行细分类标注。这个本体的抽取借助了开源工具 InsTag 来对指令打标签,然后再由人工审校完善。在此基础上,从标注了丰富标签的大规模指令库中筛选代表性指令,确保覆盖多样主题、不同难度和复杂度。此外,还使用了一种指令演化策略:通过让Qwen模型自己来“添加约束或变换要求”,生成更复杂的变体指令。这种 self-evolution 方法提升了指令集合的复杂度和覆盖范围。
- 在获得多元的指令集合后,对于每条指令,采用多样化解答生成 + 人工偏好选择的流程构造训练样本。具体做法是:利用不同规模的 Qwen 模型和多种生成策略,为同一指令生成若干备选响应,然后由多位人工注释者对这些响应按质量排序,选出最佳答案作为示范数据,以及成对的较优/较差回答作为偏好数据。通过这种 协同标注,产出了高质量的监督微调样本和偏好比较样本。
- 针对一些人工难以高效标注的领域,研究团队设计了自动化的数据合成手段。例如,对于数学类有标准答案的问题,引入拒绝采样(Rejection Sampling)策略:让模型构造多个不同的推理步骤,自动验证哪些推理能得到正确答案。将正确且逻辑合理的解题过程作为示范数据,错误过程作为反例,用于偏好比较,从而提升模型数学解题时遵循正确步骤的概率。再如执行反馈(Execution Feedback):对于编程任务,生成候选代码并附带测试用例,通过编译运行检验代码正确性,将通过测试的代码作为正样本、错误代码作为负样本。这一思想也扩展用于一般指令:让模型为带特定要求的指令(例如长度限制)生成一个Python校验函数,自动判定模型回答是否符合要求。通过执行校验,能大规模产生满足约束的高质量回答,以及相应的违规回答用于比较,提高模型遵循指令的可靠性。
- 数据再利用(Data Repurposing):对于如文学创作这类需要高水平写作才能判断好坏的任务,团队采用了“反向构造”的思路。先收集大量公共领域的优秀文学作品,然后让模型基于这些范文来反推出对应的写作指令,再将原作品当作该指令的理想回答。比如,为了获取高质量的角色扮演对话,收集维基百科等资料中的详细人物传记资料,然后命令模型根据传记内容生成对应的对话指令和回答。这样保证了生成的对话既栩栩如生又符合人物设定,相当于模型从现有精品中学习。这种方法有效地将现有优质文本转换为指令数据,解决了许多开放文本创作领域缺乏标注的难题。
- 原则引导(Constitutional AI): 在安全对齐上,Qwen2 借鉴了 Constitutional AI 思路,预先制定一套 AI 应遵守和避免的原则,然后让模型分别生成“遵守原则的回答”和“违反原则的回答”,用于强化训练模型的价值观对齐。具体来说,团队编写了宪法原则数据集,列举了安全、伦理、价值观方面模型应该遵循的准则,以及反例准则。以此指导模型自我生成一系列正面回应和负面回应的数据:正面数据符合安全原则,负面数据刻意违反,用这两者作为示范和偏好数据,让模型学会识别并遵守预设的 AI 行为准则。通过这一过程,Qwen2 在应对不当请求、避免有害内容输出上有了明显改进。在官方测试中,Qwen2 对涉及违法活动、欺诈、侵犯隐私等不安全多语言查询能给予恰当拒答或引导,体现出较好的安全性和责任意识。
经过上述指令微调与对齐优化,Qwen2 的聊天模型(Qwen2-Instruct)在各项评测中表现优异。例如,在多轮对话和指令跟随评测 MT-Bench 上取得 9.1 的高分(满分10),在人类偏好模拟评价 Arena 中也大幅领先其他开源模型。同时,小参数量的 Qwen2-7B 模型在编码等专项任务上也超越了同规模的现有开源模型。这证明了通过大规模高质量的数据微调和先进的对齐技术,Qwen2 系列在确保输出安全可靠的同时,大幅提升了模型的实用性能,成为当时开源社区中性能顶尖、值观对齐完善的大语言模型系列。
3、Qwen2.5 模型核心技术解读
Qwen2.5: 基础模型大派对!

3.1模型架构
基础架构: Qwen2.5 采用与 Qwen2 相同的Transformer解码器架构,结合了一系列当前先进的组件。模型使用分组查询注意力机制(Grouped Query Attention, GQA)替代传统多头注意力,以减少每个注意力头独立存储键值对的开销,从而更高效地利用KV缓存,加速长序列推理。同时,模型的前馈层激活函数采用SwiGLU,在保证模型表达能力的同时提升训练稳定性和非线性表现。为表示位置,Qwen2.5 使用旋转位置嵌入(RoPE)编码序列中的位置信息,并在注意力计算中加入QKV偏置(即为查询、键、值向量添加可训练偏置)以增强表达能力。架构采用Prenorm + RMSNorm方案对各层进行预归一化处理,提高深层网络训练的稳定性。总体而言,Qwen2.5 的主干架构与Llama系列类似,集成了如GQA、RoPE、SwiGLU等近年Transformer架构中的优化设计,没有引入全新的Attention类型,但通过组合上述改进实现了更优的效率与性能。
MoE 扩展: 在上述密集(dense)Transformer架构基础上,Qwen2.5 还推出了使用混合专家(Mixture-of-Experts, MoE)层的变体模型(即 Qwen2.5-Turbo 和 Qwen2.5-Plus)。这些变体将标准的前馈网络层替换为包含多个专家FFN的MoE层,配合 Top-K 专家路由 机制来为每个token选择前K个响应最好的专家进行计算。Qwen2.5 延续了 Qwen1.5-MoE 中验证的方法,引入了细粒度专家划分和共享路由等技术,确保不同专家之间参数高效共享与分配。这种架构创新显著提升了模型在下游任务(尤其是需要多样知识和技能的任务)上的性能,同时通过稀疏激活降低了推理成本。需要强调的是,开源发布的Qwen2.5模型(0.5B至72B参数)均为密集模型,而MoE架构主要用于阿里云API提供的Turbo和Plus版本,以在固定参数量下提升模型推理质量。
Tokenizer及特定符号: Qwen2.5 沿用了Qwen系列的 字节级BPE分词器 (BBPE),词表规模约为**151,643个token,**支持多语言文本的灵活分词。相较之前版本,Qwen2.5 扩充了控制符号集:控制token从原有的3个增至22个,其中新增了2个特殊符号用于工具功能(如函数调用接口等)。其余新增的控制token用于实现角色指令、格式控制等功能。统一的扩展词表在所有Qwen2.5模型中通用,这提高了一致性并避免了不同规模模型之间潜在的不兼容问题。这些特殊符号和统一词表设计,使模型能够更好地解析和生成结构化格式,方便地与外部工具对接。
3.2 训练数据与预训练方式
预训练语料规模与来源: Qwen2.5 的预训练使用了超大规模的高质量语料,总token数从前代Qwen2的约 7万亿 扩充到 18万亿。数据涵盖广泛的领域和语言,重点加强了常识和专业知识、编程代码、数学推理等方面的内容。与Qwen2相比,新数据集中多语言比例更高、内容质量更优,这为模型构建更强的多语言理解和专业推理能力打下基础。主要语料来源包括开放的互联网文本(包含中文、英文及其他语言的百科、新闻、书籍、论坛等)、代码仓库数据、数学题库,以及模型自生成的高质量数据等。由于互联网原始数据良莠不齐,Qwen2.5在数据获取后进行了严格的筛选和清洗,具体包括以下改进措施:
- 更严格的数据过滤: 为确保预训练语料的高质量,Qwen2.5 构建了复杂的质量评估与过滤流程。特别地,使用了一个训练良好的指令模型(Qwen2-Instruct)作为数据质量过滤器,对候选训练样本进行多维度打分。相比Qwen2使用的简单启发式规则筛选,此方法借助模型在大规模多语言语料上学到的知识,对文本进行细粒度的质量评价。过滤器能够识别并剔除低质量、重复或机器生成痕迹明显的内容,同时保留不同语言中更有信息量和多样性的高质量样本。这使得最终进入训练的数据在多个语种上都保持了高质量一致性。
- 数学和代码数据融入: 在预训练语料中显式加入高质量的数学推理和编程代码子集,这是Qwen2.5数据策略的一大亮点。具体来说,阿里巴巴团队预先构建了用于数学和代码的专门模型(Qwen2.5-Math和Qwen2.5-Coder),并将这些模型的训练数据(高难度数学题、证明,和各种编程任务数据)合并到Qwen2.5的预训练语料中。这样做的效果非常显著:模型在预训练阶段就接触并学习了复杂数学和编程知识,从而继承了数学推理和代码生成方面的强大能力。相比只在微调阶段看代码/数学数据,这种预训练融合策略让模型更早、更充分地掌握专业领域技能。
- 高质量合成数据: 团队利用已有的强大模型生成了大量高质量的人工合成训练样本,特别是针对数学、代码和知识问答等难度较高的领域。例如,使用 Qwen2-72B-Instruct 以及专门的 Qwen2-Math-72B 模型来产出数学和代码问题的答案解析等数据。为保证这些合成数据本身的可靠性,研究者引入了奖励模型评估:通过通用人类反馈奖励模型以及Qwen2-Math-RM-72B(数学专用奖励模型)对生成内容进行严格筛选,只保留逻辑正确、步骤清晰的高质量合成样本。这些人机结合挑选出的数据进一步充实了训练集,从而增强模型在数学、代码等任务上的表现。
- 优化数据混合比例: 为避免预训练语料在主题分布上的失衡,Qwen2.5 对数据集不同来源做了策略性重新混合。分析发现,原始网络数据中电商、社交媒体、娱乐等领域占比过高,这些内容常存在重复模板、广告或机器生成文本,信息含量有限。相反,科技、科学、学术等领域的高质量内容比例偏低。对此,团队对过度占比的领域数据进行了下采样(减少此类样本权重),对价值高但占比较小的领域进行了上采样。通过这种再平衡策略,最终的18万亿token语料在各领域上更加均衡且信息丰富,避免模型因某些领域数据过多而产生偏见或学习无效模式。均衡多样的训练语料有助于模型兼具广博的常识与各垂直领域的专业知识。
多阶段预训练策略: 为了高效利用算力并提升模型长上下文能力,Qwen2.5 采用了分阶段的预训练流程。首先,在大部分预训练过程中使用标准的 4,096 个token上下文长度进行训练;接着在最后阶段扩展上下文窗口至 32,768 个token(32K),让模型习惯更长的序列。这种“两段式”训练策略延续了Qwen2的经验:先用较短上下文学习一般知识,最后再在长上下文数据上训练一段时间,以赋予模型处理超长文本的能力。具体实现上,研究者使用了一种称为 ABF(Adaptive Base Frequency) 的技术,将RoPE位置编码的基频从1e4提升到 1e6,从而支持更长距离的旋转位置编码不衰减。换言之,RoPE随位置增加产生的相位变化在长达3.2万token范围内仍然保持区分度,这避免了直接外推RoPE可能出现的位置编码退化问题。对于开放权重的各型号(0.5B~72B)模型,除Turbo外均完成了上述32K长度的额外训练,使得Qwen2.5模型的上下文窗口从Qwen2时代的2K显著拓展到8K乃至32K(默认支持生成文本≥8K token,长上下文版最多支持到128K token)。而针对 API 提供的 Qwen2.5-Turbo 模型,团队甚至设计了渐进式上下文扩展方案:在训练过程中将上下文长度分四阶段从32K逐步提升到 262,144 个token(256K)。每个阶段的训练数据中,40%样本使用当前最大长度,60%使用较短序列,以平滑地让模型适应不断增长的序列长度。最终,借助额外的架构改进(如YARN和双块注意力DCA等长文本优化机制),Qwen2.5-Turbo 能够在推理时处理多达****100万token的超长上下文。这种前所未有的长上下文能力使模型可应对超长文档分析和跨文档推理等复杂场景。当然,如此极限上下文主要在Turbo版本实现,开源的基础模型在经过长上下文微调后通常也可支持最高约128K的上下文窗口。总的来说,多阶段预训练结合上下文扩展训练,既保证了训练效率又赋予模型处理长文本的卓越能力。
注: 除了数据与架构,本次预训练还对超参数进行了系统优化。研究者基于18T数据集合,总结了不同模型规模和架构下的学习率、批大小等超参数缩放律,针对44M到72B不同规模的密集模型和MoE模型,系统网格搜索最优超参数配置。这些经验确保每种规模的Qwen2.5模型都以接近最优的设置进行训练,提高了预训练阶段的收敛效率和效果。但由于篇幅限制,此处不展开细节。
3.3 微调策略(SFT 与 RLHF)
有监督微调(SFT): 在完成大模型的基础预训练后,Qwen2.5进行了大规模的监督微调,以让模型更好地执行指令和 align 人类意图。SFT 阶段使用了超过 100万条 高质量指令响应样本。这些微调数据涵盖对话问答、知识问答、代码生成、数学计算、推理题解等众多类别,许多样本具有复杂的多轮对话结构或要求模型给出详细步骤。相较前代,Qwen2.5 在SFT数据中特别加强了长段落生成(如摘要、报告类回答)、复杂数学推理(链式思考求解算术/应用题)以及代码编写与解释等方面的训练。例如,微调集中加入了让模型输出JSON格式或表格的指令,以及要求模型逐步推理计算再给答案的数学题等。这使模型学会遵循指示产出结构化和逐步推理的回答格式。在微调过程中可能还采用了分阶段策略:先使用一般指令数据SFT,再使用更困难的任务数据做进一步SFT,从而逐步提升模型的复杂任务表现(官方报告提到微调分了多个阶段,但细节未公开)。经过SFT训练后,Qwen2.5的基础能力与指令遵循能力有了显著提升,为后续的人类反馈对齐打下基础。
强化学习对齐(RLHF): Qwen2.5 的微调不仅限于监督学习,还包括了两阶段的基于人类反馈强化学习,以最大程度地提升模型对人类偏好的符合度。具体来说,团队采用了离线RL与在线RL相结合的方案:
- 阶段1 – 离线RL(直接偏好优化 DPO): 第一阶段使用 Direct Preference Optimization (DPO) 方法,对模型进行离线强化学习训练。其思想是在无需在线环境交互的情况下,利用预先准备的偏好数据对模型进行微调。研究者专注于那些有客观评价标准却用普通奖励模型难评估的任务领域,例如数学计算、编程、逻辑推理和严格的指令遵循。在这些任务中,往往存在“正确答案”或明确的优劣之分,但用训练出的Reward Model打分可能不可靠(比如数学证明的正确性判定)。因此,他们借助程序执行和答案匹配等自动度量手段,来筛选模型给出的解答。具体流程为:先让已SFT后的模型针对一批新设计的高难度问题(涵盖数学、代码、推理等)生成多个候选回答;然后对这些回答进行质量检查(包括自动执行验证,如运行模型生成的代码看是否正确,或将答案与标准答案比对,以及人工审核等)。凡是通过质量检查的高质量回答视为“正样本”,未通过的作为“负样本”。将这些正反回答配对,构建成偏好数据,用于训练模型进行选择更优回答的倾向。这相当于构造了一批<问题, 好答案, 差答案>三元组,然后用DPO算法调整模型参数,使其在面对相同问题时更偏向生成接近“好答案”的输出而非“差答案”。最终团队累计构建了约 15万对 这样的训练样本。接着使用一个自定义的优化目标(无需值函数的策略优化)对模型继续训练一个epoch,以较小的学习率微调模型。通过离线DPO训练,模型在上述客观任务上有了显著改进——例如数学题更倾向输出正确推导步骤而非随便猜测,代码生成更严格遵循语法和需求。离线RL阶段等于提前灌输了“大模型也要追求客观正确”的偏好。
- 阶段2 – 在线RL(群体相对策略优化 GRPO)****: 第二阶段,Qwen2.5 采用了一种改进的在线RLHF算法,称为群体相对策略优化(Group Relative Policy Optimization, GRPO)。这是相对于传统PPO的一种新方法,核心思想是基于一组模型输出的相对表现进行优化,而不依赖绝对的价值网络。在具体实施中,模型会针对给定提示采样出一组不同的候选响应,由训练好的奖励模型对这组响应进行排序或打分,然后以组内相对排名作为优化信号来更新策略。这样做的好处是:不需要训练一个额外的价值函数基线,降低了训练复杂度,同时能充分利用一条提示的多个候选反馈来稳定优化过程。在Qwen2.5的RLHF实践中,GRPO阶段主要用来强化模型对人类偏好和对话品质的整体把控。训练时通过引入人工反馈的偏好排序,鼓励模型生成更连贯、礼貌、有帮助的回答,避免出现冗余、攻击性或无关内容。可以认为,GRPO相当于PPO在LLM上的一种定制变体,通过“群体比较”来进行策略约束,使模型的回答朝着人类偏好方向进一步优化。经过这一在线RL阶段,Qwen2.5 在对齐人意图和回答风格上有了显著提升。例如模型对于模糊指令会主动澄清,对于不当请求会礼貌拒绝,对多轮对话的上下文把握也更加稳定。官方报告指出,这些后训练技术使模型的人类偏好对齐度大幅增强,同时在长文本生成、结构化数据分析和指令遵循等实际应用能力上也有明显提升。
概括来说,Qwen2.5 的微调策略是一个“三段式”流程:大规模SFT 打好基础,接着 离线DPO 提高客观任务正确性,最后 在线GRPO 提升总体对话质量和用户满意度。这种组合拳弥补了单纯RLHF的不足,在保持模型听话的同时确保了回答内容的准确专业。值得注意的是,如此规模的后训练数据(总计逾百万样本)和多阶段RLHF在开源模型中尚属少见,凸显了阿里巴巴对Qwen2.5在Alignment上的投入。
3.4 性能解读
Qwen2.5 在各类基准测试中均展现了卓越的性能提升,特别是在多语言理解、工具使用和代码能力这几方面成果突出。下面从这些角度分别解读:
- 多语言能力: 得益于海量多语言语料的预训练和精调,Qwen2.5 对英文、中文以及众多其他语言的理解和生成能力都有显著增强。官方公布模型支持29种以上语言,包括中、英、法、西、葡、德、意、俄、日、韩、越、泰、阿拉伯语等主流语种。在权威的知识与语言理解测试 MMLU 上,Qwen2.5 达到了 85+ 的平均准确率。这一分数不仅远超前代开源模型(Llama2-70B在MMLU仅约70出头),甚至接近GPT-4的水平,体现了模型在广泛知识领域的掌握程度。此外,在跨语言推理和阅读理解任务中,Qwen2.5 同样表现优异。例如官方报告给出的多语言综合测评显示,Qwen2.5-32B 在跨语言常识推理、多语言Winograd难题等任务上的得分达到88.4,显著领先于同等参数量的对手模型。在中文专业测试集 CEval 上(推测数据,未明确给出),Qwen2.5 也应有大幅提升,其中文理解和知识问答能力媲美甚至超越了许多更大规模的开源模型。总体而言,Qwen2.5 系列模型在多语言环境下具备强大的泛化能力,能够准确理解多语种问题并给出高质量回答。这意味着无论是中文用户还是其他语言的用户,都可以从Qwen2.5获得接近顶尖水平的支持。
- 工具使用与结构化输出: Qwen2.5 针对模型与外部工具的集成做出了专门优化。一方面,引入的特殊控制token使模型更容易按照指定格式输出结果,例如以 JSON 或 表格 形式给出答案。这对于需要结构化数据的应用场景(如返回解析后的信息供程序读取)非常实用。实验表明,Qwen2.5 相比之前版本更善于理解并执行类似“请以表格形式列出……”或“用JSON返回结果”的指令要求。另一方面,新增的工具功能token赋予模型调用函数或执行代码的接口。例如,当用户请求计算复杂数学表达式或进行特定格式转换时,模型可以生成一个特殊标记序列来触发预设的函数调用,由外部计算引擎完成运算后再将结果嵌入回答。这种机制类似于OpenAI模型的函数调用能力,旨在让模型学会在合适情况下将任务委托给工具。经过微调训练,Qwen2.5 确实学到了何时以及如何调用外部工具:如遇到需要精确计算或访问实时信息的指令,它会按照约定格式提出函数请求;对于代码执行类问题,模型倾向于直接给出可运行的代码片段。例如,用户询问“2025年的春节日期”这类需要历法计算的问题,模型可能返回一个包含调用历法查询函数的JSON,让外部工具计算后反馈结果。这种工具使用能力在评测中也有所体现——虽然传统基准中少有直接考察“函数调用”能力的指标,但从结构化输出正确率等方面可以侧面看到提升。总的来说,Qwen2.5 在工具增强场景下表现出色,大幅减少了人工后处理和转换的需求,使其回答可以更无缝地被程序解析利用。这对构建复杂应用(如让模型充当数据库查询助手、代码解释器等)非常有利。
- 编程与代码能力: Qwen2.5 的一大亮点是其代码生成和理解能力的大幅提升。由于在预训练中融合了海量高质量代码语料并经过专门的代码微调(包括合成代码数据和人类反馈优化),该模型在主流编程基准上取得了当前顶尖的成绩。例如,在 Python 代码生成测试 HumanEval 上,Qwen2.5-72B-Instruct 的一次性通过率超过 85%。这个成绩几乎与GPT-4相当(GPT-4据公开信息HumanEval在80%左右),显著领先于Llama2等开源模型(Llama2-70B约50%多一点)和先前最好的开源代码模型Code Llama。即使是较小规模的Qwen2.5模型也展现了惊人的代码能力:据报道,Qwen2.5-7B-Instruct在HumanEval上达到了84.8的高分,远超同级别的其它模型(7B的Code Llama不到30分)。此外,在另一个代码基准 MBPP (Python小项目题)上,Qwen2.5-32B模型的完成率约为84.5,同样处于领先地位。值得注意的是,这些成绩很多是直接用模型生成一次结果来评测的,未采用任何投票或代码执行辅助手段。如果允许模型多次尝试或结合执行反馈,其代码解题成功率还会进一步提高。Qwen2.5 对编程语言的掌握不仅体现在Python,在多语言代码数据集 MultiPL-E 中,模型对多种编程语言的问题都有出色的适应能力。综合来看,Qwen2.5 已具备媲美最好商用模型的代码理解与生成水平,可以编写正确且优化的代码、解释代码意图并找出错误。这对于AI辅助编程、代码审计等应用是重大利好。
- 综合对比与基准评测: 阿里巴巴在技术报告中提供了详尽的基准测试结果,对比了Qwen2.5与多款开源及闭源大模型的表现。整体而言,Qwen2.5-72B-Instruct 作为开源旗舰模型,在各项评测中均属顶尖:无论是语言理解(MMLU)、常识推理(BBH)、数学(GSM8K, MATH)还是编程(HumanEval, MBPP),它都超越了绝大多数开源模型和一些专有模型的成绩。尤其值得一提的是,Qwen2.5-72B的综合表现可与据称参数规模高达4050亿的“Llama-3-405B”不相上下,而后者参数量约为前者的5倍。这说明Qwen2.5在同等计算规模下的效率和能力输出极其突出。相比上一代的72B模型,Qwen2.5-72B在几乎所有基准上都有两位数幅度的提升,证明了数据和微调策略改进的有效性。对于更小规模的模型,Qwen2.5也展现了优秀的参数效率:例如14B和32B模型在MMLU、BBH等任务上得分分别达到79.7/78.2和83.3/84.5,超过了一些比它们参数更多的竞品模型。在中文任务上,虽然官方未明示具体分数,但推测Qwen2.5相对前代也有明显优势,可能在中文考试题(CEval)等评测中刷新开源最佳纪录。
此外,阿里巴巴还推出了基于Qwen2.5的专有服务模型 Qwen2.5-Turbo 和 Qwen2.5-Plus。这两者采用混合专家架构(具有相当于数百亿到上千亿的总参数激活),通过API提供高性能推理。从公布的信息看:Qwen2.5-Turbo 的性能对标类似 “GPT-4o-mini” 的模型,而 Qwen2.5-Plus 则对标 “GPT-4o” 级别模型。在内部评测中,Turbo和Plus在很多任务上已经接近甚至达到 GPT-4 水平,但推理成本却远低于GPT-4,对应呈现出极高的性价比。也就是说,用户可以通过阿里云API获得接近顶尖闭源模型的效果,却只需消耗较少的计算资源。这再次印证了Qwen2.5架构和训练的成功。
总结: Qwen2.5 通过架构优化、海量精质数据以及创新的多阶段微调,在各关键指标上均取得了突破性进展。它在多语言方面表现出色,能胜任不同语言的任务;在工具使用上引入了函数调用和结构化输出的新范式;在编程方面甚至达到或超越当前最强模型的水准。在公开评测中,Qwen2.5 系列全面领先以往开源模型,多项能力逼近OpenAI等顶级封闭模型的表现。可以说,Qwen2.5 不仅是阿里巴巴通义大模型的里程碑,也是对开源LLM社区的一次重大贡献,为业界提供了一个各方面均衡且性能卓越的新基线模型。
4、Qwen 3 模型架构设计(Architecture)
arxiv.org

Qwen3 属于典型的解码器-only Transformer 架构,即仅使用自回归解码器层堆叠来生成文本。相较前代模型,Qwen3在架构上引入多项改进:
- 分组查询注意力(Grouped Query Attention, GQA):采用多查询注意力机制,将多个查询头共享较少的键/值头。例如 Qwen3-14B 使用 40个查询头和 8个键/值头,实现更少的KV投影计算。GQA有效降低了注意力计算的内存和算力消耗,同时保持模型表达能力。
- 去偏置的注意力与QK归一化:Qwen3 移除了前代模型注意力中的Q、K、V偏置项,并引入 QK-Norm 策略对查询和键向量进行归一化。这项技术源自文献(Dehghani等人,2023),能够稳定超长上下文下的训练,使模型在长序列上不发生数值发散。
- SwiGLU激活函数:前馈网络部分采用SwiGLU激活(Swish-Gated Linear Unit)代替传统的ReLU/GELU。SwiGLU通过门控机制提高梯度流通性,缓解“大模型死神经元”问题,增强训练稳定性和模型表达能力。
- RMSNorm规范化:使用RMSNorm(均方根归一化)替代LayerNorm,并在每层采用Pre-Norm架构。RMSNorm无需计算均值,只基于均方根,训练更稳定,同时Pre-Norm有助于深层网络的梯度传播。
- 词嵌入权重绑定:针对小模型(<8B参数),Qwen3沿用了Embedding层权重与输出层权重同值绑定(Tie Embeddings)策略,以减少参数量。但在较大模型中(≥8B)取消了绑定,让输入输出嵌入独立,以提升大型模型的表达灵活性。
综合以上改进,Qwen3在架构上实现了更高效的注意力机制和更稳定的训练,哪怕使用更长上下文或更大模型规模,依然能够维持性能。
4.1 Rotary Positional Embeddings 优化
旋转位置编码(RoPE) 是Qwen3用于表示序列位置的方案。RoPE通过对查询/键向量施加随位置递增的旋转变换来编码位置信息。Qwen3对RoPE进行了两项关键改进,以支持超长上下文而不损失精度:
- 调整基频(ABF-RoPE):RoPE的一个参数是旋转频率基数,默认约为10,00010,00010,000。Qwen3采用**Adjusted Base Frequency (ABF)**方法,将RoPE基频从1e4提高到1e6。增大基频相当于减缓角频率增长,让位置编码“拉伸”,从而在上下文长度从4K扩展到32K时仍保持准确的相对位置表示。实验证明,应用ABF后模型在32K长度上性能几乎无衰减。这一改进在预训练第三阶段引入,使模型能够有效学习长达32K的上下文依赖。
- YARN 动态重映射:在推理阶段,Qwen3进一步使用**“Yet Another RoPE eNhancement (YaRN)”** 技术对位置进行动态重映射。YARN不需改动模型权重,而是在推理时按规则重新映射位置索引,将有效上下文再扩大4倍。实际效果是将训练的32K位置扩展到支持128K长度。例如,对于8B及以上模型,Qwen3标称支持128K上下文,就是通过YARN实现的。YARN确保即使输入超长(比如上百页文本),模型也能利用已有位置编码权重来处理超长序列。
- 双块注意力(Dual-Chunk Attention, DCA):面对超长序列,计算注意力的内存开销呈二次增长。Qwen3在长上下文场景下引入“双块注意力”机制:将特别长的序列在每层划分为两块,分别计算注意力并交叉交流信息。这样在不牺牲任意两位置全局依赖的前提下,将单次注意力计算的复杂度和显存占用降低约一半。DCA与上述RoPE改进结合,使模型在长序列推理时内存占用大幅下降,保障了128K长度在单机GPU上的可行性。
通过 ABF调频+YARN重映射+DCA分块 的组合,Qwen3在训练阶段实现了32K长上下文建模,并在推理部署中将处理长度提升到128K,突破了常规Transformer上下文长度的限制。这些技术让模型在应对极长文本(如整本书或多轮对话)时保持性能平稳,充分发挥长上下文优势。
4.2 多专家混合(MoE)机制
Qwen3 推出了 Mixture-of-Experts 架构的模型变体,引入多专家路由机制,大幅提升参数规模的利用效率。主要细节如下:

- 专家数量与Top-k路由:MoE版的Qwen3在部分前馈层引入 128个专家子网络(轻量级MLP模块的集合)。每个token经过MoE层时,门控路由网络会从128个专家中选出得分最高的8个进行计算(即Top-8路由,每token激活8个专家)。未选中的专家对该token保持休眠,不参与计算。这样的 Top-k门控 机制确保每个token只用到很小一部分专家参数,大幅降低了推理计算量。
- 激活参数占比与效率:由于每次仅激活8/128≈6.25%的专家,MoE模型的激活参数量仅为总参数的十分之一左右。例如,旗舰MoE模型 Qwen3-235B-A22B 总参数2350亿,但每次推理仅调用约220亿参数。因此其实际计算开销相当于一个约22B参数的稠密模型,却获得了接近235B模型的性能。这使训练和推理成本显著降低,实现“用更小的计算获得更大的模型效果”。
- 专家分片与无共享设计:Qwen3-MoE遵循Qwen2.5-MoE的做法,采用细粒度的专家分片技术,以便在多GPU上高效并行训练超多专家模型(Dai等人,2024)。与前代不同的是,Qwen3的MoE取消了不同层之间共享专家的设计,每层的专家集互不共享,避免了资源争用并精细化了各层专家功能。
- 全局批次负载均衡:为防止路由不均导致某些专家过载或“闲置”,Qwen3对MoE路由引入全局批量负载均衡损失。即在计算门控损失时,将所有层、整个batch的token分配情况综合考虑,鼓励模型将不同token分散给尽可能多的专家。这一辅助损失(参考Qiu等人2025的方法)使128个专家都能各司其职,保持高专长度的同时充分利用每个专家的容量。
凭借上述MoE机制,Qwen3的MoE版模型在同等计算成本下达到了远超稠密模型的效果。例如,30B总参的Qwen3-30B-A3B(激活3B参数)性能超越了密集模型Qwen2.5-32B,4B的小型Qwen3甚至可媲美上一代72B模型(注:这里只比较自家模型性能提升)。“多专家”架构使模型参数规模的扩展更加高效,为追求更高性能的超大模型提供了一条可行路径。
4.3 训练方法与数据
预训练数据:Qwen3的预训练语料规模相比前代有显著提升,达到约36万亿tokens,几乎是Qwen2.5的两倍。数据涵盖119种语言和方言,比前代支持的29种大幅增加。为构建如此庞杂的数据集,研发团队不仅抓取了开放网络文本,还利用内部工具从PDF等文档中提取高质量内容。具体来说,先用Qwen2.5-VL(多模态模型)识别PDF中的文本,再用Qwen2.5基础模型对提取文本进行质量提升和过滤。此外,为了丰富数学和代码领域的数据,Qwen3大量引入了合成数据:利用预先训练的Qwen2.5-Math和Qwen2.5-Coder专家模型,生成了教材、问答对、代码片段等内容,填充了数学推理和代码生成相关语料。通过这些方式,Qwen3的训练语料在广度和深度上都远超以往。
😎多阶段预训练:Qwen3的预训练采用了三阶段逐步扩展策略:阶段 S1 – 基础训练:在第一阶段,模型以4K的上下文长度,在超过30万亿token上进行预训练。这一阶段主要让模型学习基本的语言模型能力和广泛的常识知识,为后续提供良好的初始表示。阶段 S2 – 知识强化:第二阶段增加了5万亿token的训练量,重点提升模型对知识密集型任务的能力。为此,在语料中提高了STEM领域、代码和复杂推理相关数据的比例。这使模型更擅长数学推导、代码理解等需要深度知识的场景。阶段 S3 – 长上下文扩展:在最终阶段,使用精挑细选的高质量长文档数据对模型继续训练,并将上下文长度扩展到32K。通过在训练中加入长序列样本,模型逐步适应更长的依赖关系,从而在不损失性能的情况下掌握32K长度的上下文处理能力。
经过以上逐层“加料”的预训练,Qwen3基础模型的能力有了质的飞跃。据报告,其各规模的Base模型在通用基准上的表现已可媲美甚至超越参数量更大的Qwen2.5模型。例如Qwen3-14B-Base的成绩相当于Qwen2.5-32B-Base,而在STEM、编码、逻辑推理等方面小幅领先。尤其值得注意的是,MoE基础模型在仅使用约10%激活参数的情况下,就达到与同等Dense模型相当的性能,显示出训练效率的大幅提升。
指令微调和强化学习:在完成通用预训练后,Qwen3还经历了四阶段的“后训练”微调流程,旨在将“思考(推理)模式”和“非思考(直接回答)模式”融合到单一模型中:
😎阶段1:长链条思维冷启动 – 使用大量长链路的思维链(CoT) 数据对模型进行有监督微调。训练样本涵盖数学题解、代码解析、逻辑推理、科学问答等任务,每个问题都附有详细的逐步推理过程。这一步为模型注入基本的逐步推理能力,相当于教会模型“先想后答”的习惯。阶段2:基于推理的强化学习 – 在此阶段,引入强化学习(RL)来进一步提升模型的推理质量。由于人工反馈成本高,Qwen3采用了规则策划的自动奖励函数,例如检查模型思维链的逻辑正确性、数学计算是否正确等。模型通过不断尝试思考步骤并根据奖励信号优化策略,从而提高链式推理的准确性和稳健性。阶段3:思维模式融合 – 经过前两阶段,模型已擅长逐步思考,但回答速度较慢。第三阶段将模型非思考的直答能力融合回模型中。具体做法是,将第二阶段强化后的“思考型”模型生成的长链思维数据,与常见的指令微调数据混合,继续对模型进行微调。通过在同一模型上学习这两类数据,模型得以同时具备逐步推理和直接回答的能力。在这一过程中,模型还学会用特殊标记(如 …)区分思考内容,便于灵活开关。阶段4:通用领域强化学习 – 最后,Qwen3在20多个通用任务上进行了进一步的RL训练。这些任务涵盖指令遵循(如遵守用户格式要求)、对话行为(如角色扮演、多轮对话)以及工具/Agent使用等方面。通过引入模拟用户偏好的奖励,模型在最终阶段学会了更符合人类偏好的响应方式,纠正了一些不良行为,并增强了调用工具、处理复杂交互的能力。
经过这一系列精细的训练流程,Qwen3 实现了在单模型内融合两种“思维模式”的目标****:既能在需要时展开严谨的逐步推理,又能在简单提问时立即给出简明答案。而这一切无需像过去那样切换不同模型来实现,极大提升了模型使用的灵活性。用户甚至可以通过参数或提示即时控制模型开启“思考模式”或“快速模式”,官方报告称模式切换的准确率达到99%。多阶段训练和海量高质数据的结合,使Qwen3在数学、代码、常识推理以及多语言等各方面均取得了当前开源模型中的顶尖水平。
4.4推理优化与部署技术
Qwen3在推理阶段结合了多种优化策略与工具,确保模型在超长上下文和资源受限环境下依然高效运转:
-
KV缓存(Key-Value Cache):自回归生成时,模型需多次计算注意力以利用先前上下文。Qwen3采用标准的KV缓存机制,在生成时保存每层过去所有tokens的键/值向量。当生成下一个token时,直接复用缓存的历史Key/Value,而无需重复计算前序内容的注意力贡献。这种缓存式增量解码大幅降低了长序列推理的时间开销,尤其在Qwen3支持的32K-128K长上下文下,如果没有KV缓存,每生成一个新词都要重复处理海量上下文,是不可想象的。通过KV缓存,Qwen3实现了长文档的高效逐字生成。
-
KV缓存量化:针对超长对话可能带来的显存占用问题,Qwen3支持对KV缓存进行低精度量化存储。例如,可将缓存的Key/Value从16位浮点压缩为8位表示,从而将缓存内存占用近乎减半。根据HuggingFace的报告,KV缓存FP8量化在基本不影响生成质量的前提下,将长上下文生成的内存需求大幅降低。这对于需要生成超长文本的场景非常有用,能够在有限GPU内存下延长可生成的内容长度。需要注意的是,目前使用FlashAttention时暂不支持同时启用KV缓存量化,两者需要权衡选择。
-
模型低比特量化:为方便部署,Qwen3官方提供了模型权重的多种低比特版本,并支持常用的量化方案。包括GPTQ(面向推理的4比特权重量化)和AWQ(Activation-aware Weight Quantization)等方法,甚至支持最新GPU的FP8精度。量化后的模型尺寸显著缩小,例如4-bit量化可使模型权重体积约为全精度的1/8,使得数十亿参数的模型能够在消费级显卡甚至笔记本上运行。官方文档提供了不同精度下模型的性能和速度基准,显示量化对Qwen3性能影响很小。通过量化,研发者可根据需求在精度损失可控的前提下,极大降低部署成本。
-
FlashAttention 加速:Qwen3推荐在支持的硬件上启用FlashAttention 2算法来加速注意力计算。FlashAttention通过重写Attention的计算逻辑,在CUDA内核中采用块稀疏和显存交换技术,一次性完成注意力的Softmax和加权求和,避免了显存中大矩阵的显式存储。在32K等长序列下,FlashAttention可显著减少显存占用并提高速度。据官方环境配置,Qwen3的推理使用了FlashAttention 2.7版。结合Qwen3模型自身的GQA和DCA优化,FlashAttention让超长上下文的推理变得更加高效流畅。实际测试中,启用FlashAttention的Qwen3在相同硬件上吞吐率有明显提升。
-
部署框架与工具:为便于不同场景下的使用,官方提供并推荐了多种部署方案:在服务器端,可使用如vLLM或阿里云开源的SGLang等高性能推理框架进行部署。vLLM 利用PagedAttention技术高效管理KV缓存,实现业界领先的并发吞吐;SGLang则针对AWQ量化做了专门优化,支持多GPU高效推理。在本地设备上,则可以借助轻量级推理引擎,如支持CPU/GPU的llama.cpp、跨平台的Ollama/LMStudio图形界面,以及优化Transformer推理的KTransformers等工具。这些生态工具已经适配Qwen3模型,用户只需加载开源权重即可运行。通过选择合适的部署方案,Qwen3模型可以灵活地从消费级笔记本扩展到数据中心集群,既确保高性能推理,又方便集成到实际应用中。
那么,如何系统的去学习大模型LLM?
作为一名从业五年的资深大模型算法工程师,我经常会收到一些评论和私信,我是小白,学习大模型该从哪里入手呢?我自学没有方向怎么办?这个地方我不会啊。如果你也有类似的经历,一定要继续看下去!这些问题啊,也不是三言两语啊就能讲明白的。
所以我综合了大模型的所有知识点,给大家带来一套全网最全最细的大模型零基础教程。在做这套教程之前呢,我就曾放空大脑,以一个大模型小白的角度去重新解析它,采用基础知识和实战项目相结合的教学方式,历时3个月,终于完成了这样的课程,让你真正体会到什么是每一秒都在疯狂输出知识点。
由于篇幅有限,⚡️ 朋友们如果有需要全套 《2025全新制作的大模型全套资料》,扫码获取~

👉大模型学习指南+路线汇总👈
我们这套大模型资料呢,会从基础篇、进阶篇和项目实战篇等三大方面来讲解。


👉①.基础篇👈
基础篇里面包括了Python快速入门、AI开发环境搭建及提示词工程,带你学习大模型核心原理、prompt使用技巧、Transformer架构和预训练、SFT、RLHF等一些基础概念,用最易懂的方式带你入门大模型。

👉②.进阶篇👈
接下来是进阶篇,你将掌握RAG、Agent、Langchain、大模型微调和私有化部署,学习如何构建外挂知识库并和自己的企业相结合,学习如何使用langchain框架提高开发效率和代码质量、学习如何选择合适的基座模型并进行数据集的收集预处理以及具体的模型微调等等。

👉③.实战篇👈
实战篇会手把手带着大家练习企业级的落地项目(已脱敏),比如RAG医疗问答系统、Agent智能电商客服系统、数字人项目实战、教育行业智能助教等等,从而帮助大家更好的应对大模型时代的挑战。

👉④.福利篇👈
最后呢,会给大家一个小福利,课程视频中的所有素材,有搭建AI开发环境资料包,还有学习计划表,几十上百G素材、电子书和课件等等,只要你能想到的素材,我这里几乎都有。我已经全部上传到CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相信我,这套大模型系统教程将会是全网最齐全 最易懂的小白专用课!!
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)