【强化学习】知识地图
作者:昇腾实战派
背景
本博客旨在对已发表在社区的强化学习相关的博客进行整理归类,方便用户导航使用。一下文章所用的机器均为昇腾相关设备。
强化学习系列将划分为【核心算法和理论】、【框架能力与架构】、【NPU模型部署实践与调优】、【特性适配案例】五大类
核心算法和理论
veRL框架下DAPO强化学习算法的实现解析
视觉推理洞察
强化学习场景分布式框架ray相关方案介绍
DAPO + TransferQueue:优化大规模策略优化算法的数据中转与性能
训练中的 Bridge 技术解析:Mbridge 与 Megatron-Bridge
框架能力与架构
veRL 训推一致性工作及重要性采样代码演进分析
veRL异卡方案
veRL异步异卡方案考古
基于VeRL的ReactAgentLoop实践
VeRL engine_worker使能记录
VeRL 强化学习框架中的数据流与 PPO 损失计算详解
VeRL 强化学习训练框架代码架构解析
VeRL-DAPO精度问题数值计算分析
Fully Async 代码走读
参考配置
使用Ascend verl每日镜像进行大语言模型训练指南
VeRL-Megatron训练性能优化配置参考
SGLang 与 VeRL 框架下大模型训练的高性能配置优化指南
NPU模型部署实践与调优
基于VeRL框架的GSPO算法在Atlas 800T A2服务器上实践
Qwen2.5-VL-7B模型GRPO训练实践指南
【VeRL】Qwen3-235B-A22B 强化学习昇腾Atlas 800T A2复现与部署实践
【VeRL】Qwen3-235B 长序列强化学习训练性能优化实践
【VeRL】Qwen3-30B-A3B-DAPO NPU实践指导
Qwen3-30B-A3B 模型在异步训练场景下的性能优化实践
MindSpeed-RL GRPO 昇腾全共卡方案实践总结
基于昇腾平台的SAPO训练实践
Verl Full Async架构昇腾实践
【VeRL】Dense模型DAPO算法性能优化方案
基于VeRL GPT-OSS-20B MoE模型 DAPO 强化学习训练适配流程
Qwen3.5-35B-VeRL-FSDP 功能适配实践
Qwen3.5-35B-VeRL 训练性能优化实践
特性适配案例
veRL partial rollout方案
veRL fully async training 全异步方案
从服务化推理和统一训练架构,到veRL异步profiling改造
VeRL 强化学习场景下NPU环境profiling使用指南
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)