登录社区云,与社区用户共同成长
邀请您加入社区
本文对五大主流大模型推理框架(vLLM、SGLang、TensorRT-LLM、TGI、lmdeploy)进行了全面对比分析。从技术特性、性能表现、易用性等维度展开评测,结果显示: 性能表现: 单序列吞吐:TensorRT-LLM最优(78 tokens/s) 高并发场景:SGLang凭借RadixAttention技术领先(6200 tokens/s) 结构化输出任务中,SGLang成功率高达9
6月6日,由沐曦股份联合SGLang开源社区、阿里云、龙蜥社区、腾讯云及融科资讯中心举办的“沐曦芯生,开源共创——SGLang技术交流Meetup。
是 OpenDataLab 发布的最新文档解析模型,专注于的高精度转换任务。📄 论文:arxiv:2604.04771该模型基于 Qwen2-VL 1.2B 架构,通过大规模高质量数据工程,在 OmniDocBench v1.6 上超越 GPT-4o、Gemini 等商业模型,创下开源文档解析新基准。数据工程 > 参数规模。在 PDF 解析这个垂直任务上,1.2B 参数的专精模型完全可以超越通用
这篇文章介绍了如何实现一个高效的KV Cache机制来优化大语言模型推理性能。主要内容包括:1)设计了一个连续张量版的KV Cache类,采用(num_layers, max_seq_len, num_kv_heads, head_dim)的内存布局以优化访问效率;2)详细解释了这种维度排列如何实现零拷贝和连续内存访问;3)展示了如何改造attention模块,新增store和get操作与cach
在大语言模型(LLM)推理中,预填充(Prefill)阶段往往是性能瓶颈:输入序列需先转换为 KV Cache,才能进行后续解码。当多个请求共享相同前缀时,对应的 KV Cache 完全一致,存在大量重复计算。为解决这一问题,SGLang 引入了 RadixAttention,利用空闲 GPU 内存缓存并复用前缀 KV Cache;进一步地,HiCache 将这一思路扩展至宿主机内存(Host M
这篇文章详细介绍了如何从零开始构建Qwen3-0.6B大语言模型的推理引擎。主要内容包括: 模型整体架构:由embedding层、28层decoder、RMSNorm层和lm_head组成 核心模块详解: Embedding层实现token到向量的转换 RMSNorm层用于稳定训练和推理 每层decoder包含自注意力机制和MLP两部分 关键技术点: 采用pre-norm残差结构 使用GQA(分组
本文面向:手上有 24GB 级别消费/工作站显卡,准备在本地或小规模生产环境跑大模型的工程师。涉及框架版本:vLLM 0.6.x、SGLang 0.3.x、Ollama 0.5.x(2026 年 5 月)。
目前,基于MUSA的SGLang已支持DeepSeek、Qwen、GLM等主流大模型及Wan、LTX等视频生成模型,在MTT S5000等硬件上实现真正的“开箱即用”与无缝加速,显著降低了开发者的算力迁移门槛。通过与SGLang、TileLang、Triton、Mooncake等开源社区的紧密协作,摩尔线程不仅推动了MUSA平台与主流AI框架的深度适配,更。,未来12个月应优先建立跨层级的统一抽象
这篇文章不做空泛 benchmark,而是基于四个主流推理框架的官方 README、安装文档、Quick Start 和最新发布信息,拆解 vLLM、SGLang、TensorRT-LLM、llama.cpp 在硬件边界、OpenAI 兼容接口、工程复杂度和适用场景上的真实差异,帮助读者按自己的部署目标做第一轮正确选型。
vLLM 和 SGLang 对 Qwen3.6-27B 的完整部署测试教程与性能测试表现
大模型生成文本的方式是"逐字生成"——每生成一个字,都要"看一遍"之前所有的字。生成"今" → 看输入(1个字)生成"天" → 看输入 + "今"(2个字)生成"气" → 看输入 + "今天"(3个字)生成"真" → 看输入 + "今天天"(4个字)生成"好" → 看输入 + "今天天气"(5个字)每次都要重新计算之前所有字的"注意力权重",计算量巨大。把之前计算过的 Key 和 Value 缓存
至此,GPUStack 的控制面已成功部署,沐曦 GPU 节点也顺利接入集群,并能够正常采集 GPU 名称、索引、厂商信息、温度、利用率及显存使用等指标。在异构 GPU 环境下,GPUStack 可以将原本分散的推理服务进行统一纳管,使模型部署、服务运行以及监控观测都集中在同一平台中完成,从而降低多环境运维复杂度。在 GPUStack 控制台中,选择添加节点(Worker),并复制系统生成的接入命
GPUStack 支持接入官方及自定义推理镜像,以满足不同版本的 vLLM 和 SGLang 后端部署需求。以下示例展示如何在沐曦 GPU 上接入官方镜像并部署自定义版本模型。在 GPUStack 控制台中进入推理后端 → vLLM,编辑后端并添加新版本,使用沐曦官方 vLLM 镜像:参数示例版本0.15.0镜像框架MACA镜像入口命令执行命令⚠️ 注意:使用相应镜像前,需要先在沐曦开发者社区获取
本文介绍了开源视频生成模型万象的技术架构。该模型采用时空变分自编码器(VAE)结构,通过大规模预训练策略实现性能提升。文章重点解析了DiT模型的前向过程,包括输入处理、注意力机制和序列并行等关键模块。模型支持图生视频、指令编辑等任务,接受中文输入,1.3B版本仅需8.19GB显存。详细阐述了文本编码、图像编码、位置编码等输入处理流程,以及基于Triton的高效旋转位置编码实现。同时介绍了针对不同G
SGLang是专为结构化生成和多轮对话优化的LLM推理引擎,具有三大核心优势:1)结构化生成能力,支持JSON/SQL/代码等格式约束输出;2)RadixAttention技术,通过KVCache树状复用提升多轮对话效率;3)Python-like编程模型,支持控制流和模块化设计。测试表明,在结构化生成场景下吞吐量可达150-180tokens/s,多轮对话显存效率提升2-3倍。SGLang特别适
veRL框架:面向强化学习的高效混合编排系统 veRL是一个专为强化学习(RL)设计的创新框架,通过独特的Hybrid Flow架构解决了传统RL框架在多阶段异构工作流中的编排难题。该框架采用单控制器(Single-controller)与多控制器(Multi-controller)相结合的混合模式,实现了全局工作流编排与组件内分布式计算的高效统一。 核心架构包含四大组件:Model Engine
本文提供华为昇腾NPU部署Qwen3.5+SGLang的实战指南,包含Docker Compose配置和启动脚本说明。环境要求为昇腾910B/8.5.0,通过挂载模型目录和映射NPU设备实现快速部署。关键配置包括CPU调优、Ascend环境设置、多卡并行参数等,并给出启动验证步骤。文章还提供性能调优建议和常见问题排查方法,适用于单机多卡场景,支持多模态能力,可根据业务需求调整参数。
接下来我们以 Qwen3.5-122B-A10B 为例,带大家一步步完成在 Ascend 上的 SGLang 部署流程,包括环境准备、启动方式和一些关键配置点。已同步上线 Qwen3.5 全尺寸模型版本,欢迎广大开发者前往 AtomGit AI 下载模型并体验部署流程,在真实算力环境中测试 Qwen3.5 的能力边界~如果您在使用过程中遇到任何问题(包括功能、合规等),欢迎在代码仓提交 Issue
摘要:本文基于昇腾Atlas800T NPU开发环境,对Qwen-14B大语言模型在SGLang框架下的适配与性能进行了系统验证。研究内容包括环境配置、兼容性测试、性能基准评估(FP16精度下平均吞吐20-25 tokens/s)以及RadixAttention缓存、投机推理等高级特性验证。测试结果表明,该模型在昇腾平台上可稳定运行,显存占用18-20GB,支持批量推理和长文本生成。研究还提出了包
Llama 3-8B-Instruct 在昇腾 NPU 上的 SGLang 性能实测