登录社区云,与社区用户共同成长
邀请您加入社区
演示环节他展示了整个部署优化过程,包括每阶段 Agent 工作流程,以及分析者、实施者、验证者三角色协作机制。他重点介绍了 Harness、Skill、Bench 三大体系:Harness 负责协调不同 Agent 的调度与协同工作,Skill 统一管理算子开发各环节的能力、构建算子领域的「元素周期表」,Bench 则打造覆盖编译、精度、性能三大维度的标准化评测体系,当前已沉淀约 50 多个核心算
无论是每一场演讲结束后的问答环节,还是茶歇时间与最后的自由交流时段,现场的交流都格外踊跃:有人关心 Agent 优化工作流在全新架构模型上能否稳定复现,有人追问 KDA 算子的矩阵求逆如何在 Cube 上高效实现、PyPTO 底层是否生成 Ascend C 代码,也有人围绕 DSpark 多流并行是否带来 Cube 抢占、Longcat 2.0 是否做了 KV Cache offload 等工程细
CANN 全面开源开放,致力于为开发者构建统一、高效的算力使能平台,助力 AI 应用创新与加速落地。为进一步促进区域开发者交流、共建 CANN 生态,CANN 开源社区联合 AtomGit 正式发起「CANN 开发者 Meetup」南京站。
欢迎化工、材料、能源领域的开发者下载代码、运行测试用例(详情见https://gitcode.com/cann/mat-chem-sim-pred/tree/master/simulation/AI4MD),并通过Issue或社区渠道反馈问题与改进建议。本算子实现了GAFF2的五项势能——键伸缩、键角弯曲、二面角扭转、Lennard-Jones 12-6、库仑静电,力约定与GROMACS一致。分子
cann-samples:https://gitcode.com/cann/cann-sample计算公式ci,j=∑g=0ceil(K/G)−1(scaleAi,g⋅scaleBg,j⋅∑k′=0G−1(ai,gG+k′⋅bgG+k′,j))c_{i, j} = \sum^{ceil(K/G)-1}_{g=0}\left(scaleA_{i, g} \cdot scaleB_{g, j} \cd
他们把 PyTorch 模型直接导出成 ONNX 再跑到昇腾 NPU 上,中间经过了太多不必要的格式转换,而且没有做任何算子融合,很多小算子被逐个调度,调度开销把计算并行度吃掉了。这个故事说明了一个很现实的问题:昇腾 NPU 的硬件算力是够的,但软件层面的"最后一公里"优化——算子融合、内存复用、计算图优化——才是决定实际推理性能的关键。cann-recipes-infer 就是专门解决这个问题的
摘要:MoE模型分布式推理中,Token分发的AllToAll通信成为主要瓶颈,占推理时间的40-55%。DeepEP通过优化通信与计算的重叠,显著提升性能。在昇腾集群上,采用Token重排和通信-计算并行策略,使通信占比从45%降至18%,吞吐量提升至820 tok/s。相比传统AllReduce,AllToAll对硬件链路要求更高,全互联架构能充分发挥其性能优势。
本文探讨了ElementWise算子融合在AI推理中的优化价值。通过将Add、Mul、Sub等小算子合并为复合Kernel,可显著减少调度开销(原开销是计算时间的10-20倍)。典型融合场景包括残差连接、激活函数与Dropout等,昇腾NPU采用连续算子融合、GEMM尾处理融合等策略。实测显示,LLaMA-7B模型在融合后Kernel数量减半,Launch开销降低50%,整体延迟下降7%。这种优化
摘要:广播(Broadcast)机制允许不同形状的张量进行运算,通过虚拟扩展而非物理复制来提升效率。昇腾NPU通过Vector Unit实现广播计算,小张量缓存在L1中复用,避免显存浪费。图编译层(GE)会优化广播操作,如融合广播与后续算子、调整Tensor布局等。当小张量超过L1容量时,ops-broadcast会调整分块策略以维持性能。该机制显著减少了内存占用和带宽消耗,是AI计算中的重要优化
本文介绍了使用asc-devkit快速搭建昇腾AI开发环境的方法。该工具包通过Docker镜像提供预配置的开发环境,包含CANN Toolkit、编译工具链和调试工具,解决了环境配置耗时、版本不一致等问题。文章详细说明了镜像拉取、容器启动、项目初始化的步骤,并针对常见问题提供解决方案。asc-devkit支持推理部署、算子开发和训练开发等不同场景,能显著提升开发效率,特别适合团队协作和新手快速上手
大模型训练依赖高效的分布式通信库实现多卡协同计算。HCCL作为华为昇腾平台的集合通信库,采用Ring AllReduce算法将通信复杂度从O(N²)降至O(N),支持AllReduce等核心操作。其通过拓扑感知优化通信路径,实现计算与通信重叠,并集成到PyTorch框架中。相比NCCL,HCCL针对昇腾硬件特性优化,在大数据量下可达对标硬件的88%带宽利用率。开发者只需切换backend即可在代码
文章摘要: 本文详细解析了大模型在昇腾NPU上的推理全链路过程,分为Prefill和解码两个阶段。Prefill阶段一次性处理完整输入序列,计算量大但只需执行一次;解码阶段则逐Token生成输出,依赖KV Cache机制降低计算复杂度。文章重点分析了KV Cache对显存资源的占用问题,并介绍了CANN在算子融合、动态Batch管理和分页缓存等方面的优化技术。最后总结了不同阶段的性能瓶颈及应对方案
《昇腾ATC工具解析:从ONNX到OM模型的转换与优化》 本文深入剖析了昇腾NPU模型转换工具ATC的核心机制。针对ONNX模型无法直接在昇腾硬件运行的问题,文章从三个关键维度展开:1)转换流程解析,详细说明ATC如何将ONNX转为NPU可执行的OM格式;2)图优化技术,包括算子融合、无用节点消除等优化策略;3)实战中的典型问题,特别是动态Shape处理和非标准算子支持等常见痛点。通过BERT模型
本文通过厨房做菜的类比,形象解释了MindSpore与CANN的关系:MindSpore是AI框架,负责定义网络结构和训练逻辑;CANN是底层计算架构,负责在昇腾NPU上执行算子。文章重点阐述了二者的分工:MindSpore处理自动微分、参数更新等训练任务,CANN专注于算子执行和推理优化。特别强调了图编译机制在推理阶段的重要性,以及训练与推理的不同技术需求。最后给出明确判断标准:训练需要Mind
本文介绍了在昇腾NPU上使用AscendCL进行AI模型推理的完整流程。主要内容包括:1)AscendCL作为CANN架构的顶层接口,封装了底层Runtime和算子调度;2)环境搭建步骤,包括驱动安装和模型转换;3)详细代码示例展示从设备初始化到推理执行的完整过程;4)实际开发中常见的四个内存管理问题及解决方案;5)同步与异步执行模式的对比。文章采用实操导向的方式,重点突出了NPU推理开发中的关键
摘要:大模型推理变慢的主要原因是Attention计算存在O(n²)复杂度问题,尤其长序列场景下显存带宽成为瓶颈。昇腾NPU通过CANNops-transformer中的FlashAttention优化方案,采用分块计算和在线softmax技术,将显存读写量从O(n²)降至O(n)。结合昇腾的达芬奇架构特性(大缓存、Cube单元等)和CANN软件栈的自动优化能力,实现了128K长序列推理延迟降低5
为此,昇腾的解决思路是坚持底层架构创新,在虚拟指令集、运行时能力、编译器等坚持走自研突破,并兼容全球AI主流开源生态,同时推动CANN计算框架在架构层面,进行功能解耦与组件独立演进,从底层的硬件驱动到运行时,再到中间的编译器和上层的加速库,每一层都实现物理上的松耦合,各组件可独立升级和API的全面兼容。当CANN社区汇聚起来自各方的智慧,当开发者一次次在CANN上完成算子开发,当CANN与各大开源
2026年4月24日,DeepSeek V4-Pro和DeepSeek V4-Flash正式发布并开源,模型上下文处理长度由原有的128K显著扩展至1M,首次增加了KV Cache滑窗和压缩算法,大幅减少Attention计算和访存开销,并通过模型架构创新更好地支持了Agent和Coding场景。除了底层架构的升级,昇腾950超节点从基础器件、协议算法到光电互联,实现了系统级的创新突破,支持用户以
在PTO的设计里面,AIV 通过 TPUT_AYSNC 指令,把搬运任务转换成向 SDMA 硬件提交的传输描述符——相当于你把包裹和地址填好,交给快递员,然后回去继续工作。),如果是极小块的数据和较短的传输距离,可能还不如你自己送得快。CCU 是950代际新增的集合通信处理器单元,更像一个专门的分拣中心,你把货扔过去,它在内部完成归拢和分发。从此,计算与通信不再是割裂的两个孤岛,而是统一编程模型下
作者:张强豪(@zhangqianghao)指导:黄剑兴(@huangjianxing)分子动力学(MD)模拟在原子尺度(纳米级)已趋于成熟,但化工工业面临的真实问题往往发生在介观尺度(微米至毫米级):高分子熔体流动:原子级MD模拟10⁶个原子已是极限,而实际注塑成型涉及10¹²个粒子胶体自组装:纳米颗粒在溶液中的聚集行为,模拟时长需达毫秒级,远超MD能力范围多相流界面:油水两相的界面张力与相分离
1. 低比特推理背景知识深度学习模型在训练和推理阶段通常使用 FP32 (32位浮点数) 或 BF16/FP16 (16位浮点数) 格式。然而,随着模型规模的不断增大(尤其是大型语言模型 LLM),对计算效率、显存占用和能耗的要求也越来越高。低比特推理(Low-Bit Inference)应运而生,其核心思想是使用更少的比特位来表示模型参数(权重)和中间计算结果(激活值)。最常见的低比特格式包括
到了2025年,细粒度通算overlap技术进一步发展,实现了计算和通信的融合并发执行,适用于模型并行、序列并行、专家并行以及上下文并行等更广泛的场景,但计算和通信对计算核资源和访存带宽的竞争依然激烈。以8P Allreduce为例,总的内存带宽需求详细计算如下:在接收方向,7个端口会同时接收来自Fullmesh对端的数据,并需要排队进行求和操作,这一过程中每个端口的数据都需要读写内存一次,因此接
摘要:DeepSeek V4宣布全面迁移至华为昇腾950PR平台,取代英伟达CUDA生态。文章剖析了CUDA到CANN迁移的技术难点,包括算子接口差异、FlashAttention重写和精度对齐验证等核心挑战,并提供了昇腾开发环境配置方案。同时结合GPT-6发布背景,建议采用统一API管理平台应对供应商切换风险。文章指出,尽管昇腾950PR理论算力为H100的70%,但通过算法优化可弥补性能差距,
面对如此多元的场景需求,算子编程语言领域正在形成全新的格局:既有基于C/C++的Ascend C,也有基于Python的DSL(如PyPTO、Triton和TileLang),它们共同构建起覆盖从算法探索到生产部署的全流程生态体系。Developer模式下可自动启用硬件新特性,开发者无感知;开源社区流行的 Python-like,tiled-based DSL,语言层与硬件解耦,硬件特性由编译器完
写代码:NDDMA + SIMD/SIMT 同构,让搬运、转置、Pad 只需要一个接口调用实现。跑算子:KernelLaunch 调度行为可控制,算子启动头开销降低到百纳米。找瓶颈:10 kHz 全维度 Profiling 与代码打点,使定位从“天”缩短到“秒”。Ascend 950 已为您搭建了一条从算子概念 → 代码实现 → 性能调优 → 业务落地的无缝通道。今天就加入 CANN 生态,体验算
Ascend 950以灵衢总线为基础构建的超节点架构,在面向人工智能计算的多个核心业务场景,如大模型预训练、中心推理、后训练与强化学习、多模态内容等业务领域均可提供领先的系统能力,带来计算业务性能和资源利用率提升。两款芯片在继承上一代优秀能力的基础上,围绕计算、通信等关键维度实现多项技术突破,涵盖 NDDMA、CV 融合、SIMT、UB、CCU 等创新特性,大幅提升了大模型训练与推理、推荐、多模态
CANN开源社区首个聚焦材料化学工程的开源组织Material Chemical Engineering SIG(材料化学工程特别兴趣小组,以下简称“MCE SIG”)正式发布由Committer (@Magic_LF)提交的首个科学计算算子LJForceFused,该算子采用Ascend C原生开发,并已成功应用实践于中国石油集团材料设计场景,实现了学术研究工具到工业落地的闭环验证,打通了底层算
在昇腾AI 处理器的算子开发领域,Catlass 的出现标志着一个重要的转折点。它不再要求开发者从零开始通过 Ascend C 构建复杂的矩阵运算逻辑,而是提供了一套基于模板元编程的高性能算子开发范式。本篇文章我将深入剖析 Catlass 的编程范式,帮助开发者理解其核心设计思想,从而快速上手高性能算子开发。