登录社区云,与社区用户共同成长
邀请您加入社区
无论是每一场演讲结束后的问答环节,还是茶歇时间与最后的自由交流时段,现场的交流都格外踊跃:有人关心 Agent 优化工作流在全新架构模型上能否稳定复现,有人追问 KDA 算子的矩阵求逆如何在 Cube 上高效实现、PyPTO 底层是否生成 Ascend C 代码,也有人围绕 DSpark 多流并行是否带来 Cube 抢占、Longcat 2.0 是否做了 KV Cache offload 等工程细
—读取项目状态、规划修改、执行代码、跑通测试、部署验证,在试错中迭代,验证后才交付。个人 AI 系统不是堆叠 Agent,而是跑通一条可控、可验证的闭环:明确目标 → 准备上下文 → 按复杂度路由 → Codex 执行 → 测试验证 → 记忆沉淀。他最后总结了六条原则:从高频任务切入;按复杂度选内核;先定义完成标准;验收看结果不看过程;让经验持续积累;关键环节保留人工审批。
当前,企业 AI 训练推理、数据分析平台与智能化应用场景持续拓展,数据规模快速增长,对数据基础设施的稳定性、扩展性和多平台适配能力提出了更高要求。该方案面向智算中心、科研计算、智能制造、具身智能、企业知识库、多模态数据管理等典型场景,围绕数据采集、存储、流动、调度和使用的全流程需求,提供覆盖训练、推理与数据全生命周期管理的数据基础设施能力。构建在多集群及异构存储之上的对象虚拟化与数据流动平台,通过
摘要 本文深入解析了华为CANN架构中的图引擎(GE)工作原理,重点介绍了GE如何将PyTorch/MindSpore模型转换为NPU可执行指令。GE作为CANN的核心组件,主要完成四个关键任务:图解析、图优化、调度生成和指令发射。文章详细阐述了计算图中间表示(IR)的构建方式,包括算子节点和依赖关系的定义。特别强调了图优化Pass的重要性,通过常量折叠和算子融合等优化技术,将多个小算子合并为高效
本文详细介绍了在昇腾NPU上运行PyTorch模型的全流程,包括环境配置、模型转换和推理部署。主要内容: 环境准备:检查硬件与软件版本对应关系,安装驱动和CANN工具包,配置环境变量。 工具安装:使用pip安装asc-devkit工具链,建议创建conda隔离环境,安装PyTorch NPU版本。 模型转换: 从PyTorch导出ONNX模型 使用asc-devkit或ATC命令行将ONNX转换为
本文介绍了基于CANN优化的电力负荷预测推理方案elec-ops-prediction。该方案针对传统LSTM模型推理速度慢的问题,提供了一套完整的时序预测流程。文章首先分析了电力系统不同时间尺度的预测需求(超短期、短期、中期、长期)及其精度要求,详细说明了输入特征构成,包括历史负荷、时间特征、气象特征和经济指标等。随后展示了elec-ops-prediction的算子库架构,包含特征提取、推理和
昇腾AI开发者峰会2026在京成功举办,聚焦"共赴昇腾同耀光芒"主题。华为专家分享了昇腾950芯片在AgenticAI时代的超节点架构创新,包括优化EP通信、KVCache等关键技术。峰会重点展示了昇腾软件生态的易用性提升:CANN全面开源开放,支持多种编程范式;兼容主流开源生态;Mind系列软件全面升级。华为宣布全面升级开发者使能计划,提供免费算力资源和创新激励基金,并表彰了
在昇腾硬件之上,华为提供了异构计算架构,它是连接上层AI框架与底层昇腾硬件的桥梁。对上支持多种AI框架,对下服务AI处理器与编程,发挥承上启下的关键作用,是提升昇腾AI处理器计算效率的关键平台。昇腾AI软件栈驱动:提供硬件访问能力。昇腾AI处理器运行时(AscendCL):提供运行时API,用于资源管理、任务调度等。昇腾AI任务调度器:负责任务在CPU和NPU(Neural-network Pro
本文介绍了SenseVoice语音识别系统的环境配置与部署流程。首先详细说明了系统所需的软件依赖(HDK24.1、cann8.1等)和安装步骤,包括funasr、aclruntime等包的安装。接着展示了模型转换过程:从pt格式转换为onnx,再转为om格式。重点描述了API服务封装方案,使用FastAPI构建服务接口,集成VAD模块进行语音端点检测,并支持多语言识别功能。最后介绍了服务验证方法,
【24小时技术动态速览】国产AI与RISC-V生态双突破 1️⃣ 国产算力崛起:DeepSeek V4全栈适配华为昇腾,8家国产芯片厂商同步官宣支持,昇腾950PR推理性能达英伟达H20的2.87倍,美团万亿参数大模型完成国产算力训练。 2️⃣ RISC-V车规突破:SiFive与HighTec合作汽车安全软件工具链,烽火通信FuXi2360芯片通过ASIL-D认证并量产装车,IAR工具链新增车规
五一假期期间,全球科技领域迎来多项里程碑式突破:国产AI算力实现重大突破,DeepSeek-V4完成对昇腾950等国产芯片的全栈适配,推理性能提升35倍;中国五大车企联合成立RISC-V车规芯片专委会,推动汽车芯片自主可控;AI编程工具格局生变,OpenAI向开发者赠送10倍Codex用量额度争夺市场;太空算力进入工程化阶段,"三体计算星座"完成在轨组网;半导体行业持续高景气,
为此,昇腾的解决思路是坚持底层架构创新,在虚拟指令集、运行时能力、编译器等坚持走自研突破,并兼容全球AI主流开源生态,同时推动CANN计算框架在架构层面,进行功能解耦与组件独立演进,从底层的硬件驱动到运行时,再到中间的编译器和上层的加速库,每一层都实现物理上的松耦合,各组件可独立升级和API的全面兼容。当CANN社区汇聚起来自各方的智慧,当开发者一次次在CANN上完成算子开发,当CANN与各大开源
在算力资源有限,且模型支持链式调用或不严格并发要求时,基于模型睡眠进行快速切换收益还是可观的。但是因为启动服务时增加了,vllm暴露的接口非常多,建议正式服务化前再惊醒一次封装。vLLM Sleep 模式文档HCCL文档。
当前CANN软件支持通过离线安装run格式软件包、Conda、Yum、Apt-get和Pip在线安装,不同的安装类型获取软件包的方式不同,请参考本节内容进行获取。下载下表所示软件即表示您同意的条款和条件。独立软件包清单软件类型软件包说明软件包名称获取链接昇腾NPU驱动部署在昇腾AI处理器,用于管理查询昇腾AI处理器,同时为上层CANN软件提供处理器控制、资源分配等接口。
本文档针对DeepSeek-V4-PRO模型,提供昇腾910B多机多卡级联(分布式部署)及大EP(Extended Processing)架构的标准化部署实操流程,覆盖环境准备、架构配置、模型部署、功能验证、故障处理全环节,为技术实施人员提供可落地的操作指导,确保部署过程平稳高效,充分发挥多机多卡级联的算力优势及大EP架构的性能提升作用,满足生产环境高并发、高吞吐量的推理需求。
本文档针对 DeepSeek V4-Flash 大模型(MoE架构,总参数量284B,激活参数量13B),基于昇腾910B单机8卡硬件环境,提供从环境准备、模型下载、部署启动到接口验证、故障排查的全流程详细指导,适配私有化部署、企业内网推理、AI业务测试等场景,确保方案可直接落地、部署高效稳定。
4月24日,DeepSeek-V4发布,模型支持百万字超长上下文,在 Agent 智能交互、通用世界知识与逻辑推理能力方面,综合性能位居国内及开源领域前列。昇腾MindStudio 模型量化工具支持模型W8A8量化,适配昇腾A2、A3及950全系列产品,实现模型轻量化部署,进一步提升推理性能。
2026年4月24日,DeepSeek V4-Pro和DeepSeek V4-Flash正式发布并开源,模型上下文处理长度由原有的128K显著扩展至1M,首次增加了KV Cache滑窗和压缩算法,大幅减少Attention计算和访存开销,并通过模型架构创新更好地支持了Agent和Coding场景。除了底层架构的升级,昇腾950超节点从基础器件、协议算法到光电互联,实现了系统级的创新突破,支持用户以
在PTO的设计里面,AIV 通过 TPUT_AYSNC 指令,把搬运任务转换成向 SDMA 硬件提交的传输描述符——相当于你把包裹和地址填好,交给快递员,然后回去继续工作。),如果是极小块的数据和较短的传输距离,可能还不如你自己送得快。CCU 是950代际新增的集合通信处理器单元,更像一个专门的分拣中心,你把货扔过去,它在内部完成归拢和分发。从此,计算与通信不再是割裂的两个孤岛,而是统一编程模型下
今日科技领域关键动态:1️⃣月之暗面开源KimiK2.6模型,在软件工程领域多项基准测试超越GPT-5.4,支持300子Agent并行执行4000步任务;2️⃣英飞凌宣布2027年AURIX车用MCU集成RISC-V架构,行业龙头转向开源架构;3️⃣腾讯云开源CubeSandbox沙箱服务,实现硬件级隔离与亚百毫秒启动;4️⃣工信部支持太空算力研究,我国智能算力规模达1882EFLOPS;5️⃣武
本文介绍了昇腾NPU设备的容器化使用方法,主要包括两种挂载方式:物理挂载模式(需手动指定设备)和Runtime模式(自动挂载)。详细说明了虚拟NPU的创建流程,包括查询模板、创建vNPU、查看信息和删除操作。提供了Docker环境配置指南,包括二进制安装、Runtime配置和启动验证。最后给出了虚拟卡申请、挂载示例和常用管理命令。全文涵盖了从硬件虚拟化到容器集成的完整操作流程,适用于昇腾AI处理器
国产算力正在从‘替代’走向‘超越’,从单点突破演变为体系化作战。国产算力实现历史性突破——DeepSeek V4、阿里通义、字节豆包等头部大模型全面完成从CUDA到CANN的全栈迁移,标志着中国AI彻底摆脱外部算力封锁昇腾950PR推理成本降至英伟达1/70——这是国产算力从“可用”走向“好用、规模化”的关键节点,万亿Token级任务的规模化落地正在成为现实半导体涨价潮全面蔓延——从晶圆代工到MC
作者:张强豪(@zhangqianghao)指导:黄剑兴(@huangjianxing)分子动力学(MD)模拟在原子尺度(纳米级)已趋于成熟,但化工工业面临的真实问题往往发生在介观尺度(微米至毫米级):高分子熔体流动:原子级MD模拟10⁶个原子已是极限,而实际注塑成型涉及10¹²个粒子胶体自组装:纳米颗粒在溶液中的聚集行为,模拟时长需达毫秒级,远超MD能力范围多相流界面:油水两相的界面张力与相分离
1. 低比特推理背景知识深度学习模型在训练和推理阶段通常使用 FP32 (32位浮点数) 或 BF16/FP16 (16位浮点数) 格式。然而,随着模型规模的不断增大(尤其是大型语言模型 LLM),对计算效率、显存占用和能耗的要求也越来越高。低比特推理(Low-Bit Inference)应运而生,其核心思想是使用更少的比特位来表示模型参数(权重)和中间计算结果(激活值)。最常见的低比特格式包括
到了2025年,细粒度通算overlap技术进一步发展,实现了计算和通信的融合并发执行,适用于模型并行、序列并行、专家并行以及上下文并行等更广泛的场景,但计算和通信对计算核资源和访存带宽的竞争依然激烈。以8P Allreduce为例,总的内存带宽需求详细计算如下:在接收方向,7个端口会同时接收来自Fullmesh对端的数据,并需要排队进行求和操作,这一过程中每个端口的数据都需要读写内存一次,因此接
如何通过jiuwenclaw平台集成CANN Skills技能库(14个Ascend开发相关技能模块)和智能代理,帮助开发者提升NPU开发效率。提供了docker和pip两种安装方式,并演示了模型服务化配置方法。该系列适合昇腾NPU平台开发者,可实现"动嘴指挥AI助手完成算子开发"的高效工作模式。
摘要:本文揭示昇腾AI芯片的核心价值并非简单对标海外GPU,而是基于本源底层重构算力-感知-执行全链路智能耦合体系。指出当前行业存在三大认知误区:参数对标、算力堆砌和通用计算思维。提出昇腾的四大落地框架方向:智能感知中枢、本源耦合原则、全栈自主路径和国产标准制定。强调其国家战略价值在于打破西方垄断、支撑高端制造、引领技术范式转换和夯实科技自立根基。作者严守核心技术机密,仅作认知纠偏,坚持"
最近几年来,随着大模型在自然语言处理、代码生成和知识问答等领域的快速发展,0Day 模型凭借其前沿算法和大规模参数优势,成为开发者进行高性能推理和实验的重要选择。但是像这些模型对算力资源的要求都比较高,以往的GPU在部署这类模型的时候容易出现性能下降,算力不足等问题。昇腾 NPU 提供了强大的 AI 加速能力,其高带宽内存架构和算子优化,为大模型推理提供了理想平台。我选择了vLLM-Ascend版
面对如此多元的场景需求,算子编程语言领域正在形成全新的格局:既有基于C/C++的Ascend C,也有基于Python的DSL(如PyPTO、Triton和TileLang),它们共同构建起覆盖从算法探索到生产部署的全流程生态体系。Developer模式下可自动启用硬件新特性,开发者无感知;开源社区流行的 Python-like,tiled-based DSL,语言层与硬件解耦,硬件特性由编译器完
写代码:NDDMA + SIMD/SIMT 同构,让搬运、转置、Pad 只需要一个接口调用实现。跑算子:KernelLaunch 调度行为可控制,算子启动头开销降低到百纳米。找瓶颈:10 kHz 全维度 Profiling 与代码打点,使定位从“天”缩短到“秒”。Ascend 950 已为您搭建了一条从算子概念 → 代码实现 → 性能调优 → 业务落地的无缝通道。今天就加入 CANN 生态,体验算
Ascend 950以灵衢总线为基础构建的超节点架构,在面向人工智能计算的多个核心业务场景,如大模型预训练、中心推理、后训练与强化学习、多模态内容等业务领域均可提供领先的系统能力,带来计算业务性能和资源利用率提升。两款芯片在继承上一代优秀能力的基础上,围绕计算、通信等关键维度实现多项技术突破,涵盖 NDDMA、CV 融合、SIMT、UB、CCU 等创新特性,大幅提升了大模型训练与推理、推荐、多模态
CANN开源社区首个聚焦材料化学工程的开源组织Material Chemical Engineering SIG(材料化学工程特别兴趣小组,以下简称“MCE SIG”)正式发布由Committer (@Magic_LF)提交的首个科学计算算子LJForceFused,该算子采用Ascend C原生开发,并已成功应用实践于中国石油集团材料设计场景,实现了学术研究工具到工业落地的闭环验证,打通了底层算
今天,我们一起把当下最火的 Pi0 机器人视觉-语言-动作大模型,完完整整地部署在国产算力平台上,也就是华为的昇腾 Atlas 800I A2 服务器上。