登录社区云,与社区用户共同成长
邀请您加入社区
很多人第一眼看到MTT AICUBE,可能会以为它是一台迷你主机或者网络硬盘。但实际上,它是一台集“全域智能体+AI PC+AI NAS”三位一体的家庭AI中枢。它的核心灵魂,是一个叫做 “小麦”的全域智能体。
问:这些显存调优方法你平时怎么落地操作?量化:优先离线把模型转成 INT4-AWQ 权重,vLLM/TRT-LLM 启动时指定量化参数,直接降低基础显存占用;H100/H200 会开启 FP8。KV Cache:严格配置限制上下文,设置在 0.7~0.85 预留空间,多卡场景用张量并行自动分片 KV。超大模型:34B/70B 采用 TP/PP 多卡并行拆分权重,突破单卡显存上限。泄漏与碎片:日常用
6月12日,MiniMax新一代原生多模态旗舰模型 M3正式开源。同日,摩尔线程旗舰级AI训推一体智算卡MTT S5000已完成对该模型的Day-0极速适配。这是国产大模型与国产算力芯片完成适配的又一例证,也彰显了摩尔线程凭借原生FP8算力底座与高效MUSA软件生态,对前沿大模型需求的即时响应与稳定支撑能力。
6月12日,作为国内领先的国产全功能GPU企业,摩尔线程深度参与第八届北京智源大会,多位技术专家在多个论坛及Open Talk环节发表演讲,系统呈现覆盖“云-边-端”的软硬协同全栈创新成果。
国产AI生态发展迅速,企业关注点已从硬件选型转向实际部署能力。当前主流国产开源模型(DeepSeek、Qwen等)和推理框架(vLLM、LMDeploy等)已完成初步适配,RAG知识库系统已具备成熟落地条件。文章剖析了企业AI系统的全栈层级,指出软件生态兼容性比硬件参数更关键,并揭示部署中最易踩的三个坑:忽视软件兼容性、未做性能验证、忽略运维体系。目前国产AI在知识库等场景已无障碍,但Agent等
近日,摩尔线程正式发布并开源面向GPU底层算子生成的专用代码大模型MusaCoder。这是业内首个基于国产GPU算力底座完成全链路训练与验证的开源代码大模型,其完整后训练流程均在基于MTT S5000构建的夸娥智算集群上完成。
所谓 Mailbox,是指 GPU 内部集成了一组专用于跨设备握手的 Mailbox Control Registers。真正的业务数据仍走标准 PCIe Transaction Layer Packet(TLP),不会在宽度仅为 32-bit 级别的 Mailbox Regs 上逐片搬运。
OrionX社区版发布:轻量级AI算力池化解决方案助力企业降本增效 摘要:OrionX社区版推出轻量级AI算力资源池化方案,解决企业GPU利用率低、运维复杂等痛点。该方案支持算力与显存独立切分及超分技术,单卡可并行多任务,提升资源利用率300%以上;具备智能调度系统实现资源自动分配回收;提供可视化监控和开放API接口,简化运维并支持二次开发。产品部署简便,兼容主流硬件和CUDA应用,适用于各类规模
CPU是通才,GPU是并行计算专家(训练主力),TPU是Google的机器学习专用芯片,NPU是端侧AI推理的省电小能手。训练大模型看 GPU/TPU,手机本地AI看 NPU,日常通用任务看 CPU。
英伟达在2026年GTC大会上发布多项重磅技术,宣告智能体(Agent)驱动的新计算时代到来。CEO黄仁勋在台北主场推出Vera Rubin超级计算平台、专为智能体设计的Vera CPU,以及重塑PC概念的RTX Spark设备。其中,Vera Rubin采用3纳米工艺和极速组装技术,Vera CPU突破传统架构实现超高单线程性能,RTX Spark则首次将本地化AI助手融入个人电脑。大会还展示了
metadata:spec:amiFamily: Bottlerocket # 安全精简 OS,GPU 驱动内置- deviceName: /dev/xvda # 系统盘ebs:- deviceName: /dev/xvdb # 模型数据盘(从 Snapshot 恢复)ebs:snapshotID: snap-0xxxxxxxxxx # ⚡ 预加载模型权重的快照httpTokens: requir
GPU之外,立讯精密想吃下AI数据中心的"连接生意"
核心优势架构NVLink+InfiniBand 双高速互联,解决 200+GPU 间通信瓶颈叶脊拓扑提供无阻塞带宽,支持大规模扩展液冷散热保障高密度部署稳定性K8s+NVIDIA AI Enterprise 实现智能化管理后续优化方向考虑 BlueField DPU 卸载网络和存储流量,释放 CPU 资源实施混合精度训练和模型并行,充分利用集群算力探索 AI Workflow 自动化,提升资源利用
打 Kaggle 或国产大模型比赛,进入冲刺阶段,团队成员要同时跑不同的特征工程和模型融合方案。租云 GPU 成本飙升,一个月花掉好几千,团队预算吃紧。把团队已有的几张消费级显卡(如 4090)通过 OrionX 池化成一个虚拟算力池。显存超分技术让每张卡能支撑更大 batch size 或更高分辨率输入。成员按需申请算力,跑完即释放,避免资源闲置。云 GPU 租用成本降低 60%并行实验数量翻倍
GPU是通用并行计算主力,生态成熟,适合训练和云端推理。NPU是专用能效芯片,为边缘端低延迟场景设计。TPU是谷歌云端专用处理器,与TensorFlow深度集成。价格上,GPU和NPU可采购,TPU仅支持租赁。部署时,GPU代码相对通用,而NPU部署需将模型转换为专用格式并调用特定SDK,无法直接“翻译”GPU代码。开发者需根据云端/边缘、生态、能效和成本需求进行选择。
深度学习模型优化中的算子融合技术 算子融合是提升深度学习模型推理性能的关键技术,通过合并多个连续算子为单一复合算子,显著降低内存访问和调度开销。本文深入分析了算子融合的原理与实现: 性能瓶颈:揭示了内存墙(数据搬运速度远低于计算速度)和调度开销(内核启动成本高)两大核心问题 数学原理:以Conv-BN-ReLU为例,展示了如何通过数学等价变换将三个算子合并为一个,减少中间结果的内存存储 实现优势:
斯坦福 HAI 2026 报告警示 AI 能耗正以惊人速度增长。与此同时,宾大团队创造出光-物质混合粒子,有望将 AI 计算能耗降低几个数量级。本文从 AI 能耗数据分析、光学计算原理、量子模拟代码三个维度,解读这场可能颠覆 GPU 格局的硬件革命。
NVIDIA在GTC 2026发布全新Rubin平台,六大芯片协同设计:Vera CPU 88核Arm架构、Rubin GPU 336B晶体管50 PFLOPS算力、NVLink 6单机架260TB/s带宽、推理Token成本较Blackwell降10倍。OpenAI/Anthropic/Meta/xAI全数采用,2026下半年量产。
这种自主性的下降,意味着厂商不再是新硬件标准的定义者,而是 NVIDIA 标准的追随者。
为了让角色动起来自然,对于 Live2D 模型师和动画师来说需要把一张完整的插画抠得七零八落:刘海、后发、眼睛、衣服、配饰全都要分层,还要发挥想象力把被遮挡的身体部位重新画出来……这一套流程下来,简直是“掉头发”级别的折磨。然而【See-Through】上传一张动漫角色插画,自动将其分解为带有深度排序、完整修复的语义图层,并导出为分层 PSD 文件。
本文介绍了一套轻量化GPU监控方案,专为个人深度学习主机和家用NVIDIA显卡设计。针对企业级DCGM方案不适合消费级显卡的问题,推荐使用社区版nvidia_gpu_exporter工具,配合Prometheus和Grafana实现简单高效的监控。文章详细讲解了从环境准备、Docker部署到Grafana看板配置的全过程,重点解决了常见的数据空白、时区错位等问题,并提供了适配消费级显卡的专用看板I
本文基于 NVIDIA Deep Learning Institute 的《在生产环境大规模部署 RAG 工作流》课程,围绕 NIM、RAG、K8s/Helm/Operator、监控弹性、多模态与 Agentic AI 等主线,从工程实践角度总结课程内容,并结合 Mirror 平台的实际场景提供启发。
MatAnyone2是由南洋理工大学S-Lab和商汤科技联合开发的视频抠图框架。该技术采用记忆传播机制,通过区域自适应记忆融合实现稳定的视频抠像效果,能精准处理发丝等细节。其特点包括首帧锁定目标、智能记忆稳定和超清细节处理,适用于视频背景替换、直播特效、电影制作等场景。项目已在GitHub开源,并在趋动云平台提供一键部署服务,支持快速体验。该技术突破了传统视频抠图需要逐帧调整的限制,实现了自动化高
本文探讨了GPU如何成为大语言模型(LLM)的核心硬件,并分析了相关优化技术。首先对比了CPU与GPU的差异,指出GPU的大规模并行特性天然适合LLM的矩阵运算需求。随后详细解析了A100的层级结构、Tensor Core设计原理,以及GPU的SIMT执行模型和分层内存架构。重点阐述了常见优化手段:低精度计算减少数据搬运、算子融合降低中间结果存储、重计算节省显存、内存合并提高访问效率、分块提升数据
经验沉淀、UWA AI双助力,攻坚排障更高效
AI大模型最近火得不行,聊天、画图、写代码,样样精通。这些AI到底跑在什么硬件上?那些动辄千亿参数的模型,靠什么“脑力”运转?答案就在指甲盖大小的硅片上——AI芯片。这篇文章,我会用最通俗的语言,带你搞懂AI芯片的前世今生:GPU凭什么从“游戏显卡”变成“AI心脏”?NPU又是什么新鲜事物?英伟达真的无人能敌吗?以及,未来的AI芯片会走向何方?读完这篇,你就有了在饭桌上聊AI硬件的资本。从2012
摘要:曾经估值40亿美元的环保跑鞋品牌Allbirds在业绩持续下滑后,于2026年3月以3900万美元"跳楼价"出售鞋履业务,随即宣布转型AI算力租赁,公司更名为NewBirdAI。这一"极限求生"操作引发股价单日暴涨721%,市值从2100万飙升至1.845亿美元。然而分析指出,该公司既无技术积累又缺资金实力(仅融资5000万美元),实质是利用上市壳资源
近两年,AI发展迅速,大模型参数激增,算力不断提升,但内存带宽成为关键瓶颈。HBM(高带宽内存)通过3D堆叠DRAM、TSV互联和硅中介层封装,大幅提升数据吞吐率,降低延迟和功耗,成为AI芯片和超级计算机的核心内存技术。了解HBM,有助于掌握GPU架构、算力基础设施及未来AI硬件趋势。
本文系统解析了GPU资源超分技术的原理与实践,旨在解决AI算力紧缺环境下GPU利用率低下的问题。文章首先分析了GPU利用率低下的典型场景和传统调度方案的局限性,随后详细介绍了资源层GPU超分的技术体系,包括算力超分、显存超分和优先级调度等核心技术。通过对比顺丰EGPU、腾讯vCUDA和阿里云cGPU等主流方案,阐述了不同超分技术的优缺点。在落地实践部分,提出了从业务评估到规模化推广的三步走策略,并
研究人员优化分布式训练工具,使其在弹性结构适配器网络接口上高效运行。大多数现代自然语言处理应用都构建于预训练语言模型之上,这些模型编码了整个语言的词序列概率。随着时间的推移,这些模型规模越来越大,参数数量达到数十亿甚至数万亿。要在合理的时间内训练这些模型,需要非常庞大的计算集群,其巨大的通信量可能会阻塞计算,导致GPU利用率低下或效率不高。因此,需要仔细管理GPU之间的通信,以避免其成为性能瓶颈。
随着NVIDIA于2024年底正式发布NVIDIA App并宣布其全面替代经典的GeForce Experience与NVIDIA控制面板,NVIDIA显卡用户迎来了 unified GPU控制中心的新时代。本文作为系统性使用教程,深入解析NVIDIA App的核心功能架构,涵盖驱动管理、游戏图形优化、系统性能监控、AI滤镜应用以及ShadowPlay录制等关键模块的操作方法。
于是cc作为LLM大模型的手,做事情,然后把执行结果返回给大模型。这些功能都是claude code假设有一个顾问很聪明,然后他也知道怎么管理顾问的表达语言让他能够懂,然后然顾问做解决方案,用cc的规则表达要做的事情,然后作为执行agent,执行数据后给LLM。claude code是在告诉大模型他的工具机制,我支持工具是bash命令行,这个工具有3个属性,第一个是命令并且是字符串,第二个=有超时
本文介绍了在Windows系统下使用NVIDIA GPU加速大模型推理运算的配置方法。核心步骤是通过设置环境变量CUDA_VISIBLE_DEVICES来指定使用的GPU设备。文章提供了三种配置方式(CMD、PowerShell和图形界面),其中CMD方式最为简洁。配置完成后,重新启动Ollama进程即可启用GPU加速。文中强调该变量是官方唯一确认有效的GPU配置参数,并澄清了其他网传环境变量的不
本文详细介绍了如何通过趋动云API+OpenClaw调度+飞书同步实现高效AI开发。教程包含:1)OpenClaw在macOS/Windows的本地部署方法;2)趋动云模型接入配置流程;3)飞书机器人创建与权限配置;4)OpenClaw飞书插件安装步骤。通过这套方案,开发者可突破Token计费限制,实现模型调用、任务调度与团队协作的无缝衔接。教程还附赠新年福利:充值最高返25%算力金,助力开发者高
本文深入解析DevUI虚拟滚动引擎在十万级数据渲染场景下的核心技术原理与工程实践。通过动态节点池管理、GPU加速合成层和分时切片渲染三大核心策略,成功将20万行数据表格的渲染耗时从14.3秒优化至0.8秒。文章详细阐述了滑动窗口算法、三层架构模型等关键技术实现,并结合云控制台真实案例,提供了完整的性能优化方案、故障排查方法和前瞻性思考,为大规模数据渲染场景提供了可复用的技术蓝图。