登录社区云,与社区用户共同成长
邀请您加入社区
在使用 PyTorch 训练模型并通过 ONNX Runtime 进行 C++ 部署时,遇到 CUDA、cuDNN 和 ONNX Runtime 版本选择的问题。例如:PyTorch 使用 CUDA 11.3PyTorch 使用 cuDNN 8.3.2系统安装 CUDA 11.3系统安装 cuDNN 8.2.0此时部署 ONNX Runtime 时应该选择什么版本?
本节介绍了使用 PyTorch Profiler 工具分析 MNIST 手写数字识别模型在 CPU 与 GPU 上的推理性能。通过记录操作执行时间与内存消耗,可识别计算瓶颈和内存问题。通过本节学习,能够掌握在模型推理过程中进行性能分析的方法,从而能更准确地评估模型在 CPU 和 GPU 上的运行表现。
本篇文章讲一讲机器学习和深度学习模型算法常用的交叉熵损失,它的变形,以及常见应用场景和pytorch的代码适配情况(部分),很多都是自己做实践做项目和学习过程中的心得总结与经验分享,希望大家认真阅读。
本文记录了作者在Text-to-CAD检索模型训练过程中遇到的严重问题及排查过程。模型训练表面正常(loss下降、保存checkpoint),但测试指标异常低下(R@1仅0.013%)。经排查发现:1)BRepEncoder权重出现大量NaN值,源于AMP混合精度中的GradScaler静默跳过NaN梯度更新;2)预训练权重加载时complex类型张量引发初始化问题。作者通过添加NaN检测、修复权
本文深度解析一款基于Vue+FastAPI+PyTorch+通义千问的工业智能监控系统,采用本地深度学习+云端大模型双AI架构,实现工业轴承振动故障识别与AI运维问答。从架构设计、模块分工、接口交互、核心代码四个维度拆解项目,同时分析双AI架构在工业场景的落地优势,附完整部署代码与排错方案。
• 第一,先选硬件后端,再复制安装命令。• 第二,CPU 版最稳,CUDA 版最主流,ROCm 要看兼容,MPS 适合 Mac 本地调试。• 第三,安装成功不等于 GPU 可用,必须用代码验证。• 第四,is_available 返回 False 时,优先排查 wheel、驱动、设备可见性。• 第五,显存和 CUDA 报错有异步与缓存机制,不能只看表面。下一章开始进入 PyTorch 的真正核心:
记住 5 句话。✓PyTorch 的核心数据结构是 Tensor。✓训练能跑起来,靠的是 Autograd 自动求导。✓模型能被组织起来,靠的是 nn.Module 的注册机制。✓速度能上去,靠的是底层 C++ / ATen / 设备后端。✓PyTorch 好用,是因为它把 Python 友好性和底层高性能结合在了一起。下一章,我们开始进入第一个硬核组件:Tensor。你会看到 Tensor 不只
很多初学者容易把人工智能、机器学习、深度学习混为一谈。今天我们就从概念到起源,彻底理清这三者的关系。🧠 一、AI、ML、DL:从大到小,层层包含🤖 人工智能(Artificial Intelligence,AI)人工智能是最大的概念,它致力于让机器模仿人类的智能行为——像人一样推理、学习、决策、理解语言等。AI 是一个多学科交叉的领域,涵盖机器人、专家系统、计算机视觉、自然语言处理等众多方向。
大模型术语名词解释
本文介绍了基于MONAI 3D U-Net的腹部CT多器官分割项目,该项目实现了从3D NIfTI数据预处理到多器官分割的完整流程。作者详细阐述了3D医学影像处理的关键环节,包括数据方向统一、体素间距标准化、HU值归一化以及patch训练策略。项目使用BTCV数据集,验证集平均Dice达78%,测试集69.32%。文章重点分析了3D与2D医学分割的核心差异,强调空间信息处理和工程配置的重要性,并指
摘要:本项目分享了一个基于YOLOv8的工业表面缺陷智能检测系统,采用PyTorch+YOLO+Streamlit技术栈实现。系统包含五大功能模块:仪表盘总览、智能缺陷检测、数据统计分析、告警中心和模型管理,支持轻量化模型边缘部署。开发环境为Python3.8+Pycharm,使用Django后端框架,通过Streamlit启动可视化界面。该系统虽为教学项目,但完整实现了从检测到分析的工业质检全流
本文介绍了一个基于深度学习的药用植物识别系统,使用ResNet50模型和迁移学习技术,实现对98类药用植物的高精度自动识别。系统Top-1准确率达95.07%,Top-5准确率达99.26%。项目采用PyTorch框架,结合RandAugment、MixUp、CutMix等数据增强技术,以及AdamW优化器和余弦退火学习率调度策略。数据集包含10,813张图像,通过分层抽样划分为训练集(70%)、
本文介绍了PyTorch中DataParallel的使用方法和原理,帮助用户在多GPU上加速模型训练。主要内容包括: 核心概念 DataParallel适用于多GPU训练,自动拆分输入数据并合并结果 工作原理:将batch数据均匀分配到各GPU,并行计算后合并 使用步骤 检测GPU数量 用nn.DataParallel包装模型 将模型和数据移至GPU设备 正常训练流程 注意事项 batch_siz
本文摘要:文章介绍了图像分类任务的模型训练流程。首先通过PyTorch的数据增强方法(随机翻转、旋转、颜色调整等)对宠物图片数据集进行预处理,并使用ImageFolder加载训练和测试数据。接着构建了一个包含卷积层、批归一化和ReLU激活函数的CNN模型,输入为150x150的RGB图像。数据加载部分展示了如何通过DataLoader实现批量处理,并提供了可视化方法检查不同类别的样本。整体流程涵盖
本文详细介绍了基于PyTorch实现20类食物图像分类的完整流程。首先通过自动生成标签文件建立图片路径与分类标签的映射关系;接着自定义Dataset类实现数据读取与预处理;然后搭建包含三组卷积块的CNN网络结构;最后完成模型训练与评估。项目采用标准工业流程,涵盖数据准备、模型构建、训练优化等关键环节,并提供了Windows环境下的中文路径乱码解决方案。代码实现注重可复用性,支持自动选择GPU加速,
本篇是我训练营的第五次学习,主要目标是使用 PyTorch 实现一个运动鞋品牌识别任务(Adidas vs Nike)。P1 周跑通了 MNIST 手写数字识别、P2 周理解了 CIFAR10 彩色图片和 CNN 的 shape 变化、P3 周掌握了本地自定义数据集的加载和 BatchNorm、P4 周学会了保存最佳模型和单张图片预测,本周的任务则在前面四周的基础上,重点学习动态学习率的设置方法,
个人总结:本周学习了动态学习率,在之前自由探索的基础上,理解起来比较容易。模型调优时,通过改变学习率初值和dropout层位置使测试集准确率达到84%,但依旧存在过拟合。milestones:是一个关于epoch数值的list,表示在达到哪个epoch范围内开始变化,必须是升序排列。step_size:是学习率衰减的周期,每经过每个epoch,做一次学习率decay。gamma:学习率衰减的乘法因
本周重点学习了动态学习率和模型过拟合后怎么办,动态学习率主要是为了保证在模型训练过程中在早期能够提升学习效率,在后期能够避免错过最佳模型。而在模型训练过程中,过拟合现象相对常见,在面对过拟合时要如何处理也是一个重要的工程。
ResNet 核心为残差结构 + 短路连接,解决了深层网络梯度消失与网络退化问题,让超深网络得以训练。版本选型建议:追求速度选 ResNet18,工业落地首选 ResNet34/ResNet50,高精度场景使用 ResNet101/152。工程落地核心思路:预训练迁移学习 + 数据增强 + 正则化,实际项目几乎不会从零开始训练。拓展应用:ResNet 是计算机视觉通用骨干网络,可嵌入 YOLO、S
个人总结:这一周主要就是实现了resnet34的一个模型识别x光肺炎,主要学到了一个就是残差块的构建,并且以及对于resnt模型的直接调用冻结微调等操作。后续也是借助ai写了一下resnt34的代码。基本上可以手动实现。
这个项目对我最大的价值,不是单纯得到一个 94%–95% 的 Dice,也不是证明 2D U-Net 有多强,而是让我第一次完整走完了医学影像分割项目的基本流程。从猫狗大战到脾脏分割,任务从分类变成了像素级预测;数据从普通图片变成了 CT volume;输出从类别标签变成了 mask;评价指标从 accuracy 变成了 Dice;模型也从分类网络变成了 encoder-decoder 结构的 U
PyTorch3D是Facebook AI Research开源的高效3D深度学习工具库,基于PyTorch生态提供三角网格处理、可微渲染、点云操作等核心功能。其亮点包括支持异构批处理的网格数据结构、GPU加速的网格运算、可微分光栅化渲染器,以及用于神经隐式表示的Implicitron框架。该库已应用于Mesh R-CNN等研究项目,并支持3D重建、纹理迁移等任务。虽然性能不及专业图形引擎且依赖P
classes是列表,CIFAR10出生时自带,可以将label转化成name,比如label=1时,train_set.classes[label]是飞机.train_set[0],train_set对象正常不能[0],由于train_set[0]等价于train_set.train =True,(True,表示训练集,false,表示测试集)测试集:10,000张图片,每个类别有1,000张,
有gpu最好还是去英伟达显卡安装带 CUDA 的 PyTorch,amd显卡也能跑,可惜我ubuntu已经装了24.10,只做学习用途就不重装系统了。
python运行# 自定义全连接神经网络,继承nn.Module# 展平层:将 1*28*28 图片转为一维向量 784# 第一层全连接:784 -> 128 神经元# 第二层全连接:128 -> 256 神经元# 输出层:256 -> 10 (对应0-9共10个分类)# 前向传播(数据流转逻辑,函数名固定为forward)x = torch.sigmoid(x) # 激活函数return x#
本文系统介绍了Anomalib库的核心接口架构,分为三大板块:数据模块包含AnomalibDataset、MVTecADDataset等数据集处理类;模型模块涵盖AnomalibModule、Patchcore等核心算法实现,重点解析了特征提取器TimmFeatureExtractor的工作原理;引擎模块则提供训练流程支持。文章通过UML类图展示了各模块的继承关系和核心方法,为工业异常检测任务提供
PyTorch Geometric(PyG)是图神经网络(GNN)领域最主流的PyTorch扩展库,GitHub Star数达23.8K。它封装了消息传递机制,简化了GCN、GAT等经典架构的实现,支持从学术研究到工业应用的多种场景。PyG的核心功能包括: 提供MessagePassing基类,方便自定义图卷积算子 内置mini-batch loader和大规模图采样方案 支持多GPU训练和tor
本次进行优化后的全规模训练,并发现和解决了过多线程同时运行时的不稳定性。同时尝试对训练脚本进行试错和再优化,使训练模型更具效率与精准。接下来我会不断优化并更新音频检测模型,供给项目组使用。
这是一篇深度解析 PyTorch 模型训练核心机制的实战进阶指南。文章承接快速入门内容,聚焦于将模型从“能跑通”提升至“能跑好”的关键环节,系统性地剖析了深度学习项目中必经的几大核心模块。
例如,“我 喜欢 你”和“你 喜欢 我”含义不同,但如果没有位置编码,模型无法区分。RoPE 的核心作用是通过“旋转”的方式,把位置信息注入到 Attention 的 Query 和 Key 中;Attention 权重由 QK 的点积决定,如果没有位置信息,模型只能根据 token 内容相似度做注意力分配,无法感知顺序。其中 s 为缩放倍数,gamma_i ∈ [0,1] 是线性 ramp,决定
python运行# 自定义卷积神经网络类,继承 nn.Module(所有 PyTorch 模型的基类)# 调用父类 nn.Module 的初始化方法,必须写,否则模型参数无法被正确注册# -------------------------- 卷积+池化层定义 --------------------------# 第1层卷积:输入通道3(RGB图像),输出通道32,卷积核5×5,padding=2
给扩散模型装上“能量导航”;蛋白质生成和单细胞分析任务更精准蛋白质由20种常见的氨基酸组成,本质上是一类离散序列。一个蛋白质序列是否“合理”,不仅取决于每个氨基酸token本身是否常见,还取决于整条序列是否满足结构稳定性、功能相关性、进化保守性等约束。单细胞RNA测序数据主要记录每个细胞中基因的表达水平,具有数据维度高、噪声强、易受批次效应影响等特点。实际分析中常关心的是模型是否能从这些复杂数据中
摘要 《古诗小集》是一款基于HarmonyOS 6.1 SDK开发的轻量级古诗鉴赏应用,采用ArkTS语言和ArkUI框架构建。应用收录了8首经典唐诗,包含列表浏览和详情鉴赏两大核心功能。项目采用Stage模型开发,数据层以结构化对象存储完整诗作信息(含注释译文),UI层通过ForEach实现高效列表渲染,并运用古风配色方案(米黄背景+深褐文字+金色点缀)营造传统美学氛围。文章详细介绍了从项目初始
本文介绍了一个基于PyTorch框架的遥感图像语义分割系统,用于精准提取不同城市建筑物。系统支持U-Net和TransUNet等架构,包含完整实现流程:1)环境配置;2)数据准备与自定义数据加载器;3)U-Net和TransUNet模型构建;4)模型训练过程;5)推理与结果可视化。通过CrossEntropyLoss和Adam优化器进行训练,最终实现对遥感图像中建筑物的自动分割和提取。该系统为城市
本文介绍了使用CNN卷积神经网络实现衣物分类模型的完整流程。首先下载FashionMNIST数据集并进行预处理,构建包含卷积层、池化层、Dropout和全连接层的神经网络模型。通过10轮训练后,模型在测试集上达到一定准确率,但存在混淆"衬衫"和"T恤"等问题。随后进行了模型改进:增加卷积层、扩大全连接层维度、调整学习率和训练轮次、加入数据增强。改进后的模型性
本文介绍了使用PyTorch构建和训练简单CNN网络进行MNIST手写数字分类的完整流程。主要内容包括:1) 配置必要的库并检查GPU可用性;2) 下载并加载MNIST数据集;3) 可视化展示部分训练样本;4) 构建包含两个卷积层、池化层、批量归一化和全连接层的CNN网络结构;5) 使用交叉熵损失函数和SGD优化器进行模型训练。网络结构包含约1.1万个可训练参数,通过批量归一化和Dropout层防
作用:导入 PyTorch 核心库,所有深度学习操作的基础。类比:就像写作文要先拿笔,torch就是深度学习的 “笔”。作用:导入 PyTorch 的神经网络模块(Neural Network)。核心功能:提供搭建 CNN、全连接层、卷积层等所有网络层的工具。关键:我们搭建的所有 AI 模型,都依赖这个模块。作用:数据加载器,批量管理数据集。通俗理解:把大量图片打包成 “小包裹”,一次性喂给电脑,
卷积层可以提取图像的局部特征,ReLU 激活函数可以增强网络拟合非线性数据的能力,池化层能够缩小特征图并减少计算量,而全连接层则负责根据提取到的特征完成最终分类。本次使用的数据集是MNIST手写数字数据集,该数据集包含了70000张图片,为28*28形式,其中有60000张训练数据,10000张测试数据。通过本项目,我掌握了使用 PyTorch 完成数据加载、CNN 模型搭建、训练测试及结果可视化
本文系统介绍了深度学习模型部署的核心技术,重点讲解了ONNX中间表示和TensorRT推理引擎的应用。主要内容包括: 模型部署基础 模型部署的定义与挑战:环境配置和运行效率优化 标准部署流程:深度学习框架→中间表示→推理引擎 关键概念:ONNX格式、计算图静态化 ONNX实践 详细解析torch.onnx.export参数 PyTorch到ONNX的转换方法 ONNXRuntime推理实现 动态输
这个项目里我做了两类模型:一个是自己写的简单 CNN,另一个是基于 ResNet-18 的迁移学习。自定义 CNN 主要由卷积、ReLU、池化和全连接层组成。卷积层可以理解成一组可学习的特征探测器。不同卷积核会在图片上滑动,提取不同局部特征。浅层卷积可能学到边缘、直线、纹理、颜色变化这些低级特征,越往后可能组合出耳朵、鼻子、脸部轮廓这些更高级的视觉特征。这里很重要的一点是,卷积核不是人工固定好的滤
本文通过三个CNN模型在CIFAR-10上的对比实验,揭示了几个关键发现:1)SimpleCNN以仅10万参数取得79.8%准确率,优于迁移学习的ResNet18(72.1%);2)LeNet-5通过加宽卷积核(32/64核)可提升13.8%准确率至78.8%;3)ResNet18需精细调整冻结策略(仅冻结底层)和归一化(必须使用ImageNet统计量)才能达到可用性能。实验表明,当目标数据集(C
MNIST数据集是深度学习领域的“Hello World”,它包含70,000张28x28的灰度手写数字图像,是入门图像分类任务的绝佳选择。本文将手把手带你使用PyTorch构建一个简洁而高效的卷积神经网络(CNN),完成对MNIST数据集的训练与评估。文章会逐步解读每一段代码的含义,从数据加载、模型构建、训练循环到测试评估,并结合完整的训练日志分析模型的收敛过程。最终我们的模型在测试集上达到了9
本文深入解析Transformer架构的核心原理,结合PyTorch源码API,详细阐述编码器、解码器的设计思路及实现细节。重点解析位置编码的原理及其在模型中的作用,并通过源码实例展示Transformer的构建过程。适合想要学习大模型基础知识的小白和程序员,助你快速入门并掌握Transformer的核心技术。当我们谈论大模型时,Transformer架构无疑是最重要的里程碑之一。它不仅是当前大模
混合专家(Mixture of Experts, MoE)正从学术论文快速走向工业级大模型部署。但多数开源实现存在等痛点。本文不讲理论推导,nn.Linear。
本文全面解析了传统Vision Transformer(ViT)模型,该模型由Google团队2020年提出,首次将纯Transformer架构应用于计算机视觉任务,打破了CNN在视觉领域十余年的统治地位。文章从背景、原理到实现详细介绍了ViT的创新设计:通过图像分块(Patch Embedding)、添加分类令牌(Class Token)和可学习位置编码,将二维图像适配Transformer的序