云端 GPU 算力使用教程:在 VeryAI 平台完成深度学习模型训练

背景

在进行 AI 开发工作时,本地硬件算力往往难以满足模型训练的需求。最近在寻找高性价比的云端 GPU 资源时,接触到了 VeryAI GPU 算力平台,完成了从注册到模型训练的完整流程,在这里整理成教程分享给大家。

官方文档地址: https://doc.veryai.cn/

平台概况

VeryAI GPU 算力平台提供云端 GPU 实例租用服务,面向开发者和科研人员提供按需计费的算力资源。

注册方式 :支持短信验证码登录和微信扫码登录,登录即完成注册。

新用户注册机制 :账户注册完成后,系统会自动分配 150 积分(1 积分 = 1 元人民币)到账户中,可用于抵扣平台服务费用,无需预先充值即可开始使用。

支持的 GPU 型号一览

平台提供多种 GPU 型号供用户选择:

完整使用流程(6 步)

Step 1:注册登录

访问 veryai.cn,使用手机号接收验证码完成登录,或使用微信扫码授权登录。登录成功即完成注册。

Step 2:查看账户积分

登录后进入「我的账户」页面,可以看到账户中已自动分配 150 积分,可用于后续实例租用。

Step 3:租用 GPU 实例

  1. 进入「GPU 实例市场」,浏览可用的 GPU 型号
  2. 选择合适的 GPU 型号和数量
  3. 选择预装的系统镜像(支持 PyTorch、TensorFlow 等)
  4. 设置租用时长
  5. 提交订单,使用账户积分支付

Step 4:连接实例

实例创建成功后,支持三种连接方式:

  • VNC 图形界面连接
  • SSH 命令行连接
  • Jupyter Notebook 在线开发环境

Step 5:运行 GPU 任务

平台已预装主流深度学习框架,可直接运行训练任务。以下是 GPU 环境检测示例代码:

NVIDIA-SMI 输出示例:
import torch

print(“PyTorch 版本:”, torch.version)
print(“CUDA 可用:”, torch.cuda.is_available())
print(“CUDA 版本:”, torch.version.cuda)
print(“GPU 数量:”, torch.cuda.device_count())

if torch.cuda.is_available():
for i in range(torch.cuda.device_count()):
print(f"GPU {i}: {torch.cuda.get_device_name(i)}")

# 简单的矩阵运算测试
x = torch.rand(1000, 1000).cuda()
y = torch.rand(1000, 1000).cuda()
z = torch.matmul(x, y)
print("\nGPU 计算测试完成")
print(f"输出张量尺寸: {z.size()}")

else:
print(“CUDA 不可用,请检查实例配置”)

NVIDIA-SMI 输出示例:
±----------------------------------------------------------------------------+
| NVIDIA-SMI 535.54.03 Driver Version: 535.54.03 CUDA Version: 12.2 |
|-------------------------------±---------------------±---------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
+=++==============+
| 0 NVIDIA GeForce RTX 3090 Off | 00000000:00:05.0 Off | N/A |
| 0% 30C P8 15W / 350W | 0MiB / 24576MiB | 0% Default |
±------------------------------±---------------------±---------------------+

Step 6:保存工作成果

实例到期后系统盘数据将被清除,建议将重要数据备份至云盘或下载到本地。

典型使用场景

场景一:深度学习模型训练

  • 使用多卡 GPU 实例进行模型训练

  • 通过 SSH 连接实例,上传训练代码和数据集

  • 运行训练脚本,监控训练进度

  • 训练完成后下载模型权重
    场景二:推理服务部署

  • 使用单卡 GPU 实例部署模型服务

  • 配置公网访问策略

  • 启动推理 API 服务
    场景三:数据预处理

  • 使用 CPU 实例或低配 GPU 实例

  • 上传原始数据,运行预处理脚本

  • 保存处理后的数据用于后续训练

计费说明

  • 采用积分账户体系,1 积分 = 1 元人民币
  • GPU 实例按租用时长计费,精确到分钟
  • 实例到期后自动停止计费
  • 不支持主动释放实例,请根据任务需求合理规划租用时长

注意事项

  1. 系统盘数据在实例到期后自动清除,请及时备份重要数据
  2. 建议根据任务预估时间设置租用时长,避免资源浪费
  3. 可定期创建快照备份重要数据

总结

VeryAI 平台提供了较为丰富的 GPU 型号选择,操作流程简单直观,预装环境节省了配置时间。积分计费体系清晰,新用户账户中的初始积分足以完成初步的模型训练实验。

对于需要临时算力的开发者和学生而言,这是一个可以纳入考虑的选项。建议结合自身项目需求评估是否适用。

更多详细信息可参考官方文档: https://doc.veryai.cn/
标签 :深度学习, GPU, 云计算, PyTorch, 教程, 算力

以上是个人使用经验,仅供参考。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐