Radeon Cloud快速部署Gemma 4模型运行
·
Radeon Cloud 快速部署 Gemma 4 模型运行学习笔记
1. 环境准备与确认
首先前往 AMD Radeon Cloud 平台。
创建笔记或直接点击启动 Hello ROCm Bate笔记。
在开始部署前,首先确认 GPU 环境是否就绪。
- 确认 GPU 可用性: 使用
amd-smi指令检查 GPU 状态。 - 验证 PyTorch 环境: 运行以下命令确认 PyTorch 能正确识别 AMD GPU:
python -c "import torch; print('PyTorch:', torch.__version__); print('ROCm available:', torch.cuda.is_available()); print('Device:', torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'N/A')"
2. 模型下载
为了获得更稳定的下载速度,通过魔搭 ModelScope 社区进行模型获取。
- 配置镜像源: 切换至腾讯云镜像源以加速依赖下载。
pip config set global.index-url https://mirrors.cloud.tencent.com/pypi/simple/
- 安装 ModelScope:
pip install modelscope
- 下载模型: 使用以下命令将 Gemma 4 模型下载至指定目录:
modelscope download --model google/gemma-4-E4B-it --cache_dir "./models"
💡 注意: 耐心等待直到看到“Successfully Downloaded”提示。
- 验证完整性: 检查权重文件是否下载成功。
ls -lh ./models/google/gemma-4-E4B-it/
3. 启动 vLLM 推理服务
vLLM 是高效的推理框架,在启动前需确保环境配置正确。
- 环境准备: 卸载冲突包并安装 vLLM 及相关依赖。
uv pip uninstall torchvision
uv pip install vllm torchvision --no-cache --index-url https://mirrors.aliyun.com/pypi/simple/ --extra-index-url https://wheels.vllm.ai/rocm/ -U
- 启动服务:
vllm serve ./models/google/gemma-4-E4B-it/ --served-model-name gemma-4-E4B-it
⚠️ 警告: 服务启动后,该终端窗口将被占用,请保持其运行,不要关闭或中断。
4. 对话测试
打开一个新的终端窗口进行交互测试。
- 运行对话测试命令:
vllm chat --url http://localhost:8000/v1 --model gemma-4-E4B-it
- 测试互动: 输入“你是谁,你能做什么”来验证模型响应。
5. 任务总结与资源释放
完成后,需要及时关闭服务并销毁实例,避免资源浪费。
- 停止服务: 在各终端窗口按
Ctrl+C退出聊天及结束 vLLM 服务。 - 清理资源: 确保已保存必要产出后,前往云平台个人主页(Profile),点击 Destroy Instance。
#Datawhale #AMDev
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)