基于千里云+ComfyUI 的 AI 图像生成实战
🎨 基于千里云+ComfyUI 的 AI 图像生成实战:文生图 / LoRA / ControlNet 完整工作流记录
博主前言:这是 AI 图像生成工作流实验(实验3)的完整记录,使用千里云算力平台(NVIDIA RTX 4090 48GB)+ ComfyUI 框架,分别完成了文生图、LoRA 推理和 ControlNet 控制生成三种工作流。文章详细记录每一步操作,适合同样在跑 ComfyUI 实验的同学参考!
📋 目录
实验环境与平台选择
Step 1:登录千里云,获取 GPU 资源
Step 2:启动 ComfyUI 环境
Step 3:下载模型
Step 4:工作流①——文生图实验
Step 5:工作流②——LoRA 推理实验
Step 6:工作流③——ControlNet 实验
实验结果对比与分析
总结与踩坑记录
- 实验环境与平台选择
为什么选择千里云?
做这次实验需要跑 Stable Diffusion / FLUX 这类大模型,本地 GPU 显存根本不够用(FLUX.1 光模型就 12GB 起步)。综合对比几家算力平台后,我选择了 千里云,原因如下:
✅ RTX 4090 48GB 显存:跑 FLUX / SDXL 完全不压线,不需要量化
✅ 预装 ComfyUI 镜像:开箱即用,省去繁琐的环境配置
✅ 按量计费:实验用完即停,不浪费
✅ 网速快:模型下载速度比本机快很多
本次实验完整配置
配置项 详情
算力平台 千里云(https://www.qianlicloud.com)
GPU 型号 NVIDIA RTX 4090 48GB
GPU 显存 48GB
CPU Intel Xeon Platinum 8358 × 32 核
内存 120 GB DDR4
操作系统 Ubuntu 22.04 LTS
CUDA 版本 CUDA 12.1
Python 版本 Python 3.10
AI 框架 ComfyUI + SD v1.5 / SDXL / FLUX.1
2. Step 1:登录千里云,获取 GPU 资源
打开 https://www.qianliyun.com,注册/登录账号后进入控制台。
操作步骤:
进入「GPU 实例」页面,选择地区(推荐华东区,延迟低)
选择实例规格:RTX 4090 48GB(1卡)
镜像选择:搜索 “ComfyUI” 选择预装好的镜像模板
点击「立即创建」→ 等待约 1~2 分钟实例启动
复制 WebUI 访问链接,在浏览器打开
💡 小技巧:千里云支持一键复制 ComfyUI 访问地址,启动完成后直接就能看到 ComfyUI 的节点编辑界面,完全不需要自己配环境!
- Step 2:启动 ComfyUI 环境
成功进入 ComfyUI 界面后,可以看到默认加载的「文生图」基础工作流(如下图所示):
alt text 界面说明:
左侧:节点面板(右键可添加新节点)
中间:画布(拖拽节点,连接数据流)
右侧/底部:队列控制(Queue Prompt 运行推理)
ComfyUI 采用节点式工作流设计,每个节点代表一个处理步骤,数据通过连线在节点间流动,直观清晰。
- Step 3:下载模型
在千里云实例的终端中执行以下命令下载模型(平台网速很快,基本几分钟搞定):
进入 ComfyUI 模型目录
cd /root/ComfyUI/models/
下载 SD v1.5 Checkpoint(也可选择 SDXL / FLUX)
cd checkpoints/
wget -c https://huggingface.co/runwayml/stable-diffusion-v1-5/resolve/main/v1-5-pruned-emaonly.ckpt
下载 LoRA 模型(以二次元风格为例)
cd …/loras/
可从 civitai 或 Hugging Face 下载目标 LoRA
下载 ControlNet 模型
cd …/controlnet/
wget -c https://huggingface.co/lllyasviel/ControlNet-v1-1/resolve/main/control_v11p_sd15_canny.pth
下载完成后,在 ComfyUI 界面点击右上角「刷新」按钮,节点的模型选择列表就会更新。
- Step 4:工作流①——文生图实验
工作流节点结构
[Checkpoint Loader] → [CLIP Text Encode (Prompt)] → [KSampler] → [VAE Decode] → [Save Image]
参数配置
参数 值
Checkpoint v1-5-pruned-emaonly.ckpt
Positive Prompt a beautiful anime girl standing in a sakura forest, high quality, detailed, 8k
Negative Prompt blurry, low quality, bad anatomy, watermark
Steps 20
CFG Scale 7
Sampler euler
Scheduler normal
图像尺寸 512 × 512
运行结果
:文生图实验生成结果 Fig.1 alt text
参数对比实验(Steps & CFG)
我分别调整了 Steps 和 CFG 参数,记录效果如下:
Steps 对比(CFG=7 固定):
Steps 效果描述 推理时间
10 图像模糊,细节缺失,轮廓不清晰 ~2s
20 图像清晰,细节丰富,质量较好 ~4s
30 细节进一步提升,但与20步差异不大 ~6s
CFG Scale 对比(Steps=20 固定):
CFG 效果描述
5 图像较为随机,与 Prompt 符合度低
7 与 Prompt 语义吻合,色彩自然 ✅
10 过度饱和,色彩失真,有轻微伪影




Steps/CFG 对比图(3×2 对比网格) alt textalt textalt textalt textalt text 结论:Steps=20,CFG=7 是本次实验的最佳基础参数组合。
- Step 5:工作流②——LoRA 推理实验
工作流节点结构
[Checkpoint Loader] + [Load LoRA] → [CLIP Text Encode] → [KSampler] → [VAE Decode] → [Save Image]
与文生图工作流的区别:在 Checkpoint 之后、KSampler 之前,新增了 Load LoRA 节点,将 LoRA 权重融合进基础模型。
实验配置
参数 值
基础 Checkpoint v1-5-pruned-emaonly.ckpt
LoRA 模型 二次元动漫风格 LoRA
strength(model) 0.5 / 0.8 / 1.0(三组对比)
strength(clip) 0.8
其他参数 与文生图实验相同
运行结果与对比


:Loalt textRA 三组对比结果(strength=0.5 / 0.8 / 1.0)alt textalt text
效果分析:
strength 效果描述
0.5 风格轻微融合,画风接近基础模型,动漫感不强
0.8 风格迁移鲜明,人物动漫画风清晰,图像质量稳定 ✅
1.0 动漫风格过强,部分细节失真,人物比例略有变形
结论:LoRA strength 建议在 0.6~0.85 区间调整,过高会破坏基础模型的语义理解能力。
- Step 6:工作流③——ControlNet 实验
工作流节点结构
[Checkpoint Loader] + [ControlNet Loader] + [Load Image] → [Apply ControlNet] → [CLIP Text Encode] → [KSampler] → [VAE Decode] → [Save Image]
实验配置(Canny 边缘控制)
参数 值
控制模式 Canny 边缘检测
ControlNet 模型 control_v11p_sd15_canny.pth
control_weight 1.0
参考图 自定义参考图(人物/场景)
Prompt 与参考图内容相关的描述
运行结果
:ControlNet 实验结果(左:参考图,中:Canny 边缘图,右:生成图)alt text
三种控制模式说明
控制模式 适用场景 特点
Canny 建筑、工业设计、需保持轮廓结构 基于边缘线条控制,精准保留轮廓
Depth 风景、室内场景、空间层次控制 基于深度图控制前后景空间关系
OpenPose 人物姿态控制 提取骨骼关键点,精准复现动作姿势
结论:Canny 控制效果非常好,生成图轮廓与参考图高度吻合,ControlNet 是实现"可控生成"的利器。
- 实验结果对比与分析
三种工作流综合对比
实验类型 工作流复杂度 关键参数 核心能力 推荐场景
文生图 ⭐ 简单 Steps, CFG, Prompt 创意图像生成 概念设计、原型生成
LoRA 推理 ⭐⭐ 中等 strength 风格定制化 特定画风、IP 风格生成
ControlNet ⭐⭐⭐ 较复杂 control_weight, 控制模式 结构可控生成 辅助设计、姿态复现
千里云 A100 性能实测
在 NVIDIA RTX 4090 48GB 上,本次实验各工作流推理速度如下:
工作流 分辨率 Steps 推理时间
文生图 512×512 20 ~3s
LoRA 推理 512×512 20 ~3.5s
ControlNet 512×512 20 ~4s
SDXL 文生图 1024×1024 25 ~8s
RTX 4090 48GB 显存使得整个实验过程中完全无 OOM 问题,跑 FLUX.1 也丝滑。
- 总结与踩坑记录
实验收获
通过本次实验,系统掌握了:
ComfyUI 节点式工作流的核心操作逻辑(节点连接、参数调整、队列管理)
Stable Diffusion 推理流程:Checkpoint 加载 → CLIP 编码 → KSampler 去噪 → VAE 解码
LoRA 的正确使用方式:strength 参数敏感,建议从 0.6 开始逐步调大
ControlNet 的三种控制模式及其适用场景
千里云算力平台的完整使用流程(登录 → 选实例 → 启动镜像 → 运行实验)
踩坑记录
问题 原因 解决方案
刷新后模型列表不更新 ComfyUI 缓存未刷新 点击右上角 🔄 刷新按钮,或重启 ComfyUI
ControlNet 效果很弱 control_weight 设置过低 将 control_weight 调整至 0.8~1.0
LoRA 加载后图像变黑 strength 值超过 1.0 或 LoRA 与 Checkpoint 不兼容 降低 strength,换用兼容的 LoRA
生成图有大量伪影 CFG Scale 过高(>12) CFG 控制在 5~9 范围内
显存不足报错 本地 GPU 显存太小 改用千里云 RTX 4090 48GB,彻底解决
📌 写在最后
这次实验最大的感受是:硬件资源真的很重要。在千里云 RTX 4090 48GB上跑实验,基本是"改参数→运行→看结果"的流畅循环,完全不需要担心显存溢出或者等太久。
如果你也在跑 ComfyUI 相关实验,推荐直接用 千里云 开一个 RTX 4090 48GB 实例,体验会好很多。
Tags: ComfyUI Stable Diffusion LoRA ControlNet AI图像生成 千里云 RTX 4090 48GB 深度学习实验 FLUX`
如果这篇文章对你有帮助,欢迎点赞收藏!有问题欢迎在评论区交流 🙌
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)