第005章:ComfyUI&AIGC基础概念及发展历程(三)
上一章我们说到了VAE-GAN,虽然一定程度上解决的AI生图的稳定性和生图质量,但他有一个致命的缺点就是:“没法用文字控制画图,也就是没法文生图”,这样就导致我们没法用人话和他交流。再一个面对一些复杂的场景他就很难驾驭了。
同期虽然也提出了Diffusion扩散模型,但由于其动不动过千的采样步数,需要巨大的显存,根本就没进行民用,也一直不温不火。
“采样”这个词我还是现在就给大家解释一下吧,后面可能会频繁出现。在上一章中我举了一个刮刮卡的例子,我还是用刮刮卡给大家来解释。
训练AI绘画呢,就是先拿一张图片,在图片上加噪点(可以理解为给刮刮卡抹图层),直到整张图片全部被噪点覆盖掉(就好比我们平时买到的刮刮卡,已经完全看不到图层下的图像了),原始的Diffusion扩散模型这个过程大概需要1000步,这叫正向加噪。
AI生图呢,刚好和他的训练是反着的,哪个刮刀一遍又一遍的去刮卡片上的图层,知道把整个图像完全显露出来,原始的Diffusion扩散模型这个过程大概也需要1000步.
“采样”我们通俗的理解就是“把图片上的噪点慢慢擦掉,露出图片的这个过程,就是采样”。
了解了“采样”的概念,我们下来进入本章的正题。
大概在2020年的年中,谷歌旗下顶级深度学习研究院Google Brain发表了Denoising Diffusion Probabilistic Models(去噪扩散概率模型 DDPM),首次用改造版 UNet 做噪声预测(不再输出分割图,输出原图噪声),对扩散模型理论进行了完善,但其巨量的显存需求仍然没有得到改善。
2021年DDIM(去噪扩散隐式模型 Denoising Diffusion Implicit Models)论文发表,对原始的DDPM模型理论进行改良,把DDPM得千步采样直接降到了10-50步,奠定了AIGC从实验室走向民间的基础。
简单的给大家收一下DDIM的原理,他在模型训练这块和DDPM是一样的,但对采样出图这块的算法公式进行了修改。原本的DDPM在采样出图的时候是1000、999、998....1非常老实的一步一步的往下走。而DDIM呢他却是跳着走的1000、900、800....1,大概就是这个意思。
同期(2021)另一条AIGC路线NLP模型上的OpenAI也取得了突破,用 CLIP+Transformer 实现初代文生图,并对Clip技术进行开源。
同样还是2021年,德国慕尼黑大学CompVis 实验室发表LDM 潜在扩散模型(Latent Diffusion Models),在DDPM和DDIM的基础上再次进行优化,把扩散从昂贵像素搬到小尺寸潜空间,让 AI 绘画从实验室落地个人电脑成为可能。
这个时候文生图全流程所需要的技术基本上就准备完成了:提示词→CLIP(NLP编码)→文本特征 → UNet(潜空间DDIM去噪采样)→生成潜图Z → VAE解码→成品图片。
同年(2021)Midjourney 内测上线:闭源商用文生图出圈,引爆画师圈。
2022年8月:CompVis 技术 + Stability 算力 + LAION 数据的Stable Diffusion 1.4(SD)问世、并完全开源,全球首个 4G 显存本地运行的开源文生图模型,瞬间引爆民间生态.。
至此AIGC技术彻底的从实验室走向了民间,2022年也因此成为了AIGC发展的元年。
到这里我们“ComfyUI&AIGC基础概念及发展历程”这个系列文章,基本就可以说是完成了。下一章开始,我讲开始聚焦实操部分的具体技术及操作方法,真正的开始AIGC&ComfyUI的学习。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)