pix2pix相较于基础GAN模型,最核心的改进在于从一个“随机生成器”转变为一个“可控的图像翻译器”。具体的改进主要体现在一下三个关键方面:

  • 输入

基础GAN的输入为随机噪声,目标是生成一张看起来真实的图像,但具体生成什么内容是不可控的。

pix2pix的输入为一张具体的源图像(如轮廓图、语义标签图),是生成过程变得可控,实现了“输入一张图,输出对应的另一张图”的图像翻译任务。(即条件GAN)

  • 网络结构

原始GAN通常使用简单的全连接网络或普通编码器-解码器。

pix2pix的生成器为U-Net判别器为PatchGAN,PatchGAN不判断整张图的真假,而是将图像分成多个NxN的局部小块分别判断,最后取平均。这使得模型更关注图像的局部纹理和清晰度(高频信息),而不是整体布局(低频信息)。

  • 损失函数

原始GAN仅依赖对抗损失,导致生成器为“欺骗”判别器而生成不真实或单一的图像。

pix2pix在对抗损失基础上,增加了L1损失。L1损失会逐像素计算生成图像与真实目标图像之间的差异,强制保证生成结果在整体结构和颜色上接近“标准答案”。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐