ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Week13:生成模型

Week13:生成模型 目录一、English Abstract二、中文摘要三、学习内容1. 生成模型的基本概念2. 为什么生成任务困难3. GAN 的基本结构4. GAN 的对抗训练目标5. GAN 的训练过程6. GAN 的理论直觉7. GAN 训练中的主要问题训练不稳定模式崩溃梯度消失评价困难8. GAN 的代表性变体Conditional GANDCGANWGANCycleGANStyleGAN9. GAN 的评价指标10. GAN 的应用四、本周总结一、English AbstractThis report summarizes generative models, with a focus on Generative Adversarial Networks (GANs). A generative model learns the underlying distribution of training data so that it can generate new samples that resemble the data. Unlike discriminative models, which mainly focus on predicting labels, generative models attempt to model how observed data are produced. The report introduces the basic idea of generation, the minimax game between the generator and the discriminator, the GAN training objective, and practical issues such as unstable training, mode collapse, and the difficulty of evaluation. It also discusses representative GAN variants, including Conditional GAN, DCGAN, WGAN, CycleGAN, and StyleGAN, and explains common evaluation metrics and applications such as image generation, image translation, super-resolution, and data augmentation.二、中文摘要本周学习生成模型重点为生成对抗网络Generative Adversarial NetworkGAN。生成模型的目标是学习训练数据的潜在分布并生成与真实数据相似的新样本。GAN 由生成器和判别器组成二者通过对抗博弈共同训练生成器尽量生成足以乱真的样本判别器尽量区分真实样本与生成样本。课程还讨论了 GAN 训练中的主要困难例如训练不稳定、模式崩溃和评价指标不完善并介绍了条件 GAN、DCGAN、WGAN、CycleGAN、StyleGAN 等代表性模型及其在图像生成、图像转换、超分辨率和数据增强中的应用。三、学习内容1. 生成模型的基本概念判别模型主要回答“输入属于哪一类”例如判断一张图片是猫还是狗生成模型则关注“数据是如何产生的”目标是学习真实数据的概率分布。如果能够学到训练数据的分布p d a t a ( x ) p_{data}(x)pdata​(x)模型就可以从该分布中采样生成新的、类似训练数据的样本。生成模型的典型任务包括根据随机噪声生成图片、语音或文本根据输入图片生成另一张图片对缺失数据进行补全生成可用于训练其他模型的数据。2. 为什么生成任务困难生成任务通常面对高维数据。例如一张彩色图片可能包含数十万甚至上百万个像素而真实数据在高维空间中的分布往往非常复杂。生成模型需要解决以下问题如何表示复杂的数据分布如何判断生成样本是否足够真实如何避免模型只生成少数几种样本如何稳定地训练模型。与分类任务相比生成任务通常缺少一个简单、明确且可靠的目标函数。3. GAN 的基本结构GAN 由两个网络组成生成器GeneratorG输入一个随机向量z zz输出一个生成样本G ( z ) G(z)G(z)生成器的目标是让生成样本尽可能接近真实数据。判别器DiscriminatorD输入一个样本x xx输出该样本来自真实数据的概率D ( x ) D(x)D(x)判别器的目标是正确区分真实样本和生成样本。生成器和判别器相互竞争因此 GAN 的训练过程可以看作一场对抗博弈。4. GAN 的对抗训练目标GAN 的目标函数可以写成min ⁡ G max ⁡ D V ( D , G ) E x ∼ p d a t a ( x ) [ log ⁡ D ( x ) ] E z ∼ p z ( z ) [ log ⁡ ( 1 − D ( G ( z ) ) ) ] \min_G \max_D V(D,G) \mathbb{E}_{x \sim p_{data}(x)}[\log D(x)] \mathbb{E}_{z \sim p_z(z)}[\log(1-D(G(z)))]Gmin​Dmax​V(D,G)Ex∼pdata​(x)​[logD(x)]Ez∼pz​(z)​[log(1−D(G(z)))]其中p d a t a ( x ) p_{data}(x)pdata​(x)表示真实数据分布p z ( z ) p_z(z)pz​(z)表示生成器输入的噪声分布D ( x ) D(x)D(x)表示判别器判断样本为真的概率G ( z ) G(z)G(z)表示生成器根据噪声生成的样本。判别器希望最大化目标函数即尽可能正确地区分真样本和假样本。生成器希望最小化目标函数即尽可能让判别器把生成样本判断为真实样本。5. GAN 的训练过程GAN 通常采用交替训练的方式固定生成器更新判别器固定判别器更新生成器重复以上过程直到达到较好的平衡状态。训练时可以分别从真实数据和随机噪声中采样得到真实样本和生成样本再利用二分类损失更新两个网络。从直觉上看判别器像一个鉴定专家负责识别真假生成器像一个造假者不断改进自己的生成结果两者的能力会在对抗中共同提高。6. GAN 的理论直觉在理想情况下当生成器能够完全拟合真实数据分布时生成样本与真实样本无法区分此时判别器对任何样本的判断概率都接近0.5 0.50.5。理论上最优判别器可以表示为D ∗ ( x ) p d a t a ( x ) p d a t a ( x ) p g ( x ) D^*(x) \frac{p_{data}(x)}{p_{data}(x)p_g(x)}D∗(x)pdata​(x)pg​(x)pdata​(x)​其中p g ( x ) p_g(x)pg​(x)表示生成器产生的数据分布。当判别器达到最优时生成器最小化目标函数的过程可以理解为缩小真实分布与生成分布之间的差异。7. GAN 训练中的主要问题训练不稳定生成器和判别器的训练需要保持平衡。如果判别器过强生成器可能无法获得有效梯度如果生成器过强判别器又可能无法提供有意义的区分信号。模式崩溃模式崩溃Mode Collapse是指生成器只生成少数几种样本而无法覆盖真实数据中的多种模式。例如训练数据中包含多种字体但生成器只反复生成其中一种字体。梯度消失当判别器能够非常轻松地区分真假样本时生成器可能收到很小的梯度导致学习速度变慢甚至停止。评价困难生成样本的质量很难用单一指标衡量。模型可能生成清晰但不真实的图片也可能生成多样但质量较低的图片。8. GAN 的代表性变体Conditional GAN条件 GAN 在生成器和判别器中加入额外条件y yy例如类别标签、文本描述或其他图像。生成器学习G ( z , y ) G(z,y)G(z,y)判别器学习D ( x , y ) D(x,y)D(x,y)这样可以让生成结果符合指定的条件例如生成指定类别的数字或根据文本生成图像。DCGANDCGAN 将卷积神经网络引入 GAN并使用一系列架构设计提高训练稳定性例如使用步长卷积、批归一化和合适的激活函数。DCGAN 使 GAN 更容易生成具有一定结构和语义的图像。WGANWGAN 使用 Wasserstein 距离衡量真实分布与生成分布之间的差异并加入 Lipschitz 约束以缓解原始 GAN 训练不稳定和梯度消失的问题。CycleGANCycleGAN 用于没有成对数据的图像转换任务例如将马转换为斑马、将夏天转换为冬天。它通过循环一致性损失要求图像经过两次转换后能够回到原来的内容。StyleGANStyleGAN 采用基于风格的生成器结构可以生成高质量的人脸图像并支持对风格、年龄、表情等属性进行一定程度的控制。9. GAN 的评价指标常见的 GAN 评价方法包括Inception ScoreIS衡量生成图像的清晰度和多样性Fréchet Inception DistanceFID比较真实图像和生成图像在特征空间中的分布距离人工评价通过人工判断生成样本的真实性、清晰度和多样性。不同评价指标各有局限因此通常会结合多种指标进行判断。10. GAN 的应用GAN 已被广泛应用于多个领域图像生成图像到图像的转换图像超分辨率黑白图像上色图像修复数据增强视频生成语音和音频生成人脸属性编辑。GAN 的核心价值在于它不一定需要显式写出数据的概率密度函数也可以通过生成器和判别器的对抗过程学习复杂的数据分布。四、本周总结本周重点学习了生成模型和 GAN 的基本思想理解了生成器与判别器之间的对抗关系、GAN 的目标函数和交替训练过程。同时学习了 GAN 训练中常见的训练不稳定、模式崩溃和评价困难等问题并了解了 Conditional GAN、DCGAN、WGAN、CycleGAN、StyleGAN 等代表性模型。生成模型的核心目标是学习数据分布并生成新的样本而 GAN 通过生成器与判别器的博弈实现这一目标是理解现代图像生成和生成式人工智能的重要基础。
返回列表