[论文解读] Few-shot Semantic Image Synthesis Using StyleGAN Prior
本文提出了一种少样本语义图像合成方法,利用预训练的StyleGAN生成器,仅通过一个或五个标注的训练样本对,即可从稀疏或密集的语义布局生成高质量、逼真的图像。通过在StyleGAN特征与语义类别之间进行最近邻特征匹配,生成伪语义掩码,该方法训练一个编码器以最小的标注数据控制生成器,在仅支持一个样本的情况下也实现了最先进的布局保真度与视觉质量。
This paper tackles a challenging problem of generating photorealistic images from semantic layouts in few-shot scenarios where annotated training pairs are hardly available but pixel-wise annotation is quite costly. We present a training strategy that performs pseudo labeling of semantic masks using the StyleGAN prior. Our key idea is to construct a simple mapping between the StyleGAN feature and each semantic class from a few examples of semantic masks. With such mappings, we can generate an unlimited number of pseudo semantic masks from random noise to train an encoder for controlling a pre-trained StyleGAN generator. Although the pseudo semantic masks might be too coarse for previous approaches that require pixel-aligned masks, our framework can synthesize high-quality images from not only dense semantic masks but also sparse inputs such as landmarks and scribbles. Qualitative and quantitative results with various datasets demonstrate improvement over previous approaches with respect to layout fidelity and visual quality in as few as one- or five-shot settings.
研究动机与目标
- 解决在仅有少量标注训练样本对的情况下,从语义布局生成高质量逼真图像的挑战。
- 通过利用未标注数据和预训练的StyleGAN,降低像素级语义掩码标注的高昂成本。
- 在少样本场景下,支持从密集掩码和稀疏输入(如关键点、涂鸦)进行语义图像合成。
- 通过在伪标签数据上使用简单的L2损失,避免复杂的损失函数与超参数调优。
- 通过学习从语义类别到StyleGAN潜在空间的映射,弥合语义布局与真实图像之间的域差距。
提出的方法
- 使用在大规模未标注数据集(如FFHQ、LSUN)上预训练的StyleGAN生成器作为语义特征空间的先验。
- 对于少样本标注样本中的每个语义类别,在StyleGAN的中间层计算其特征向量的均值。
- 通过在潜在空间中寻找其StyleGAN特征与类别均值特征最近邻的随机噪声向量,生成伪语义掩码。
- 训练一个编码器网络,使其将随机噪声映射到能生成匹配伪标签语义掩码图像的潜在码,损失函数为简单的L2损失。
- 将训练好的编码器与固定的StyleGAN生成器集成,以在推理阶段通过语义布局实现控制。
- 通过将密集掩码和稀疏输入(如关键点、涂鸦)统一视为编码器的语义布局输入,支持两类输入。
实验结果
研究问题
- RQ1在仅有一个或五个标注训练样本对的少样本设置下,能否实现高保真度的语义图像合成?
- RQ2如何有效利用预训练的StyleGAN生成器,以补偿语义图像合成中标注数据的不足?
- RQ3尽管可能存在错位,通过StyleGAN潜在空间的最近邻特征匹配生成的伪标签语义掩码,是否能支持高质量的图像生成?
- RQ4该方法是否能泛化到稀疏输入类型(如关键点和涂鸦),这些输入相比密集掩码精度较低?
- RQ5在少样本约束下,与现有的像素对齐和无监督图像到图像翻译方法相比,该方法在布局保真度和视觉质量方面表现如何?
主要发现
- 在单样本设置下,该方法在LSUN ChurchMask数据集上实现了65.1的Fréchet Inception Distance(FID),优于pSp(89.5)和pix2pixHD++(100.6),且使用相同数量的标注样本。
- 在CelebAMask-HQ数据集上,该方法在单样本设置下实现了38.3的平均交并比(mIoU),显著优于pSp(24.8)和pix2pixHD++(38.7),且使用相同训练数据。
- 即使在使用完整训练集时,该方法的FID(56.9)也低于pSp(76.2),表明通过伪采样更好地探索了StyleGAN的潜在空间。
- 该方法在不同数据集上保持了稳定的性能,五样本设置下FID分数分别为82.1(CelebALandmark-HQ)和77.4(LSUN ChurchMask),优于所有基线方法。
- 该方法对稀疏输入表现出鲁棒性:无需密集掩码监督,即可成功从关键点和涂鸦生成图像。
- 在单样本设置下,该方法在CelebALandmark-HQ上的关键点对齐RMSE为31.5,低于pSp的37.0,表明其具有更好的布局保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。