[论文解读] Image Generation From Small Datasets via Batch Statistics Adaptation
本文提出一种方法,通过仅微调批量归一化层的缩放和偏移参数,同时冻结所有卷积核权重,将预训练生成器适配到极小数据集(少至25张图像)上,从而生成高质量图像。该方法实现稳定训练,保持原始生成质量,并支持在不发生灾难性遗忘的情况下添加低资源量的新类别或新领域。
Thanks to the recent development of deep generative models, it is becoming possible to generate high-quality images with both fidelity and diversity. However, the training of such generative models requires a large dataset. To reduce the amount of data required, we propose a new method for transferring prior knowledge of the pre-trained generator, which is trained with a large dataset, to a small dataset in a different domain. Using such prior knowledge, the model can generate images leveraging some common sense that cannot be acquired from a small dataset. In this work, we propose a novel method focusing on the parameters for batch statistics, scale and shift, of the hidden layers in the generator. By training only these parameters in a supervised manner, we achieved stable training of the generator, and our method can generate higher quality images compared to previous methods without collapsing, even when the dataset is small (~100). Our results show that the diversity of the filters acquired in the pre-trained generator is important for the performance on the target domain. Our method makes it possible to add a new class or domain to a pre-trained generator without disturbing the performance on the original domain.
研究动机与目标
- 解决仅提供少量图像(例如约100张或更少)时训练高质量生成模型的挑战。
- 克服在小数据集上标准GAN训练常导致的模式崩溃和泛化能力差的问题。
- 在不重新训练或降低原始领域性能的前提下,实现向预训练生成器中添加新类别或新领域。
- 利用大规模预训练生成器中的先验知识,提升在小规模、分布外数据集上的样本质量和多样性。
提出的方法
- 通过仅微调批量归一化层的缩放和偏移参数,将预训练生成器(如BigGAN或SNGAN)的知识迁移至小规模目标数据集。
- 训练期间固定所有卷积核权重,以防止过拟合并保持预训练模型的泛化能力。
- 使用小规模目标数据集以监督方式训练缩放和偏移参数,最小化具有固定生成器架构的GAN损失。
- 推理时采用截断采样以提升样本质量与多样性,尤其在高分辨率设置下表现更优。
- 将该方法应用于条件生成与无条件生成任务,包括不同图像领域间的插值与领域形态转换。
- 对于BigGAN中的条件批量归一化层,省略对统计量的L2正则化项,因为其内部神经网络已提供充分正则化。
实验结果
研究问题
- RQ1是否可仅通过调整批量归一化参数,有效将预训练生成器适配到小规模、分布外的数据集上?
- RQ2仅微调缩放和偏移参数是否能在保持原始生成器性能的同时,实现在小数据集上的高质量图像合成?
- RQ3源预训练生成器中滤波器的多样性如何影响目标领域生成图像的质量?
- RQ4该方法是否能实现低资源量的领域添加,而不会引发灾难性遗忘或原始领域的性能下降?
- RQ5该方法在极小训练数据下是否对高分辨率图像生成(如256×256)有效?
主要发现
- 在仅使用25张图像进行训练时,该方法生成的图像质量更高且多样性更优,未观察到模式崩溃现象。
- 在ImageNet 1K上预训练的生成器在目标领域上产生了最高质量的样本,表明源领域中滤波器的多样性对成功适配至关重要。
- 在小数据集上(如25张真人与动漫人脸)生成图像之间的插值产生了平滑且语义合理的过渡,表明潜在空间操作有效。
- 通过仅调整缩放和偏移参数,该方法成功实现了不同领域间的领域形态转换,例如从ImageNet中的“芝士汉堡”形态转换为“人脸”或“花朵”。
- 对于BigGAN-256,以极小的学习率(1e-7)微调首个线性层可提升图像锐度,表明极小的参数更新也能增强高分辨率生成效果。
- 该方法支持生成器的低资源学习,可在不重新训练整个模型或降低现有类别性能的前提下添加新类别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。