[论文解读] Large Scale Adversarial Representation Learning
BigBiGAN 在 BigGAN 的基础上加入一个编码器和一个联合鉴别器,以实现对抗式表征学习,取得最先进的无监督 ImageNet 表征,并提升无条件图像生成。
Adversarially trained generative models (GANs) have recently achieved compelling image synthesis results. But despite early successes in using GANs for unsupervised representation learning, they have since been superseded by approaches based on self-supervision. In this work we show that progress in image generation quality translates to substantially improved representation learning performance. Our approach, BigBiGAN, builds upon the state-of-the-art BigGAN model, extending it to representation learning by adding an encoder and modifying the discriminator. We extensively evaluate the representation learning and generation capabilities of these BigBiGAN models, demonstrating that these generation-based models achieve the state of the art in unsupervised representation learning on ImageNet, as well as in unconditional image generation. Pretrained BigBiGAN models -- including image generators and encoders -- are available on TensorFlow Hub (https://tfhub.dev/s?publisher=deepmind&q=bigbigan).
研究动机与目标
- 推动从高质量生成模型中进行表征学习,而非自监督任务。
- 通过整合一个编码器和一个联合鉴别器,与 BigGAN 风格的生成器结合,开发 BigBiGAN。
- 通过线性探测在 ImageNet 上系统评估表征学习性能,并评估生成指标(IS, FID)。
- 研究设计选择(编码器架构、单项鉴别子项、生成器容量)及其对表征和生成的影响。
提出的方法
- 使用 BiGAN/ALI 框架,使用 BigGAN 风格的生成器 G 和编码器 E 将数据 x 映射到潜在变量 z。
- 引入一个联合鉴别器 D,通过单项项和联合项对数据 x、潜在变量 z 以及它们的配对 (x,z) 进行评分。
- 采用一个鉴别器架构,F(用于 x)、H(用于 z)、J(联合 x,z)来计算分数 s_x、s_z、s_xz。
- 优化编码器-生成器损失,使之欺骗 D,而 D 学会区分编码器产生的配对与生成器产生的配对。
- 采用不对称的 E/G 设置、较高分辨率的 E 输入,以及解耦的 E/G 优化以加速收敛。
- 通过消融比较不同变体,包括非确定性的 E、单元损失项以及生成器容量;通过 ImageNet 线性探测和生成指标进行评估。
实验结果
研究问题
- RQ1在 BiGAN/ALI 框架中,将基于 BigGAN 的生成器与编码器配对,是否能够学习用于 ImageNet 的高质量无监督表征?
- RQ2单项鉴别项和稳定的联合鉴别器是否能在不牺牲生成质量的前提下改善表征学习?
- RQ3编码器分辨率、生成器容量和解耦的 E/G 优化如何影响下游分类和无条件图像生成?
- RQ4BigBiGAN 学到的表示在 ImageNet 上是否与最先进的自监督方法具有竞争力?
- RQ5表征学习对 BigBiGAN 的无条件生成指标(IS、FID)的影响是什么?
主要发现
- BigBiGAN 在最近使用生成模型的方法中,与最先进的无监督 ImageNet 结果相匹配甚至超越。
- 向鉴别器添加单元项并增加编码器容量同时提升表示质量(Cls.)和生成指标(IS、FID)。
- 非确定性的编码器(从 x 采样 z)在下游分类方面优于确定性编码。
- 提高 E 分辨率和 G 容量通常会提升表征学习,尽管训练效率下降;更高分辨率的 E 可以提升生成质量(FID)。
- 解耦 E 和 G 的优化(更高的 E 学习率)加速训练并使线性分类性能提升数个百分点。
- 在某些配置下,具有高分辨率 E 的无监督 BigBiGAN 生成在 IS/FID 基准上可优于此前的无监督方法,在某些配置下接近或达到有监督基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。