Skip to main content
QUICK REVIEW

[論文レビュー] CoDeGAN: Contrastive Disentanglement for Generative Adversarial Network

Jiangwei Zhao, Zejia Liu|arXiv (Cornell University)|Mar 5, 2021
Adversarial Robustness in Machine Learning参考文献 46被引用数 6
ひとこと要約

この論文は、視覚的データにおけるクラス間要因の変動を分離するために対照学習を活用する、生成対抗ネットワークのための新しい対照的分離フレームワークCD-GANを提案する。クラス関連特徴における対照的損失とラベル付きアーキテクチャ画像による限定的教師付き情報の統合により、CD-GANは教師なし分離性能において最先端の水準に達し、わずか1–2%のラベル付きデータでも顕著に向上する。

ABSTRACT

Disentanglement, a critical concern in interpretable machine learning, has also garnered significant attention from the computer vision community. Many existing GAN-based class disentanglement (unsupervised) approaches, such as InfoGAN and its variants, primarily aim to maximize the mutual information (MI) between the generated image and its latent codes. However, this focus may lead to a tendency for the network to generate highly similar images when presented with the same latent class factor, potentially resulting in mode collapse or mode dropping. To alleviate this problem, we propose exttt{CoDeGAN} (Contrastive Disentanglement for Generative Adversarial Networks), where we relax similarity constraints for disentanglement from the image domain to the feature domain. This modification not only enhances the stability of GAN training but also improves their disentangling capabilities. Moreover, we integrate self-supervised pre-training into CoDeGAN to learn semantic representations, significantly facilitating unsupervised disentanglement. Extensive experimental results demonstrate the superiority of our method over state-of-the-art approaches across multiple benchmarks. The code is available at https://github.com/learninginvision/CoDeGAN.

研究の動機と目的

  • 生成対抗ネットワークにおける分離表現の学習という課題に取り組む。これは確率的推論やサンプル尤度を欠いているためである。
  • 同じ要因値が類似した画像特徴を生成するという直感に基づき、対照的学習を用いたGANにおけるクラス間分離の新しいパラダイムを検討する。
  • 特に複雑なデータ分布において、限定的教師付き情報を最大限に活用する方法を模索する。
  • 対照的損失の設計により、訓練の安定性を向上させ、モード崩壊を防止する。

提案手法

  • 生成器、識別器、エンコーダを備えた対照的分離フレームワーク(CD-GAN)を導入し、生成器は連続的コンテンツコードzとワンホット要因コードcを用いる。
  • 実画像をラベル付きのアーキテクチャポイントとして扱い、生成画像の特徴と同クラスまたは異クラスの実画像の特徴を対照的に比較する対照的損失を採用する。
  • ℓ₂損失と対照的損失の両方を用いてエンコーダを監視し、同じクラスの画像の特徴を引き寄せ、異なるクラスの特徴を引き離すようにする。
  • 対照的損失を介して、明示的な尤度や事後分布推論がなくても、生成器がクラス一貫性のあるサンプルを生成するように間接的に誘導する。
  • MNIST、Fashion-MNIST、CIFAR-10、dSprites、Facesなど複数のデータセットにこのフレームワークを適用し、ラベル効率に関するアブレーションスタディを実施する。
  • SNGANアーキテクチャを用い、標準指標(正解度ACC、正規化相互情報量NMI、調整ランダムインデックスARI、FID、インセプションスコアIS)を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1確率的推論に依存せずに、対照的学習をGANにおけるクラス間要因の分離に効果的に適用できるか?
  • RQ2GANベースのモデルにおける分離性能を向上させるために、限定的教師付き情報をどのように最大限に活用できるか?
  • RQ3対照的損失はGANの訓練を安定化させ、モード崩壊を緩和するのを助けるか?
  • RQ4CD-GANは教師なしおよび弱教師あり設定において最先端の分離性能を達成できるか?

主な発見

  • MNISTでは、教師なし設定で0.91 ACC、0.93 NMI、0.94 ARIを達成し、InfoGAN や ClusterGAN より優れた性能を示した。
  • Fashion-MNISTでは、教師なし設定で0.66 ACC、0.62 NMI、0.53 ARIを達成し、ベースライン手法を著しく上回った。
  • わずか1–2%のラベル付きデータで、Fashion-MNISTで0.82 ACC、0.72 NMI、0.68 ARIを達成し、分離性能が顕著に向上した。
  • CIFAR-10のような複雑なデータセットでは、5%のラベルで0.41 ACC、7.65 IS、23.97 FIDを達成し、教師なしベースラインより著しく優れており、教師あり手法と競合する性能を示した。
  • 対照的損失の設計により、実画像のラベル付きアーキテクチャをアーキテクチャポイントとして用いることで、特徴の分離性と生成画像のキャリブレーションが向上し、一般化性と分離性が向上した。
  • CD-GANは訓練の安定性が向上し、モード崩壊が軽減された。これは、対照的損失が生成サンプルの多様性と一貫性を促進するためであると考察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。