Skip to main content
QUICK REVIEW

[論文レビュー] DualDis: Dual-Branch Disentangling with Adversarial Learning

Thomas Robert, Nicolas Thome|arXiv (Cornell University)|Jun 3, 2019
Digital Media Forensic Detection参考文献 45被引用数 4
ひとこと要約

DualDisは、クラスと属性情報を別々の線形化された潜在部分空間に分離するため、敵対的訓練を用いた二重ブランチオートエンコーダを提案する。敵対的分類器を用いて直交的な分離を強制することで、正確な意味的画像編集と効果的な半教師ありデータ拡張を可能にし、CelebAで最先端の分離性能を達成するとともに、Yale-Bで生成データを用いた際10%の精度向上を達成した。

ABSTRACT

In computer vision, disentangling techniques aim at improving latent representations of images by modeling factors of variation. In this paper, we propose DualDis, a new auto-encoder-based framework that disentangles and linearizes class and attribute information. This is achieved thanks to a two-branch architecture forcing the separation of the two kinds of information, accompanied by a decoder for image reconstruction and generation. To effectively separate the information, we propose to use a combination of regular and adversarial classifiers to guide the two branches in specializing for class and attribute information respectively. We also investigate the possibility of using semi-supervised learning for an effective disentangling even using few labels. We leverage the linearization property of the latent spaces for semantic image editing and generation of new images. We validate our approach on CelebA, Yale-B and NORB by measuring the efficiency of information separation via classification metrics, visual image manipulation and data augmentation.

研究の動機と目的

  • 画像データにおけるアイデンティティ(クラス)と視覚的属性情報の明示的分離を可能にする、分離表現学習フレームワークの開発。
  • 敵対的訓練を用いて潜在空間におけるクラスと属性要因の直交性を強制すること。
  • 各潜在部分空間における変動要因の線形化を図り、効果的な意味的画像操作および生成を可能にすること。
  • 限定的なラベルを用いた半教師あり学習を可能にし、強力な分離性能を維持すること。
  • 意味的データ拡張を通じて実用的利点を示すこと。

提案手法

  • DualDisは、1つのブランチがアイデンティティ(クラス)を、もう1つのブランチが属性をエンコードする二重ブランチのエンコーダ・デコーダアーキテクチャを用いる。各ブランチは専用の分類器によってガイドされる。
  • 敵対的分類器は、それぞれの潜在空間において反対側のドメインの情報を検出することを学習させ、エンコーダがクロスドメイン信号を除去するよう強制することで、分離を達成する。
  • 再構成損失により、結合された潜在コードから現実的な画像を生成できるようにする。
  • 線形分類器を用いて各潜在部分空間における要因の線形化をガイドし、ベクトル演算による意味的ナビゲーションを可能にする。
  • 半教師あり学習は、ラベルなしデータを訓練中に活用することで、アノテーション依存性を低減する。
  • アイデンティティを保持したまま、属性潜在コードを学習された線形方向に変更することで画像編集を実行する。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練は、共有された画像表現におけるクラスと属性要因の分離を効果的に可能にするか?
  • RQ2潜在部分空間間の直交性を強制することで、分離品質と下流分類精度が向上するか?
  • RQ3線形化された潜在空間は、ベクトル演算を通じてどの程度正確な意味的画像編集を可能にするか?
  • RQ4半教師あり学習を用いることで、限定的なラベルで強力な分離性能を達成できるか?
  • RQ5モデルから生成された画像は、意味的データ拡張を通じてアイデンティティ分類精度を向上させることができるか?

主な発見

  • DualDisはCelebAで最先端の分離性能を達成し、アイデンティティおよび属性の両方で高い分類精度を達成した。
  • Yale-Bデータセットでは、1クラスあたり60枚の生成画像を用いたデータ拡張により、アイデンティティ分類精度がほぼ10ポイント向上した。
  • 学習された線形方向に沿って性別、眼鏡、笑顔の強度といった属性を変更することで、意味的画像編集を成功させた。
  • 1枚の画像のアイデンティティと別の画像の属性を組み合わせることで、妥当で意味的に一貫した結果が得られ、効果的な分離が確認された。
  • 半教師あり学習により、ラベルが限られた状況でも強力な分離性能を維持でき、アノテーション不足に対する耐性が示された。
  • 線形化された潜在空間により、笑顔の強度や髪の色の変化など、微細な属性変更が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。