Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Simulated and Unsupervised Images through Adversarial Training

Ashish Shrivastava, Tomas Pfister|arXiv (Cornell University)|Dec 22, 2016
Domain Adaptation and Few-Shot Learning被引用数 7
ひとこと要約

本論文では、教師なしの実画像データを用いて合成画像のリアルさを向上させつつアノテーションを保持する、GANベースの手法SimGANを用いたシミュレーテッド+アンラベルド(S+U)学習を提案する。局所的 adversarial loss、自己正則化、履歴に基づく discriminator の更新を組み合わせることで、ラベルなしの実画像データを一切使用せずに、視線推定および手のポーズ推定において最先端の性能を達成した。

ABSTRACT

With recent progress in graphics, it has become more tractable to train models on synthetic images, potentially avoiding the need for expensive annotations. However, learning from synthetic images may not achieve the desired performance due to a gap between synthetic and real image distributions. To reduce this gap, we propose Simulated+Unsupervised (S+U) learning, where the task is to learn a model to improve the realism of a simulator's output using unlabeled real data, while preserving the annotation information from the simulator. We develop a method for S+U learning that uses an adversarial network similar to Generative Adversarial Networks (GANs), but with synthetic images as inputs instead of random vectors. We make several key modifications to the standard GAN algorithm to preserve annotations, avoid artifacts, and stabilize training: (i) a 'self-regularization' term, (ii) a local adversarial loss, and (iii) updating the discriminator using a history of refined images. We show that this enables generation of highly realistic images, which we demonstrate both qualitatively and with a user study. We quantitatively evaluate the generated images by training models for gaze estimation and hand pose estimation. We show a significant improvement over using synthetic images, and achieve state-of-the-art results on the MPIIGaze dataset without any labeled real data.

研究の動機と目的

  • 合成画像と実画像の分布のギャップがモデルの汎化性能を妨げる問題に対処すること。
  • 高価な人間によるアノテーションを必要とせず、合成データ上で堅牢なディープラーニングモデルを訓練できること。
  • 画像精錬中にセマンティックアノテーション(例:視線方向、キーポイント位置)を保持すること。
  • 画像精錬のための GAN 訓練を安定化させ、アーチファクトを防止すること。

提案手法

  • 生成器ネットワークを訓練して、 adversarial training を用いて合成画像をより現実的なバージョンに変換する。
  • 画像の小さなパッチに局所的 adversarial loss を適用することで、グローバルな画像レベルの損失と比較して、リアルさを向上させ、アーチファクトを低減する。
  • 元の合成画像と精錬後の画像の間のピクセル単位の大きな差をペナルティ化する自己正則化損失を導入し、アノテーションの保持を促進する。
  • 訓練の履歴として、過去の訓練ステップで得られた精錬済み画像の移動平均を用いて discriminator を更新することで、訓練の安定性を向上させ、モード崩壊を防止する。
  • 生成器と discriminator の両方を、変更された GAN 目的関数に従って交互に訓練する。
  • 空間的構造を維持し、グローバルな歪みを避けるために、完全畳み込みアーキテクチャを用いる。

実験結果

リサーチクエスチョン

  • RQ1adversarial training は、セマンティックアノテーションを保持しつつ、合成画像のリアルさを効果的に向上させることができるか?
  • RQ2画像精錬における視覚的アーチファクトを低減する観点で、局所的 adversarial loss とグローバルな損失とを比較すると、どちらが優れているか?
  • RQ3discriminator の更新時に精錬済み画像の履歴を維持することで、訓練の安定性と画像品質が向上するか?
  • RQ4精錬済み合成データで訓練されたモデルは、人間によるアノテーションが一切ない実データで訓練されたモデルを上回る性能を示せるか?
  • RQ5提案手法は、視線推定や手のポーズ推定といった下流タスクの性能をどの程度向上させるか?

主な発見

  • 精錬済み合成データで学習した場合、NYU テストセットにおいて手のポーズ推定で 5 ピクセル以内の誤差で 72.4% の精度を達成し、実データ学習(74.5%)と合成データ学習(69.7%)を上回った。
  • 合成データを 3 倍に増やした場合、精錬済み合成データでは 5 ピクセル以内の誤差で 83.3% の精度を達成し、実データ学習を顕著に上回った。
  • discriminator の更新時に精錬済み画像の履歴を用いることで、視線推定誤差は履歴なしの 12.2 度から 7.8 度に低下した。
  • ユーザースタディおよび定性的な評価により、精錬済み画像は元の合成画像と比較して著しくリアルであると認識された。
  • 局所的 adversarial loss は、グローバルな adversarial loss を用いた精錬で生じる深度境界のアーチファクトを効果的に解消した。
  • 提案手法は、ラベルなしの実データを一切使用せず、MPIIGaze データセットで最先端の性能を達成した。これは S+U 学習の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。