Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Learning of General Transformations for Data Augmentation

Saypraseuth Mounsaveng, David Vázquez|arXiv (Cornell University)|Sep 21, 2019
Generative Adversarial Networks and Image Synthesis参考文献 40被引用数 7
ひとこと要約

本論文は、空間変換ネットワーク(STN)とU-Netベースのエンコーダデコーダアーキテクチャを用いて一般化された画像変換を学習する、エンドツーエンドで微分可能なデータオーグメンテーションフレームワークを提案する。このフレームワークは敵対的学習により、多様でクラスを保持するオーグメンテーションを生成する。本手法は、手作業によるオーグメンテーションや画像生成ベースの手法を上回り、MNIST、Fashion-MNIST、SVHN、CIFAR-10において、特にデータが少ない状況下で最先端の精度を達成する。

ABSTRACT

Data augmentation (DA) is fundamental against overfitting in large convolutional neural networks, especially with a limited training dataset. In images, DA is usually based on heuristic transformations, like geometric or color transformations. Instead of using predefined transformations, our work learns data augmentation directly from the training data by learning to transform images with an encoder-decoder architecture combined with a spatial transformer network. The transformed images still belong to the same class but are new, more complex samples for the classifier. Our experiments show that our approach is better than previous generative data augmentation methods, and comparable to predefined transformation methods when training an image classifier.

研究の動機と目的

  • ヒューリスティックなデータオーグメンテーションの限界、すなわちドメイン特有の知識を要し、データ分布に適応できない点を是正すること。
  • GANベースの画像生成がデータが少ない状況で不安定で性能が低い問題を、サンプルをゼロから生成するのではなく変換を学習することで克服すること。
  • データオーグメンテーション生成器と分類器をエンドツーエンドで微分可能に同時に学習させることで、分類器の一般化性能を向上させること。
  • STNによるグローバルなアフィン変換とU-Netによるローカルなピクセル単位の歪みを組み合わせることで、より強固で多様なデータオーグメンテーションを実現すること。

提案手法

  • 本手法は、ノイズベクトルと入力画像から、空間変換ネットワーク(STN)を用いてグローバルなアフィン変換を学習し、微分可能な空間的変換を可能にする。
  • U-Netベースのエンコーダデコーダアーキテクチャは、入力画像の潜在表現上で、色のずれやテクスチャの変化などのローカルで非剛体な歪みを学習する。
  • 生成器は2つの判別器を用いて敵対的に訓練される:クラス判別器($D^C$)は、拡張されたサンプルが元のクラスに属し続けることを保証し、類似度判別器($D^D$)は、恒等変換や自明な変換を防ぐ。
  • 生成器と分類器の間に追加の敵対的損失を導入することで、誤分類されやすい難しいサンプルの生成を促進し、分類器のロバスト性を向上させる。
  • 全システムはエンドツーエンドで訓練され、バックプロパゲーションを用いて生成器、判別器、分類器を同時に最適化する。
  • 本手法はMNIST、Fashion-MNIST、SVHN、CIFAR-10に適用され、部成分の寄与を検証するアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1敵対的学習による画像変換は、分類器の精度において、従来の手作業によるデータオーグメンテーションを上回ることができるか?
  • RQ2画像をゼロから生成するのではなく変換を学習することで、特に訓練データが少ない状況下でも性能が向上するか?
  • RQ3生成器と分類器を同時にエンドツーエンドで学習させることは、別々に学習させるよりも効果的か?
  • RQ4STNによるグローバル(アフィン)変換とU-Netによるローカル(ピクセル単位)変換を組み合わせることで、単独で使用する場合よりも優れたデータオーグメンテーションが得られるか?
  • RQ5クラス判別器と類似度判別器の二重判別器の使用は、自明な変換を防ぎ、一般化性能を向上させるのに効果的か?

主な発見

  • 提案手法は、あらかじめ定義されたデータオーグメンテーションを一切使用しないMNISTにおいて80.5%のテスト精度を達成し、ベースライン分類器(66%)を上回り、手作業およびGANベースのオーグメンテーション手法をも凌駆する。
  • STN(グローバル変換)とU-Net(ローカル歪み)の組み合わせが最高の性能を発揮し、両方のモジュールを用いた場合の精度は80.14%に達する。
  • 両方の判別器($D^C$ と $D^D$)を併用することで、精度が73.82%に向上し、単一判別器のバリアントを著しく上回る。
  • 生成器と分類器の間に敵対的損失を追加することで、さらに精度が向上し、困難で誤分類されやすいサンプルの生成がモデルのロバスト性を向上させることを示している。
  • アブレーションスタディにより、STN、U-Net、二重判別器、および共同学習の各要素が最適な性能を発揮するために不可欠であることが確認された。
  • モデルはデータセット固有の変換を学習している:例えば、SVHNでは中央の数字にズームインし、CIFAR-10では色とコントラストの変更を適用し、MNISTおよびFashion-MNISTではフリップを避ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。