Skip to main content
QUICK REVIEW

[論文レビュー] DeMIAN: Deep Modality Invariant Adversarial Network

Kuniaki Saito, Yusuke Mukuta|arXiv (Cornell University)|Dec 23, 2016
Domain Adaptation and Few-Shot Learning参考文献 31被引用数 4
ひとこと要約

DeMIANは、画像とテキストの2つのモダリティ間で分布をアライメントすることで、敵対的訓練を用いてモダリティ不変表現を学ぶ深層敵対的ネットワークを提案する。この手法は、ペア化されたサンプルの関係性とドメイン適応の原則を併用する。CUB-200-2011およびSUN Attributeデータセットにおいて、ゼロショット学習で最先端の性能を達成し、従来手法よりも2〜3%の精度向上を実現した。

ABSTRACT

Obtaining common representations from different modalities is important in that they are interchangeable with each other in a classification problem. For example, we can train a classifier on image features in the common representations and apply it to the testing of the text features in the representations. Existing multi-modal representation learning methods mainly aim to extract rich information from paired samples and train a classifier by the corresponding labels; however, collecting paired samples and their labels simultaneously involves high labor costs. Addressing paired modal samples without their labels and single modal data with their labels independently is much easier than addressing labeled multi-modal data. To obtain the common representations under such a situation, we propose to make the distributions over different modalities similar in the learned representations, namely modality-invariant representations. In particular, we propose a novel algorithm for modality-invariant representation learning, named Deep Modality Invariant Adversarial Network (DeMIAN), which utilizes the idea of Domain Adaptation (DA). Using the modality-invariant representations learned by DeMIAN, we achieved better classification accuracy than with the state-of-the-art methods, especially for some benchmark datasets of zero-shot learning.

研究の動機と目的

  • 完全にペア化されたラベル付きデータを必要としない状況でも、画像やテキストといった異なるモダリティ間で分類が可能なモダリティ不変表現を学習すること。
  • 完全にラベル付きのマルチモーダルデータセットを収集する際の高い人的コストを低減するため、不完全なデータ(例:ペア化された画像とテキスト、またはラベル付きの非ペアデータ)を用いて学習すること。
  • 異なるモダリティ間の表現の分布をより類似させることで、未観測のモダリティへの一般化を向上させること。
  • ドメイン適応(分布アライメント)とマルチモーダル学習(ペアワイズサンプルマッチング)の長所を統合した敵対的フレームワークに統合すること。

提案手法

  • DeMIANは、異なるモダリティ(例:画像とテキスト)からの入力を、共有されたモダリティ不変表現空間に写像する生成ネットワークGを用いる。
  • 異なるモダリティからの表現を区別するモダリティ識別器Dを採用し、生成器がモダリティに依存しない特徴を生成するよう促す。
  • 生成器は、共有空間内でのペア化されたサンプル(例:対応する画像とテキスト)間の距離を最小化するように学習する。この際、ハイパーパrameter λ=10 を用いたコサイン距離を用いる。
  • 敵対的訓練を適用し、生成器が識別器の誤差を最大化するように学習させることで、ドメイン不変表現を促進する。
  • 各モダリティに別個のエンコーダーを用い、識別器の共有された隠れ層により、モダリティに依存しない特徴学習を強制する。
  • 分類用のクロスエントロピー損失と敵対的損失を用い、重み減衰と固定された学習率 2.0×10⁻⁴ を用いて、エンドツーエンドで学習を行う。

実験結果

リサーチクエスチョン

  • RQ1部分的なラベルやペア化されたサンプルしか入手できない不完全なマルチモーダルデータから、モダリティ不変表現を効果的に学習できるか?
  • RQ2異なるモダリティ間で分布をアライメントする敵対的訓練は、従来手法と比較してゼロショット分類性能を向上させるか?
  • RQ3ペアワイズサンプルマッチングとドメイン適応の原則を組み合わせることで、クロスマodal転移学習における一般化性能が向上するか?
  • RQ4訓練に使用可能なラベル付きサンプルの割合が非常に少ない場合、提案手法はどの程度頑健か?

主な発見

  • CUB-200-2011データセットでは、DeMIANは従来手法よりも約3%のゼロショット認識精度向上を達成し、最先端の性能を実現した。
  • SUN Attributeデータセットでは、DeMIANは約2%のゼロショット精度向上を達成し、アンサンブルモデルを必要としていた従来の最先端手法を上回った。
  • SUN Attributeのリtrievalベースの分類タスクにおいて、DeMIANはSocherら[30]と比較して、猫-トラックを除くすべてのクラスペアで高い精度を達成し、優れた一般化性能を示した。
  • t-SNE可視化により、DeMIANが学習した表現はVGG特徴と比較してクラスごとにより明確にクラスタリングされており、クラス間の分離が明確であることが確認された。
  • ラベル付きサンプルがたった0.5%の状況でも、DeMIANは最先端手法[38]と同等の性能を維持しており、優れたサンプル効率性を示した。
  • 識別器が共有表現空間内で異なるモダリティを区別できなかったことから、モデルが効果的に分布アライメントを実現していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。