Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Generative Models for Compositional Representation Learning

Mike Wu, Noah D. Goodman|arXiv (Cornell University)|Dec 11, 2019
Multimodal Machine Learning Applications参考文献 74被引用数 5
ひとこと要約

本論文は、結合尤度における形式的かつ正当な変分下界を用いる、新しいマルチモーダル生成モデルの族を提案する。これにより、従来のマルチモーダルVAEが周辺分布や条件付き分布に偏りがちであったという欠陥を是正する。この手法は、異なるモダリティにVAE、GAN、ノーマライジングフローを組み合わせることで、結合尤度推定および下流の構成的タスクにおいて優れた性能を達成する。特に弱教師あり設定やモダリティ欠損状況下でも顕著な性能向上を示す。言語による教師あり学習では、より抽象的かつ構成的である視覚的表現を学習する。

ABSTRACT

As deep neural networks become more adept at traditional tasks, many of the most exciting new challenges concern multimodality---observations that combine diverse types, such as image and text. In this paper, we introduce a family of multimodal deep generative models derived from variational bounds on the evidence (data marginal likelihood). As part of our derivation we find that many previous multimodal variational autoencoders used objectives that do not correctly bound the joint marginal likelihood across modalities. We further generalize our objective to work with several types of deep generative model (VAE, GAN, and flow-based), and allow use of different model types for different modalities. We benchmark our models across many image, label, and text datasets, and find that our multimodal VAEs excel with and without weak supervision. Additional improvements come from use of GAN image models with VAE language models. Finally, we investigate the effect of language on learned image representations through a variety of downstream tasks, such as compositionally, bounding box prediction, and visual relation prediction. We find evidence that these image representations are more abstract and compositional than equivalent representations learned from only visual data.

研究の動機と目的

  • 既存のマルチモーダルVAEに見られる形式的で正しくない変分下界の欠如を是正すること。これは、しばしば周辺分布や条件付き分布に偏りがちな傾向がある。
  • 異なるモダリティに異なる生成モデル(VAE、GAN、フロー)を統合可能な統一された目的関数を構築し、画像やテキストのような複雑なデータのハイブリッドモデリングを可能にすること。
  • 現実世界のマルチモーダルデータ収集で一般的な弱教師ありおよびモダリティ欠損状況下での性能を評価すること。
  • 言語によるガイド付き学習によって得られる視覚的表現が、ビジョンオンリーモデルに比べてより構成的かつ汎化可能であるかを検証すること。
  • マルチモーダルに学習された特徴量を用いて、物体検出や視覚的関係予測などの下流タスクで性能向上を示すこと。

提案手法

  • 結合周辺尤度 $\log p_\theta(\mathbf{x}, \mathbf{y})$ における新しい変分下界を導出。これにより、従来のマルチモーダルVAEで不正な目的関数として使われていたものを是正する。
  • 結合事後分布の変分分散分解を導入。これにより周辺分布と条件付き分布の成分が明確に分離され、結合密度に対する有効な下界が保証される。
  • 異なるモダリティに異なる生成モデルタイプ(VAE、GAN、フロー)を組み合わせることでハイブリッドモデリングを可能にし、例えばテキストにはVAE、画像にはGANやフローを適用可能にする。
  • 単一モダリティの事後分布をガウス分布の積として組み合わせる、連携事後分布 $q_\phi(\mathbf{z}|\mathbf{x}, \mathbf{y})$ を採用。これにより変分推論の整合性が保たれる。
  • VAE-VAE や VAE-GAN などのモデルを、GANによる高品質な画像生成とVAEによる離散的テキストモデリングを活用して学習に用いる。
  • 弱教師あり学習を実装。小規模なペアドデータセットで学習しながら、大規模なペアドでないデータセットを活用することで、欠損モダリティに対する一般化性能と耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1結合尤度における形式的かつ正当な変分下界が、従来のマルチモーダルVAEに比べてマルチモーダル表現学習をどのように改善するか?
  • RQ2異なる生成モデル族(VAE、GAN、フロー)を異なるモダリティに適用することで、現実世界の複雑なデータセットにおける性能向上が達成できるか?
  • RQ3弱教師ありおよびモダリティ欠損状況下で、マルチモーダル生成モデルはどのように性能を示すか?
  • RQ4言語によるガイド付きで学習された視覚的表現は、ビジョンオンリーモデルに比べてより構成的構造を示すか?
  • RQ5マルチモーダル表現は、物体検出や視覚的関係予測といった下流タスクでどの程度性能を向上させるか?

主な発見

  • 提案手法のマルチモーダルVAEは、結合尤度推定およびクロスマダリティ翻訳タスクにおいて、従来手法を上回る性能を示す。特に弱教師ありおよびモダリティ欠損状況下で顕著な改善を示す。
  • VAE-GANモデル(言語にはVAE、画像にはGANを適用)は、サンプル品質と表現学習の両面で顕著な向上を達成する。
  • 言語と併せて学習された視覚的表現は、より強い構成的構造を示し、物体検出や視覚的関係予測タスクでの性能向上に寄与する。
  • 高い欠損率が発生しても、モデルは強固な性能を維持する。これにより、不完全なモダリティに対しても耐性があることが示された。
  • 新しい目的関数は、MVAE や JMVAE とは異なり、結合周辺尤度を正しく下界で抑えている。これら従来手法は、周辺分布に偏るか、結合密度を正しく界磁しない。
  • 画像、テキスト、ラベルデータセットに対する実験結果から、提案手法で学習されたマルチモーダル生成モデルは、より抽象的かつ汎化可能な表現を学習できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。