Skip to main content
QUICK REVIEW

[論文レビュー] Mitigating Modality Collapse in Multimodal VAEs via Impartial Optimization

Adrián Javaloy, Maryam Meghdadi|arXiv (Cornell University)|Jun 9, 2022
AI in cancer detection被引用数 6
ひとこと要約

本稿では、異なるモダリティ間の勾配の相反する影響により一部のモダリティを無視する『モダリティコラプス』を緩和するため、公平な最適化(impartial optimization)を提案する。計算グラフ内に特定の『公平性ブロック』(impartiality blocks)を同定し、マルチタスク学習の手法(例:勾配再重み付け)を適用することで、全モダリティに均等に最適化が行われるよう保証する。この手法により、多様なデータセットおよびアーキテクチャにおいて、再構成性能、条件付き生成、潜在空間の整合性が顕著に向上する。

ABSTRACT

A number of variational autoencoders (VAEs) have recently emerged with the aim of modeling multimodal data, e.g., to jointly model images and their corresponding captions. Still, multimodal VAEs tend to focus solely on a subset of the modalities, e.g., by fitting the image while neglecting the caption. We refer to this limitation as modality collapse. In this work, we argue that this effect is a consequence of conflicting gradients during multimodal VAE training. We show how to detect the sub-graphs in the computational graphs where gradients conflict (impartiality blocks), as well as how to leverage existing gradient-conflict solutions from multitask learning to mitigate modality collapse. That is, to ensure impartial optimization across modalities. We apply our training framework to several multimodal VAE models, losses and datasets from the literature, and empirically show that our framework significantly improves the reconstruction performance, conditional generation, and coherence of the latent space across modalities.

研究の動機と目的

  • 訓練中に一部のモダリティを優遇する傾向を示すモダリティコラプスを解消すること。
  • 計算グラフ内の特定の部分構造(『公平性ブロック』と呼ばれる)における勾配の相反が、モダリティコラプスの根本的原因であることを同定すること。
  • 既存のマルチタスク学習手法を活用することで、全モダリティにわたる公平な最適化を実現する汎用的な訓練フレームワークを構築すること。
  • 複数のVAEアーキテクチャ、損失関数、マルチモーダルデータセットを用いて、フレームワークの有効性を実証的に検証すること。
  • 全モダリティにおける連合分布、周辺分布、条件付き分布のモデリングを向上させ、再構成、生成、分離性の向上を図ること。

提案手法

  • バックプロパゲーション中に異なるモダリティの勾配が相反する計算グラフの部分構造(『公平性ブロック』)を同定する。
  • マルチタスク学習で用いられる勾配相反緩和技術(例:勾配再重み付け、不確実性重み付け)を適用し、全モダリティにわたる最適化のバランスを取る。
  • アーキテクチャの変更なしに、既存のマルチモーダルVAEモデル(例:MVAE、MMVAE、MoPoE)に公平な最適化フレームワークを統合する。
  • ELBO、IWAE、SIWAEなどの異なる訓練目的を用いて、提案手法のロバストネスと一般化性能を評価する。
  • 異種のモダリティ間でのスコア比較を公正に行うために、対数尤度スコアをモダリティ次元数で正規化する。
  • 複数のランダムシードでモデルを学習し、平均値と標準偏差を報告することで統計的信頼性を確保する。

実験結果

リサーチクエスチョン

  • RQ1モダリティコラプスの原因は何か?具体的には、計算グラフ内での特定の勾配の相反が原因であると特定できるか?
  • RQ2既存のマルチタスク学習手法(勾配相反緩和)は、マルチモーダルVAEにおける訓練の公平性向上に効果的に適用可能か?
  • RQ3公平な最適化は、再構成、条件付き生成、潜在空間の質の向上という観点で、顕著な改善をもたらすか?
  • RQ4提案フレームワークは、異なるVAEアーキテクチャ、損失関数、データセットにおいても効果を示すか?
  • RQ5公平な最適化は、負の伝搬を低減させ、マルチモーダル環境下での連合分布モデリングをどの程度向上させるか?

主な発見

  • 提案された公平な最適化フレームワークにより、全モダリティにおける再構成性能が顕著に向上。ELBO損失下でMVAEは連合対数尤度が-8.61から-8.07に改善(+1.22)した。
  • MMVAEでは、ELBO下で『S』モダリティの対数尤度が-2.18から-2.31に低下し、かつて無視されがちなモダリティの適合性が向上した。
  • IWAE損失下のMoPoEでは、『T』モダリティの対数尤度が-1.19から-1.27に低下し、かつて不足気味だったモダリティのモデリングが改善された。
  • 条件付き生成性能と潜在空間の整合性も一貫して向上し、全モダリティサブセットにおける連合および条件付き対数尤度が向上した。
  • 評価された全データセットおよびモデルで最先端の性能を達成し、5つのランダムシードで統計的に有意な改善が得られた。
  • 特に高次元または最適化が不十分なモダリティ(例:画像-テキストVAEにおけるテキストモダリティ)において改善が顕著で、モダリティコラプスの緩和が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。