Skip to main content
QUICK REVIEW

[論文レビュー] Balanced Multimodal Learning via On-the-fly Gradient Modulation

Xiaokang Peng, Yake Wei|arXiv (Cornell University)|Mar 29, 2022
Advanced Image and Video Retrieval Techniques被引用数 12
ひとこと要約

本稿では、一般化向上を伴う即時勾配調節(OGM-GE)を提案する。この手法は、モダリティ寄与度の差異に基づいて勾配を調整することで、マルチモーダルモデルの最適化を動的にバランスさせる。同時に、一般化能力を保持するために適応的ガウスノイズを注入する。複数のマルチモーダルベンチマークで一貫した性能向上を達成し、特に最適化が不十分なモダリティの表現を向上させるが、アーキテクチャの変更を要しない。

ABSTRACT

Multimodal learning helps to comprehensively understand the world, by integrating different senses. Accordingly, multiple input modalities are expected to boost model performance, but we actually find that they are not fully exploited even when the multimodal model outperforms its uni-modal counterpart. Specifically, in this paper we point out that existing multimodal discriminative models, in which uniform objective is designed for all modalities, could remain under-optimized uni-modal representations, caused by another dominated modality in some scenarios, e.g., sound in blowing wind event, vision in drawing picture event, etc. To alleviate this optimization imbalance, we propose on-the-fly gradient modulation to adaptively control the optimization of each modality, via monitoring the discrepancy of their contribution towards the learning objective. Further, an extra Gaussian noise that changes dynamically is introduced to avoid possible generalization drop caused by gradient modulation. As a result, we achieve considerable improvement over common fusion methods on different multimodal tasks, and this simple strategy can also boost existing multimodal methods, which illustrates its efficacy and versatility. The source code is available at \url{https://github.com/GeWu-Lab/OGM-GE_CVPR2022}.

研究の動機と目的

  • マルチモーダル学習における最適化の不均衡を解消すること。特に、一方のモダリティが学習を支配し、他方が最適化されない状況を改善すること。
  • マルチモーダルモデルが単一モーダルベースラインを上回る場合でも、両方の単一モーダルエンコーダーの表現品質を向上させること。
  • アーキテクチャ的またはトレーニングのオーバーヘッドなしに、既存の統合手法を強化するプラグイン戦略を開発すること。
  • 勾配調節による一般化能力の低下を防ぐために、適応的ノイズを導入すること。

提案手法

  • 即時勾配調節(OGM)は、トレーニング中に各モダリティが結合損失に寄与する割合の差を動的にモニタリングする。
  • 勾配調節は、この差異に基づいて各モダリティごとの最適化強度を調整し、最適化が不十分なモダリティに多くの更新を割り当てる。
  • 一般化向上(GE)は、調節によって生じる勾配ノイズの減少を補うために、動的に変化するガウスノイズを注入する。
  • SGD や Adam といった標準的な最適化手法と互換性があり、ヴァニラ早期統合から高度な統合アーキテクチャまで適用可能である。
  • ノイズ強度は学習率とバッチサイズに基づいて調整され、一般化性能と正の相関関係を維持するようにする。
  • 追加の分類器や事前学習を必要とせず、エンドツーエンドの統合学習中に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルモデルが単一モーダルモデルを上回る場合でも、なぜその中での単一モーダル表現が最適化されないまま残るのか?
  • RQ2マルチモーダル学習環境において、最適化を各モダリティにバランスさせるために、勾配フローをどのように適応的に制御できるか?
  • RQ3勾配調節がモデルの一般化能力に与える影響は何か? そして、その影響をどのように緩和できるか?
  • RQ4提案手法は、異なる最適化手法、統合戦略、データセットに普遍的に適用可能か?

主な発見

  • VGGSound では、SGD を用いた場合、視覚モダリティの性能が 49.1% から 50.6% に、音声モダリティも 49.1% から 50.6% に向上し、両モダリティで一貫した向上を示した。
  • CREMA-D では、SGD を用いた場合 51.7% から 61.9% に、Adam を用いた場合 49.7% から 54.6% に向上し、異なる最適化手法に対しても有効であることが示された。
  • 同じトレーニング設定下で、ノイズを追加した場合、VGGSound では 48.3% から 50.3% に、CREMA-D では 50.4% から 60.2% に向上した。
  • 小さなバッチサイズと大きな学習率が、より良い性能をもたらすことが確認され、ノイズ強度と一般化性能の理論的関連性が裏付けられた。
  • ヴァニラ統合と高度な統合手法の両方において、Kinetics-Sounds や VGGSound を含む4つのマルチモーダルデータセットで一貫した向上が得られた。
  • SGD と Adam の両最適化手法と組み合わせても効果を示し、広範な互換性とプラグインの有用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。