Skip to main content
QUICK REVIEW

[論文レビュー] VLMixer: Unpaired Vision-Language Pre-training via Cross-Modal CutMix

Teng Wang, Wenhao Jiang|arXiv (Cornell University)|Jun 17, 2022
Multimodal Machine Learning Applications被引用数 12
ひとこと要約

VLMixerは、視覚的根拠のある語をテキストから除去し、意味的に整合性のある画像パッチに置き換えることでマルチモーダル文を生成するクロスモーダルCutMix(CMC)を用いた、未対応の視覚言語事前学習手法を提案する。この手法により、対応データを一切使用せずに暗黙的なクロスモーダルアライメントを実現する。CMCと対照的学習を統合することで、5つの下流ビジョン・ランゲージタスクで最先端性能を達成し、従来の未対応手法を上回る。

ABSTRACT

Existing vision-language pre-training (VLP) methods primarily rely on paired image-text datasets, which are either annotated by enormous human labors, or crawled from the internet followed by elaborate data cleaning techniques. To reduce the dependency on well-aligned image-text pairs, it is promising to directly leverage the large-scale text-only and image-only corpora. This paper proposes a data augmentation method, namely cross-modal CutMix (CMC), for implicit cross-modal alignment learning in unpaired VLP. Specifically, CMC transforms natural sentences from the textual view into a multi-modal view, where visually-grounded words in a sentence are randomly replaced by diverse image patches with similar semantics. There are several appealing proprieties of the proposed CMC. First, it enhances the data diversity while keeping the semantic meaning intact for tackling problems where the aligned data are scarce; Second, by attaching cross-modal noise on uni-modal data, it guides models to learn token-level interactions across modalities for better denoising. Furthermore, we present a new unpaired VLP method, dubbed as VLMixer, that integrates CMC with contrastive learning to pull together the uni-modal and multi-modal views for better instance-level alignments among different modalities. Extensive experiments on five downstream tasks show that VLMixer could surpass previous state-of-the-art unpaired VLP methods.

研究の動機と目的

  • ビジョン・ランゲージ事前学習における高価な人手による画像・テキストペアの依存度を低減すること。
  • 単独の画像およびテキストコーパスのみを用いて、未対応設定下での効果的なクロスモーダルアライメントを可能にすること。
  • 意味を損なわせることなく視覚的トークンを自然言語文に挿入することで、データの多様性を向上させ、モデルの汎化性能を向上させること。
  • データ拡張による暗黙のアライメントを通じて、微細なトークンレベルのクロスモーダル相互作用を学習すること。
  • 画像タグや明示的なアライメントの監視なしに、未対応のビジョン・ランゲージ事前学習で最先端の性能を達成すること。

提案手法

  • クロスモーダルCutMix(CMC)は、事前に構築された視覚的パッチギャラリーから、テキスト内の視覚的根拠のある語を意味的に類似した画像パッチに置き換えることでマルチモーダル文を構築する。
  • 視覚的パッチギャラリーは、概念検出器を用いて画像のみのデータセットから高品質で多様な画像パッチを抽出することで構築され、テキストの概念と意味的に整合性を保つ。
  • 元のテキスト文とそのマルチモーダルなCMC変換版の間で対照的学習の目的関数を適用することで、モダリティ間のインスタンスレベルのアライメントを促進する。
  • 共通のエンコーダーを用いて、ユニモーダルおよびマルチモーダルなビューを同じ埋め込み空間にマップし、対照的損失を通じてアライメントを実現する。
  • pre-training中にパッチ置換の品質とバランスを向上させるために、KショットCMCおよびコンテキストに配慮したサンプリングを導入する。
  • モデルは大規模な未対応の画像およびテキストデータセット(例:COCO)で事前学習され、下流タスクの微調整には一切ペairedデータを用いない。

実験結果

リサーチクエスチョン

  • RQ1CutMixを用いたクロスモーダルデータ拡張は、未対応のビジョン・ランゲージ事前学習におけるクロスモーダルアライメントを改善できるか?
  • RQ2自然言語文に視覚的トークンを挿入することで意味が保持されるとともに、モデルの汎化性能が向上するか?
  • RQ3ペアドデータなしで、ユニモーダルとマルチモーダルなビュー間の対照的学習がモダリティを効果的にアライメントできるか?
  • RQ4テキストコーパスと画像コーパスの間で共有される視覚的概念の数が、下流タスクの性能に与える影響は何か?
  • RQ5サンプリング戦略(例:Kショット、コンテキストに配慮した戦略)がマルチモーダル文の構築品質に与える影響は何か?

主な発見

  • VLMixerは、VQAやNLVR2を含む5つの下流ビジョン・ランゲージタスクで最先端の性能を達成し、従来の未対応事前学習手法を上回る。
  • NLVR2ベンチマークでは、テストセットで73.08%の正確度を達成し、前回の最先端手法を大きく上回った。
  • アブレーションスタディの結果、KショットCMCおよびコンテキストに配慮したサンプリングの両方が性能向上に寄与しており、K値が大きいほどバランスの取れたトークン混合が得られ、より良い結果が得られた。
  • パッチギャラリー内の共有概念の数が性能に正の相関を示し、1200個の概念でピークに達した後、長尾クラスでの誤認識の影響でわずかに低下した。
  • ユニモーダルとマルチモーダルなビュー間の対照的学習は、テキストのみのデータ拡張(例:クロッピング、語の削除)を上回り、クロスモーダルな監視の有効性を示した。
  • モデルの性能はデータ拡張の設計に対して頑健であり、クロスモーダルな対照的学習は複数のタスクで一貫して結果を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。