Skip to main content
QUICK REVIEW

[論文レビュー] ERNIE-ViL 2.0: Multi-view Contrastive Learning for Image-Text Pre-training

Bin Shan, Weichong Yin|arXiv (Cornell University)|Sep 30, 2022
Multimodal Machine Learning Applications被引用数 10
ひとこと要約

ERNIE-ViL 2.0 は、多視点対照学習フレームワークを提案し、多様な視点におけるモodal内およびモダリティ間相関をモデル化することで、画像・テキスト事前学習におけるクロスモダリティ表現を向上させる。オブジェクトタグを特別なテキスト的視点として導入し、二重エンコーダー構造を活用することで、公開データのみを用いて中国語クロスモダリティリテンションで最先端の性能を達成するとともに、英語ベンチマークでも競争力のある結果を示した。

ABSTRACT

Recent Vision-Language Pre-trained (VLP) models based on dual encoder have attracted extensive attention from academia and industry due to their superior performance on various cross-modal tasks and high computational efficiency. They attempt to learn cross-modal representation using contrastive learning on image-text pairs, however, the built inter-modal correlations only rely on a single view for each modality. Actually, an image or a text contains various potential views, just as humans could capture a real-world scene via diverse descriptions or photos. In this paper, we propose ERNIE-ViL 2.0, a Multi-View Contrastive learning framework to build intra-modal and inter-modal correlations between diverse views simultaneously, aiming at learning a more robust cross-modal representation. Specifically, we construct multiple views within each modality to learn the intra-modal correlation for enhancing the single-modal representation. Besides the inherent visual/textual views, we construct sequences of object tags as a special textual view to narrow the cross-modal semantic gap on noisy image-text pairs. Pre-trained with 29M publicly available datasets, ERNIE-ViL 2.0 achieves competitive results on English cross-modal retrieval. Additionally, to generalize our method to Chinese cross-modal tasks, we train ERNIE-ViL 2.0 through scaling up the pre-training datasets to 1.5B Chinese image-text pairs, resulting in significant improvements compared to previous SOTA results on Chinese cross-modal retrieval. We release our pre-trained models in https://github.com/PaddlePaddle/ERNIE.

研究の動機と目的

  • 画像・テキスト事前学習において、多様な視点におけるモダリティ内およびモダリティ間相関をモデル化することで、クロスモダリティ表現のロバスト性を向上させること。
  • ウェブクロールされたノイズの多い画像・テキストペアにおける意味的ギャップを解消するため、オブジェクトタグを特別なテキスト的視点として導入し、より良いクロスモダリティ整合性を実現すること。
  • 公開データセットのみを用いてクロスモダリティリテンションで優れた性能を達成し、英語および中国語のタスクにおける堅実なベンチマークを確立すること。
  • 15億の中国語画像・テキストペアにスケーリングすることで、中国語クロスモダリティリテンションで最先端の結果を達成すること。

提案手法

  • 各モダリティ内に複数の視点を構築し、画像同士およびテキスト同士のペアを用いてモダリティ内相関を学習し、単一モダリティの表現を向上させる。
  • オブジェクトタグのシーケンスを特別なテキスト的視点として導入し、細粒度の視覚的コンセプトとテキスト記述の間を橋渡し、クロスモダリティ意味的ギャップを縮小する。
  • 二重エンコーダー構造を採用し、多様な視点ペア(例:(タグ, 画像)、(テキスト, 画像))における対照学習を実施することで、クロスモダリティ整合性を共同最適化する。
  • すべての視点ペアにわたる表現を共同最適化する多視点対照学習目的関数を採用し、ロバスト性および一般化性能を向上させる。
  • 2900万件の公開利用可能な英語画像・テキストペアでモデルを事前学習し、中国語ペアを15億件にスケーリングすることで、ゼロショットおよびフェイントショット一般化性能を向上させる。
  • クロスモダリティマッチングにコサイン類似度を活用し、複数の視点組み合わせにわたる対照損失を適用することで、視点不変な表現を促進する。

実験結果

リサーチクエスチョン

  • RQ1複数の視点におけるモダリティ内およびモダリティ間相関をモデル化することで、画像・テキスト事前学習におけるクロスモダリティ表現のロバスト性および一般化性能が向上するか?
  • RQ2ノイズの多い画像・テキストペアにおける意味的ギャップを低減する目的で、オブジェクトタグを特別なテキスト的視点として用いることはどの程度有効か?
  • RQ3公開データセットのみを用いた多視点対照学習フレームワークが、クロスモダリティリテンションで最先端の性能を達成できるか?
  • RQ415億の中国語画像・テキストペアに事前学習データをスケーリングすることで、中国語クロスモダリティリテンションタスクの性能が顕著に向上するか?

主な発見

  • ERNIE-ViL 2.0 は、単一視点対照学習ベースラインと比較して、画像・テキストリテンションの平均Recallで2.3%の絶対的向上を達成した。
  • テキストから画像へのリテンションでは3.2%の絶対的向上を示し、より困難なテキストから画像へのタスクで優れた性能を発揮した。
  • オブジェクトタグを用いたモダリティ間対照学習を追加することで、平均Recallが1.6%向上し、意味的ギャップを埋める有効性が裏付けられた。
  • 15億の画像・テキストペアで事前学習を実施した後、中国語クロスモダリティリテンションで最先端の結果を達成し、以前の最先端手法を大きく上回った。
  • ゼロショット一般化性能が強く、細粒度的・抽象的・長尾のテキストクエリに対しても画像を効果的に検索できた。
  • 画像およびテキストのリテンション結果から、ERNIE-ViL 2.0 がノイズの多いウェブクロールデータでさえも、細粒度のコンセプトおよびインスタンスを効果的に学習していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。