Skip to main content
QUICK REVIEW

[論文レビュー] MARMOT: A Deep Learning Framework for Constructing Multimodal Representations for Vision-and-Language Tasks

Patrick Y. Wu, Walter R. Mebane|arXiv (Cornell University)|Sep 23, 2021
Multimodal Machine Learning Applications参考文献 9被引用数 5
ひとこと要約

MARMOT は、計算コストの高い事前学習をモダリティ変換に置き換えることで、画像やテキストが欠損している場合でも有効な表現学習が可能な深層学習フレームワークであり、視覚言語タスクのためのマルチモーダル表現を構築する。2016年米国大統領選挙の不正行為ツイート分類タスクでは20のカテゴリのうち19でテキストのみのモデルを上回り、Hateful Memes データセットでは VisualBERT の精度を 2.87%、AUC を 3.89% 向上させた。

ABSTRACT

Political activity on social media presents a data-rich window into political behavior, but the vast amount of data means that almost all content analyses of social media require a data labeling step. However, most automated machine classification methods ignore the multimodality of posted content, focusing either on text or images. State-of-the-art vision-and-language models are unusable for most political science research: they require all observations to have both image and text and require computationally expensive pretraining. This paper proposes a novel vision-and-language framework called multimodal representations using modality translation (MARMOT). MARMOT presents two methodological contributions: it can construct representations for observations missing image or text, and it replaces the computationally expensive pretraining with modality translation. MARMOT outperforms an ensemble text-only classifier in 19 of 20 categories in multilabel classifications of tweets reporting election incidents during the 2016 U.S. general election. Moreover, MARMOT shows significant improvements over the results of benchmark multimodal models on the Hateful Memes dataset, improving the best result set by VisualBERT in terms of accuracy from 0.6473 to 0.6760 and area under the receiver operating characteristic curve (AUC) from 0.7141 to 0.7530.

研究の動機と目的

  • 政治科学研究における最先端の視覚言語モデルが、画像とテキストの両方を必要とし、高コストな事前学習に依存するという限界を是正すること。
  • 画像やテキストが欠損している可能性のあるマルチモーダルソーシャルメディアデータに対して、効果的な表現学習を可能にすること。
  • 計算コストの高い事前学習を、クロスモダリティ関係を効率的に学習するモダリティ変換に基づくアプローチに置き換えること。
  • マルチモーダルコンテンツが一般的だが不完全な現実世界の政治的・ソーシャルメディアデータにおける分類性能を向上させること。
  • 高価な計算リソースにアクセスできない社会科学者にとって実用的でアクセスしやすいフレームワークを提供すること。

提案手法

  • MARMOT は、1つのモダリティから別のモダリティを再構築することで、モダリティ変換を通じて共同マルチモーダル表現を学習するトランスフォーマー基盤のアーキテクチャを採用する。
  • 画像特徴とテキスト特徴のための二重エンコーダー構成を採用し、それらをアライメントするためにクロスアテンション機構を用いる。
  • 標準的な事前学習の代わりに、モダリティ変換における対照的学習目的を採用することで、ゼロショットまたはフェイントショットの新しいドメインへの適応が可能になる。
  • 1つのモダリティが欠損している場合でも、関連する表現を生成したりアテンションを集中させたりする能力を備えることで、欠損モダリティをサポートする。
  • 重み付き Adam を用い、コサイン学習率スケジューリングを適用し、グリッドサーチを用いてバリデーションセット上でハイパーパramータを最適化する。
  • 安定性を確保するため、初期に言語モデルとモダリティ変換デコーダーを固定した後、エンドツーエンドで微調整する。

実験結果

リサーチクエスチョン

  • RQ1画像とテキストの両方が各サンプルに必要としない視覚言語フレームワークは、政治科学研究データで強力な性能を発揮できるか?
  • RQ2高コストな事前学習を置き換えることで、マルチモーダル理解タスクの性能を維持または向上させられるか?
  • RQ3MARMOT は、ソーシャルメディアからの選挙事件レポート分類において、テキスト中心のモデルやマルチモーダルベースラインと比べてどのように差をつけるか?
  • RQ4MARMOT は、最先端のモデルと比較して、Hateful Memes ベンチマークでの性能をどの程度向上させるか?
  • RQ5MARMOT は、欠損または不完全なモダリティを含む現実世界のソーシャルメディアデータに一般化できるか?

主な発見

  • 2016年米国大統領選挙期における選挙不正ツイートを分類するタスクにおいて、MARMOT はテキストのみのアンサンブル分類器よりも20のマルチラベルカテゴリのうち19で優れた性能を示した。
  • Hateful Memes データセットでは、MARMOT は精度 0.6580、AUC 0.7587 を達成し、VisualBERT の精度(0.6473)と AUC(0.7141)を上回った。
  • VisualBERT に対する改善は、精度で 2.87 パーセンテージポイント、AUC で 3.89 パーセンテージポイントであり、顕著な性能向上を示した。
  • モデルは安定した学習ダイナミクスを示し、初期の 4 エポック間のパラメータ固定後、バリデーション精度が単調に増加した。
  • MARMOT は欠損モダリティに対して頑健であり、1つのモダリティのみが存在する場合でも性能を維持した。
  • 大規模な画像キャプションデータセットでの完全な事前学習を必要とせず、Hateful Memes バリデーションセットで最先端の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。