Skip to main content
QUICK REVIEW

[論文レビュー] VAuLT: Augmenting the Vision-and-Language Transformer for Sentiment Classification on Social Media

Georgios Chochlakis, Tejas Srinivasan|arXiv (Cornell University)|Aug 18, 2022
Multimodal Machine Learning Applications被引用数 8
ひとこと要約

VAuLTは、大規模な事前学習言語モデル(例:BERT)を統合することで、ビジョンアンドランゲージトランスフォーマー(ViLT)の言語表現を強化し、ソーシャルメディアにおけるセンチメント分類タスクでの性能を顕著に向上させる。この手法は、ViLTおよび最先端の結果をTWITTER-2015、TWITTER-2017、MVSA-Single、MVSA-Multipleで達成し、エンドツーエンドの共同微調整により、トレーニングおよび推論効率にほとんど影響を与えない。

ABSTRACT

We propose the Vision-and-Augmented-Language Transformer (VAuLT). VAuLT is an extension of the popular Vision-and-Language Transformer (ViLT), and improves performance on vision-and-language (VL) tasks that involve more complex text inputs than image captions while having minimal impact on training and inference efficiency. ViLT, importantly, enables efficient training and inference in VL tasks, achieved by encoding images using a linear projection of patches instead of an object detector. However, it is pretrained on captioning datasets, where the language input is simple, literal, and descriptive, therefore lacking linguistic diversity. So, when working with multimedia data in the wild, such as multimodal social media data, there is a notable shift from captioning language data, as well as diversity of tasks. We indeed find evidence that the language capacity of ViLT is lacking. The key insight and novelty of VAuLT is to propagate the output representations of a large language model (LM) like BERT to the language input of ViLT. We show that joint training of the LM and ViLT can yield relative improvements up to 20% over ViLT and achieve state-of-the-art or comparable performance on VL tasks involving richer language inputs and affective constructs, such as for Target-Oriented Sentiment Classification in TWITTER-2015 and TWITTER-2017, and Sentiment Classification in MVSA-Single and MVSA-Multiple. Our code is available at https://github.com/gchochla/VAuLT.

研究の動機と目的

  • ViLTの言語的容量が限定的であることに起因する、単純な画像キャプションで事前学習されているため、感情豊富で複雑なソーシャルメディアのテキストでは性能が劣ることを是正する。
  • 多モodalセンチメント分類の向上を図る。ここでは、言語が多様で繊細であり、しばしば皮肉的または比喩的である。
  • オブジェクト検出器を高価に使用せずに、トレーニングおよび推論効率を維持しながら、言語理解を強化する。
  • 事前学習言語モデルが、キャプションデータセットと実世界のソーシャルメディア入力との間のドメインシフトを埋める可能性があるかを検証する。
  • 特に感情分析タスクにおいて、深層言語エンコーダーと深層視覚エンコーダーの貢献度を評価する。

提案手法

  • VAuLTは、ViLTの標準的な言語埋め込み層を、大規模な事前学習言語モデル(例:BERT)からの文脈的表現に置き換える。これらの表現はViLTエンコーダーに供給される。
  • 言語モデルとViLTのエンドツーエンドの共同微調整を実施し、強化された言語特徴とビジョンアンドランゲージ表現空間との整合性を確保する。
  • 視覚入力は線形変換された画像パッチを用いて処理され、ViLTの計算効率を保持する。
  • このアプローチはモジュラーである。言語モデルは特徴抽出器として機能し、その出力をViLTの入力埋め込み層に挿入するが、コアアーキテクチャは変更しない。
  • 実験では、ViLT、固定言語モデルバージョン、および深層視覚エンコーダーを搭載したモデル(例:TomViLT、TomVAuLT)と比較し、深層言語モデリングの貢献度を分離する。
  • この手法は、感情的な言語と多モーダルセンチメントを含む複数のベンチマークで評価される:TWITTER-2015、TWITTER-2017、MVSA-Single、MVSA-Multiple。

実験結果

リサーチクエスチョン

  • RQ1事前学習言語モデルによるViLTの言語表現の強化が、複雑で多様な言語を含むソーシャルメディアにおけるセンチメント分類タスクで顕著な性能向上をもたらすか?
  • RQ2言語モデルとViLTの共同微調整は、ViLT単体の微調整や固定言語モデルを使用する場合よりも優れた性能をもたらすか?
  • RQ3多モーダルモデルの性能は、特に感情分析タスクにおいて、言語エンコーダーと視覚エンコーダーの深さにどのように依存するか?
  • RQ4大規模な事前学習言語モデルは、広範な再トレーニングなしに、キャプションデータセットと実世界のソーシャルメディアデータの分布シフトを埋め合わせることができるか?
  • RQ5多モーダルセンチメント分類において、深層言語エンコーダーは深層視覚エンコーダーと併用することで性能を向上させるか、あるいは相反する影響を及ぼすか?

主な発見

  • VAuLTは、センチメント分類タスクにおいてViLT比で20%の相対的向上を達成し、強化された言語表現による顕著な向上を示している。
  • 言語モデルとViLTの共同微調整は不可欠である。固定言語モデルを使用した場合、ViLTと同等またはそれ以下の性能にとどまる。
  • TWITTER-2015では、VAuLTは75.0%の正確度と69.0%のマクロF1スコアを達成し、ViLT(69.6%と60.3%)およびTomViLT(73.2%と66.1%)を上回った。
  • TWITTER-2017では、VAuLTは67.8%の正確度と64.9%のマクロF1スコアを達成し、ViLT(64.0%と58.0%)およびTomViLT(67.3%と64.4%)を上回った。
  • TomVAuLTとTomViLTの実験から、深層言語エンコーダーが存在する場合、深層視覚エンコーダーは性能を低下させることが判明し、強力な視覚エンコーダーの必要性に関する仮定に疑問を呈した。
  • VAuLTは、MVSA-SingleおよびMVSA-Multipleを含むすべての評価ベンチマークで最先端または競争力のある性能を達成し、計算オーバーヘッドを最小限に抑えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。