Skip to main content
QUICK REVIEW

[論文レビュー] Multi-scale Cooperative Multimodal Transformers for Multimodal Sentiment Analysis in Videos

Lianyang Ma, Yue Yu|arXiv (Cornell University)|Jun 16, 2022
Sentiment Analysis and Opinion Mining被引用数 6
ひとこと要約

本稿では、視覚的・言語的・音声的モodalから得られるマルチスケール表現を活用することで、クロスマodal相互作用を強化する、マルチモーダルセンチメント分析のための新規アーキテクチャ、Multi-scale Cooperative Multimodal Transformers (MCMulT) を提案する。マルチスケールクロスマodalアテンションを用いた協調的で階層的な特徴抽出により、同期・非同期の両方のマルチモーダルデータセットで最先端の性能を達成し、MulT よりも複数の指標で優れている。

ABSTRACT

Multimodal sentiment analysis in videos is a key task in many real-world applications, which usually requires integrating multimodal streams including visual, verbal and acoustic behaviors. To improve the robustness of multimodal fusion, some of the existing methods let different modalities communicate with each other and modal the crossmodal interaction via transformers. However, these methods only use the single-scale representations during the interaction but forget to exploit multi-scale representations that contain different levels of semantic information. As a result, the representations learned by transformers could be biased especially for unaligned multimodal data. In this paper, we propose a multi-scale cooperative multimodal transformer (MCMulT) architecture for multimodal sentiment analysis. On the whole, the "multi-scale" mechanism is capable of exploiting the different levels of semantic information of each modality which are used for fine-grained crossmodal interactions. Meanwhile, each modality learns its feature hierarchies via integrating the crossmodal interactions from multiple level features of its source modality. In this way, each pair of modalities progressively builds feature hierarchies respectively in a cooperative manner. The empirical results illustrate that our MCMulT model not only outperforms existing approaches on unaligned multimodal sequences but also has strong performance on aligned multimodal sequences.

研究の動機と目的

  • 動画センチメント分析における、視覚的・言語的・音声的ストリームの時間的非同期問題に対処すること。
  • クロスマodalアテンションの過程で、単一スケール特徴ではなくマルチスケール表現を活用することで、マルチモーダル統合のロバスト性を向上させること。
  • 複数スケールでの方向性のあるクロスマodal相互作用を通じて、モダリティ間で協調的で階層的な特徴学習を可能にすること。
  • 局所的およびグローバルアテンションを統合するブロックスケール機構を用いることで、計算複雑性を低減しつつ高い性能を維持すること。
  • 同期および非同期のマルチモーダルセンチメント分析ベンチマークで優れた性能を示すことを目的とする。

提案手法

  • MCMulTアーキテクチャは、各モダリティからのマルチスケール表現を統合し、クロスマodalアテンションを実行するマルチスケールクロスマodalトランスフォーマーブロック(MCTB)を採用している。
  • 各モダリティは、ソースモダリティからのマルチレベル特徴に注目するマルチスケールクロスマodalアテンション(MACT)層を用い、異なる意味的粒度での特徴表現を強化している。
  • 方向性のあるクロスマodal相互作用を協調的に実行する:各モダリティは、他のモダリティからの強化された特徴を段階的に活用して、自身の階層的表現を構築する。
  • ブロックスケール機構により、ウィンドウ化された局所的コンテキストアテンションとグローバルアテンションを統合し、計算複雑性を低減しながら長距離依存関係を保持する。
  • MCTBのスタックに複数のクロスマodalトランスフォーマー(CT)層を組み合わせており、各CT層はソースモダリティからのマルチスケール特徴に注目する。
  • アーキテクチャは、手動での同期処理や特徴工学的前処理を必要とせず、非同期マルチモーダルシーケンス上でエンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール表現は、非同期マルチモーダルシーケンスにおけるクロスマodal相互作用のロバスト性を向上させるか?
  • RQ2モダリティ間で協調的で階層的な特徴学習を行うことで、センチメント分類性能が向上するか?
  • RQ3ブロックスケール機構は、マルチモーダルトランスフォーマーにおいて計算効率と性能のバランスをどのようにとるか?
  • RQ4MCMulT は、同期および非同期のマルチモーダルセンチメント分析ベンチマークで、既存の最先端手法を上回る性能を示すか?
  • RQ5性能を最大化するために、MCTBブロックとCT層の最適な構成は何か?

主な発見

  • CMU-MOSEI データセットにおいて、MCMulT は 7 クラス分類タスクで 51.83%(Acc²₇)の精度、2 クラスタスクで 83.00%(Acc²₂)の精度を達成し、MulT-12 より Acc²₂ で 5.6 パercent 点高い性能を示した。
  • 7 クラスタスクでは F1 スコア 82.77%、相関係数 0.699 を達成し、すべての MulT バリエーションおよび単一モダリティベースラインを上回った。
  • MCMulT-LocalDense は 51.36%(Acc²₇)と 82.41%(Acc²₂)を達成し、局所的コンテキストアテンションが密度アテンションよりも性能を向上させたことが示された。
  • 最適な設定は 4 つの MCTB ブロックと 1 ブロックあたり 3 つの CT 层であり、それ以上に増加させると性能が頭打ちとなり、わずかに低下した。
  • 視覚的および音声的モダリティをターゲットモダリティとして用いた場合、MCMulT は単一モダリティベースラインに比べて 10–15% の性能向上を達成した。
  • 例えば V,A→T や T,A→V といった異なるモダリティコンビネーションに対しても、強力な汎化性能を示しており、クロスマodal統合設定全体にわたる一般化能力を有している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。