Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Sentiment Analysis using Hierarchical Fusion with Context Modeling

Navonil Majumder, Devamanyu Hazarika|arXiv (Cornell University)|Jun 16, 2018
Sentiment Analysis and Opinion Mining被引用数 13
ひとこと要約

本稿では、マルチモーダルセンチメント分析のための階層的融合フレームワークを提案する。まず、全結合層を用いて単モダリティ特徴を二モダリティ表現に統合し、次にGRUによる文脈モデリングを介してそれらを三モダリティ表現に統合する。本手法は、CMU-MOSIおよびIEMOCAPデータセットにおいて、最先端技術よりも1–2.4%の精度向上を達成し、発話レベルのセンチメント分析において最大10%の誤差率低減を実現した。

ABSTRACT

Multimodal sentiment analysis is a very actively growing field of research. A promising area of opportunity in this field is to improve the multimodal fusion mechanism. We present a novel feature fusion strategy that proceeds in a hierarchical fashion, first fusing the modalities two in two and only then fusing all three modalities. On multimodal sentiment analysis of individual utterances, our strategy outperforms conventional concatenation of features by 1%, which amounts to 5% reduction in error rate. On utterance-level multimodal sentiment analysis of multi-utterance video clips, for which current state-of-the-art techniques incorporate contextual information from other utterances of the same clip, our hierarchical fusion gives up to 2.4% (almost 10% error rate reduction) over currently used concatenation. The implementation of our method is publicly available in the form of open-source code.

研究の動機と目的

  • 単純な特徴連結手法の限界を是正することを目的とし、モダリティ間で相反する信号を適切に処理できない点を改善する。
  • 融合プロセスを階層的に構造化することでマルチモーダル統合を改善し、3つのモダリティをまずペアで統合し、その後に全統合を行う。
  • 発話レベルの文脈をGRUを用いて統合し、動画クリップの逐次的表現学習を強化する。
  • マルチモーダルセンチメントおよび感情分類において、既存の最先端手法を上回ることを目的とする。

提案手法

  • 各発話について、専用のエンコーダーを用いて単モダリティ特徴(テキスト、音声、映像)を抽出する。
  • 二モダリティ特徴統合は、全結合層を用い、文脈に配慮した二モダリティ表現を生成する。
  • 二モダリティ統合特徴にGRUを適用することで、発話間の文脈情報をモデル化する。
  • 三モダリティ統合は、3つの二モダリティ表現をもう一つの全結合層で統合し、その後に文脈伝播を目的としたGRUを適用する。
  • 最終的な統合表現は、ソフトマックス層を用いてセンチメント分類に使用する。
  • モデルはクロスエントロピー損失を用いてエンドツーエンドで学習され、実装はGitHubで公開されている。

実験結果

リサーチクエスチョン

  • RQ1全統合の前にモダリティをペアで統合する階層的統合戦略は、単純な連結手法と比較してマルチモーダルセンチメント分類の精度を向上させるか?
  • RQ2発話レベルの文脈をGRUで統合することで、動画クリップにおけるマルチモーダルセンチメント分析の性能にどのような影響を与えるか?
  • RQ3提案手法は、単モダリティおよびマルチモーダルセンチメント分類の両タスクにおいて、最先端モデルを上回る性能を発揮するか?
  • RQ4特にテキストが音声や視覚的手がかりと矛盾する場合に、モデルはモダリティ間の相反信号をどのように処理するか?
  • RQ5階層的統合メカニズムは、既存の統合手法と比較して、誤差率をどの程度低減するか?

主な発見

  • 提案された階層的統合(HFusion)手法は、個々の発話のセンチメント分類において、単純な連結手法よりも1%の精度向上を達成し、誤差率は5%低減した。
  • 複数発話の動画クリップでは、HFusionはベースラインの連結手法よりも最大2.4%高い精度を達成し、誤差率はほぼ10%低減した。
  • CMU-MOSIデータセットでは、HFusionはすべてのモダリティ組み合わせにおいて最先端技術を1–2%上回り、特にマルチモーダル設定で最大の向上を示した。
  • IEMOCAPデータセットでは、HFusionは最先端技術を1–2.4%上回り、三モダリティ性能はテキストのみの性能よりも3%高い。
  • 文脈モデリングを組み込んだモデル(CHFusion)は、すべてのモダリティ組み合わせでHFusionを1–2%上回り、逐次的文脈統合の有効性を裏付けた。
  • IEMOCAPにおけるクラスごとの分析では、Fスコアが一貫して向上(例:Happyでは81.4%、Angerでは77.6%)しており、感情カテゴリ全体にわたる高い安定性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。