Skip to main content
QUICK REVIEW

[論文レビュー] Multi-task Learning for Multi-modal Emotion Recognition and Sentiment Analysis

Shad Akhtar, Dushyant Singh Chauhan|arXiv (Cornell University)|May 14, 2019
Sentiment Analysis and Opinion Mining参考文献 20被引用数 7
ひとこと要約

本論文は、テキスト、音声、視覚的入力を用いて、マルチモーダルなセンチメントおよび感情認識を同時に実行するマルチタスク学習フレームワークを提案する。再帰的ユニット上に文脈レベルのモダリティ間アテンション機構を適用することで、発話間およびモダリティ間の依存関係を捉え、CMU-MOSEIデータセットで最先端の性能を達成した。

ABSTRACT

Related tasks often have inter-dependence on each other and perform better when solved in a joint framework. In this paper, we present a deep multi-task learning framework that jointly performs sentiment and emotion analysis both. The multi-modal inputs (i.e., text, acoustic and visual frames) of a video convey diverse and distinctive information, and usually do not have equal contribution in the decision making. We propose a context-level inter-modal attention framework for simultaneously predicting the sentiment and expressed emotions of an utterance. We evaluate our proposed approach on CMU-MOSEI dataset for multi-modal sentiment and emotion analysis. Evaluation results suggest that multi-task learning framework offers improvement over the single-task framework. The proposed approach reports new state-of-the-art performance for both sentiment analysis and emotion analysis.

研究の動機と目的

  • 動画におけるセンチメントおよび感情認識の向上を目的とした、複数モダリティ(テキスト、音声、視覚)入力の統合の課題に対処すること。
  • センチメントと感情認識のタスク間の相関関係を活用して、一般化性能および予測の信頼性を向上させること。
  • 発話間およびモダリティ固有の寄与度の文脈的依存関係をアテンション機構を用いてモデル化すること。
  • 共有表現を用いてセンチメントおよび感情分類の両方を統合的に最適化する統一フレームワークの構築。
  • マルチモーダルな感情分析ベンチマークにおいて、シングルタスク学習のベースラインを上回ること。

提案手法

  • 動画内の発話間の順序的依存関係をモデル化するために、GRUに基づく再帰的ニューラルネットワークを用いる。
  • 各発話ごとに、テキスト、音声、視覚モダリティからの寄与度を動的に重みづけする文脈レベルのモダリティ間アテンション機構を適用する。
  • 下位層の表現をセンチメントおよび感情の分類ヘッド間で共有しつつ、分類ヘッドは別々に保つことで、マルチタスク学習を統合する。
  • モダリティ固有の埋め込みをアテンションによって後段統合することで、各インスタンスに対して最も情報量の多いモダリティに注目できるようにする。
  • センチメントおよび感情分類の両タスクに対して交差エントロピー損失を用いて、ネットワーク全体をエンドツーエンドで学習する。
  • 発話間の文脈およびモダリティ間特徴に対するアテンションを用いることで、表現学習を強化する。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルな設定において、センチメントと感情認識を同時に学習することで、シングルタスク学習よりも性能が向上するか?
  • RQ2発話間の文脈的依存関係をモデル化することで、マルチモーダルな感情認識がどのように向上するか?
  • RQ3異なる発話文脈において、どのモダリティ(テキスト、音声、視覚)がセンチメントおよび感情予測に最も寄与しているか?
  • RQ4センチメントと感情の間の相関関係をモデル化することで、分類精度がどの程度向上するか?
  • RQ5アテンション機構は、各予測に対して最も関連性の高いモダリティおよび発話を的確に特定できるか?

主な発見

  • 提案されたマルチタスク学習フレームワークは、センチメントおよび感情分析の両方において、CMU-MOSEIベンチマークで最先端の性能を達成した。
  • MTLフレームワークは、シングルタスク学習(STL)ベースラインよりも精度と再現率を向上させた:たとえば、センチメント分類において、MTLは精度0.5、再現率1.0を達成したが、STLベースラインではそれぞれ0.3および0.5であった。
  • 単一タスクモデルが3つのうち1つしか正しく予測しなかったケースで、本モデルは怒り、嫌悪、喜び、悲しみの4つの感情を正しく予測した。
  • センチメントの知識は感情分類を顕著に向上させる——例として、ポジティブなセンチメントは「喜び」の感情予測を助け、これは感情のポジティブ・ネガティブな関連性と整合的である。
  • MTLフレームワークは「怒り」(1173件の予測)と「悲しみ」(1618件の予測)を過剰に予測し、「恐怖」と「驚き」を過小に予測しているが、これはデータセット内のクラス不均衡に起因すると考えられる。
  • 本モデルは、マルチタスク学習が、曖昧なまたは皮肉的な発話においても、より良い証拠の抽出と一般化性能の向上を可能にすることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。