Skip to main content
QUICK REVIEW

[論文レビュー] Noise-Resistant Multimodal Transformer for Emotion Recognition

Yuanyuan Liu, Haoyu Zhang|arXiv (Cornell University)|May 4, 2023
Emotion and Mood Recognition被引用数 5
ひとこと要約

本論文は、ノイズに強いマルチモーダルトランスフォーマー(NORM-TR)を提案する。これは、ノイズに依存しない汎用的特徴(NRGFs)をノイズに配慮した学習スキームにより学習することで、ノイズの影響を受ける入力に対して耐性を高める。NORM-TRは、NRGFsをクエリとして、マルチモーダル特徴(MFs)をキー/バリューとして用いる融合トランスフォーマーを採用し、MOSI、MOSEI、IEMOCAP、RMLデータセットで最先端の性能を達成しており、精度とノイズ耐性の両面で顕著な向上を示している。

ABSTRACT

Multimodal emotion recognition identifies human emotions from various data modalities like video, text, and audio. However, we found that this task can be easily affected by noisy information that does not contain useful semantics. To this end, we present a novel paradigm that attempts to extract noise-resistant features in its pipeline and introduces a noise-aware learning scheme to effectively improve the robustness of multimodal emotion understanding. Our new pipeline, namely Noise-Resistant Multimodal Transformer (NORM-TR), mainly introduces a Noise-Resistant Generic Feature (NRGF) extractor and a Transformer for the multimodal emotion recognition task. In particular, we make the NRGF extractor learn a generic and disturbance-insensitive representation so that consistent and meaningful semantics can be obtained. Furthermore, we apply a Transformer to incorporate Multimodal Features (MFs) of multimodal inputs based on their relations to the NRGF. Therefore, the possible insensitive but useful information of NRGF could be complemented by MFs that contain more details. To train the NORM-TR properly, our proposed noise-aware learning scheme complements normal emotion recognition losses by enhancing the learning against noises. Our learning scheme explicitly adds noises to either all the modalities or a specific modality at random locations of a multimodal input sequence. We correspondingly introduce two adversarial losses to encourage the NRGF extractor to learn to extract the NRGFs invariant to the added noises, thus facilitating the NORM-TR to achieve more favorable multimodal emotion recognition performance. In practice, on several popular multimodal datasets, our NORM-TR achieves state-of-the-art performance and outperforms existing methods by a large margin, which demonstrates that the ability to resist noisy information is important for effective emotion recognition.

研究の動機と目的

  • マルチモーダル入力におけるノイズ(例:背景音声、関係のない視覚的手がかり)や意味的に無関係な情報が感情認識性能に与える悪影響を是正すること。
  • 任意のモダリティにノイズが存在しても、正確な感情理解を維持できる耐性のあるマルチモーダル統合フレームワークの開発。
  • 入力シーケンスにランダムにノイズを注入することを明示的に学習させる、ノイズに配慮した学習スキームの設計。
  • コアな感情的意味を保持しつつ、ノイズをフィルタリングする、一般化可能な干渉に強い表現(NRGFs)の抽出。
  • MFsがNRGFsを補完することで、詳細なモダリティ固有の情報を活用し、耐性を高めるマルチモーダル統合の改善。

提案手法

  • ノイズに配慮した学習スキームを活用して、ノイズに依存しない表現を学習するノイズに強い汎用的特徴(NRGF)抽出器を導入する。
  • NRGFsをクエリとして用い、音声・映像・テキストからのマルチモーダル特徴(MFs)をキーおよびバリューとして用いることで、文脈に配慮した統合を実現するマルチモーダル融合トランスフォーマーを採用する。
  • 訓練中に入力シーケンスにランダムなマスキングまたはノイズの注入を適用し、すべてのモダリティまたは特定のモダリティに実世界のノイズを模倣する。
  • NRGFsのノイズ注入に対する不変性を強制するために2つの adversarial 損失を適用し、推論時の耐性を促進する。
  • KDE(カーネル密度推定)とコサイン類似度を用いて、異なる訓練体制下でのNRGFsおよびMFsの分布を可視化・分析する。
  • 入力シーケンス長(最適な正確性を得るため8フレームに設定)およびアテンションメカニズムの設計を含むハイパーパramータチューニングにより、モデル性能を最適化する。

実験結果

リサーチクエスチョン

  • RQ1ノイズに依存しない表現を明示的に学習することで、マルチモーダルトランスフォーマーがノイズの影響に対して耐性を高められるか?
  • RQ2融合トランスフォーマーにおいてNRGFsをクエリとして用いることで、標準的なマルチモーダル統合と比較して感情認識の正確性がどのように向上するか?
  • RQ3ノイズに配慮した学習スキームは、ノイズ条件下での一般化能力をどの程度向上させるか?
  • RQ4ノイズに配慮した学習スキームの有無に応じて、NRGFsおよびMFsの分布はどのように変化するか?また、これにより特徴の耐性にどのような示唆があるか?
  • RQ5融合トランスフォーマーのアテンションメカニズムは、マスキング(ノイズあり)フレームよりもクリアなフレームに注目する傾向を示すか?これは、効果的なノイズ抑制を示唆するか?

主な発見

  • NORM-TRは、MOSI、MOSEI、IEMOCAP、RMLデータセットで最先端の性能を達成しており、既存手法を大きく上回っている。
  • 入力シーケンス長を8フレームに設定した場合、MOSIデータセットで88.89%の正確性を達成するが、32フレームに達するとノイズの蓄積により性能が急激に低下する。
  • 可視化の結果、ノイズに配慮した学習スキームを適用した場合、NRGFs同士の類似度は非常に高く(類似度 ≈ 1)、一方NRGFsとMFsの類似度は低く(類似度 ≈ 0)なることが示され、耐性とモダリティ固有性の両立が確認された。
  • 融合トランスフォーマーにおけるアテンション重みは、マスキング(ノイズあり)フレームに対して顕著に低下しており、モデルがクリアで情報量の多い入力を好む傾向があることを裏付けた。
  • ノイズに配慮した学習スキームにより、ノイズが注入された入力から抽出されたNRGFs間の類似度が顕著に低下した。これは、NRGFsがより一般化され、ノイズに一貫性を持つようになったことを証明している。
  • 本手法は強力な一般化能力を示し、明示的に注入されたノイズと、暗黙的である実世界のノイズの両方を効果的に処理できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。