Skip to main content
QUICK REVIEW

[論文レビュー] Key-Sparse Transformer for Multimodal Speech Emotion Recognition

Weidong Chen, Xiaofeng Xing|arXiv (Cornell University)|Jun 22, 2021
Emotion and Mood Recognition参考文献 32被引用数 4
ひとこと要約

本論文は、不要でノイズの多いトークンを抑制しながら、感情関連の音声フレームや語を動的に特定・注目することができるキースプライスドトランスフォーマー(KS-Transformer)を提案する。注意重みに学習可能なスパarsity機構を適用することで、IEMOCAPおよびLSSEDの性能が向上し、IEMOCAPでは75.3%の未加重正解率、LSSEDでは55.7%を達成し、マルチモーダル感情認識における優れたロバスト性と効率性を示した。

ABSTRACT

Speech emotion recognition is a challenging research topic that plays a critical role in human-computer interaction. Multimodal inputs further improve the performance as more emotional information is used. However, existing studies learn all the information in the sample while only a small portion of it is about emotion. The redundant information will become noises and limit the system performance. In this paper, a key-sparse Transformer is proposed for efficient emotion recognition by focusing more on emotion related information. The proposed method is evaluated on the IEMOCAP and LSSED. Experimental results show that the proposed method achieves better performance than the state-of-the-art approaches.

研究の動機と目的

  • 音声およびテキスト入力における不要で非感情関連の情報が、音声感情認識の性能を低下させることを是正すること。
  • 音声およびテキストモダリティにおける感情関連特徴への選択的注目を可能にすることで、マルチモーダル統合の効率を向上させること。
  • 自動的に感情的に顕著なフレームおよび語を特定・優先するスパースアテンション機構を開発すること。
  • より優れたモダリティ間相互作用と特徴の集中を実現することで、ベンチマークデータセットIEMOCAPおよびLSSEDで最先端の性能を達成すること。

提案手法

  • 注意重みを計算した後、学習可能なしきい値に基づいて最小の重みを0にリセットすることで、アテンションヘッドにおけるスパarsityを達成するキースプライスドアテンション機構を提案。
  • キースプライスド処理後に、音声およびテキストモダリティ間で深い、マルチステージの相互作用を可能にする、段階的クロスアテンションブロック(CCAB)を導入。
  • 音声埋め込みとテキスト埋め込みのための、それぞれ事前学習済みのwav2vecおよびRoBERTaモデルを用いて、堅牢な初期特徴表現を取得。
  • k=0.5(注意重みの50%が0にリセット)が、情報保持とノイズ抑制のバランスを最適に保つと判明し、最適なスパarsity戦略として選択。
  • KS-Transformer内では、ヘッドごとにスパarsityを適用することで、アテンションの多様性を維持する多ヘッドアテンション機構を採用。
  • 特徴抽出、モダリティ相互作用(CCABを介して)、および最終分類のための深層統合を統合する3モジュールアーキテクチャにKS-Transformerを統合。

実験結果

リサーチクエスチョン

  • RQ1学習可能なキースプライスドアテンション機構は、音声およびテキストにおける非感情的・ノイズの多いトークンをフィルタリングすることで、感情認識の性能を向上させることができるか?
  • RQ2段階的クロスアテンションブロック(CCAB)の数が、マルチモーダル感情認識におけるモダリティ相互作用および全体的な性能に与える影響は何か?
  • RQ3提案されたKS-Transformerは、IEMOCAPやLSSEDなどのベンチマークデータセットにおいて、標準Transformerおよび既存の最先端モデルを上回る性能を示すか?
  • RQ4情報保持とノイズ低減のバランスを最適化するための最適なスパarsityレベル(ハイパーパrameter kで制御)は何か?
  • RQ5特に大規模なLSSEDデータセットにおけるクラス不均衡の下で、モデルの性能はいかがなっているか?

主な発見

  • 提案されたKS-Transformerは、IEMOCAPで75.3%の未加重正解率を達成し、CMA(72.8%)、STSER(72.1%)、GBAN(70.1%)を上回る。
  • LSSEDデータセットでは、55.7%の未加重正解率を達成し、PyResNet(42.9%)およびSTSER(51.2%)を上回る。
  • 最適なスパarsityレベルはk=0.5(50%の注意重みが0にリセット)であり、両データセットで性能とノイズ抑制のバランスが最適化されている。
  • 3つの段階的クロスアテンションブロック(CCAB)を使用した場合が最良の性能を示し、複数回のモダリティ相互作用が効果的な統合に不可欠であることを示した。
  • 可視化により、KS-Transformerが非感情的語(例:'it'、'a'、'look')への注目を低減し、'beautiful' や 'arguing' といった感情的に顕著な語への注目を増加させていることが確認された。
  • IEMOCAPでは過学習に対するロバスト性が向上し、kが0.5を超えた場合、LSSEDでは性能低下が抑制されるなど、スパarsityが大規模かつ不均衡なデータ処理において有益であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。