Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Classifier Interactive Learning for Ambiguous Speech Emotion Recognition

Ying Zhou, Xuefeng Liang|arXiv (Cornell University)|Dec 10, 2020
Emotion and Mood Recognition参考文献 31被引用数 5
ひとこと要約

本稿では、複数の分類器が協働して感情確率分布(曖昧なラベル)を構築し、相互に学び合いながら反復的に表現を最適化する、曖昧な会話感情認識のための新規手法Multi-Classifier Interactive Learning (MCIL) を提案する。MCIL は個々の分類器の精度と分類器間の一貫性を向上させ、MAS、IEMOCAP、FAU-AIBO でそれぞれ 3.1%、2.0%、1.58% の絶対的精度向上を達成し、最先端の性能を実現した。

ABSTRACT

In recent years, speech emotion recognition technology is of great significance in industrial applications such as call centers, social robots and health care. The combination of speech recognition and speech emotion recognition can improve the feedback efficiency and the quality of service. Thus, the speech emotion recognition has been attracted much attention in both industry and academic. Since emotions existing in an entire utterance may have varied probabilities, speech emotion is likely to be ambiguous, which poses great challenges to recognition tasks. However, previous studies commonly assigned a single-label or multi-label to each utterance in certain. Therefore, their algorithms result in low accuracies because of the inappropriate representation. Inspired by the optimally interacting theory, we address the ambiguous speech emotions by proposing a novel multi-classifier interactive learning (MCIL) method. In MCIL, multiple different classifiers first mimic several individuals, who have inconsistent cognitions of ambiguous emotions, and construct new ambiguous labels (the emotion probability distribution). Then, they are retrained with the new labels to interact with their cognitions. This procedure enables each classifier to learn better representations of ambiguous data from others, and further improves the recognition ability. The experiments on three benchmark corpora (MAS, IEMOCAP, and FAU-AIBO) demonstrate that MCIL does not only improve each classifier's performance, but also raises their recognition consistency from moderate to substantial.

研究の動機と目的

  • 会話の感情が複数の感情を併せ持つ場合(それぞれ異なる確率で)、現在の単一ラベルまたは複数ラベル手法が効果的に表現できない曖昧な感情認識の課題に対処すること。
  • 感情の曖昧さを離散的ラベルとしてではなく、不確実性を反映する確率分布としてモデル化することで、認識性能を向上させること。
  • 分類器が互いの予測から学べるよう相互にやり取りすることにより、分類器間の一貫性と耐性を高めること。
  • 専門家による投票情報が存在しないデータセットに対しても汎用的に適用可能な手法を開発すること。これに対して、先行手法はこのような統計情報に依存している。
  • 人間認知における最適に相互作用する理論にインspiredされた相互学習が、分類器の精度と一致度の両方を向上させることを検証すること。

提案手法

  • まず、曖昧なデータから正確なラベルを用いて、多様な分類器を訓練し、初期モデルを構築する。
  • その後、これらの分類器が残りの曖昧な発話に対して投票を行い、予測された感情分布の統計を生成する。
  • 投票の統計をもとに、曇ったラベルとして確率分布(例:[0.3, 0.5, 0.2] はそれぞれ happy, sad, angry を表す)を構築する。
  • これらの構築された曠いラベルを用いて分類器を再訓練することで、互いの予測から学び、不確実なデータの表現を向上させる。
  • 再訓練の過程で、分類器の予測同士の整合性を測定・最適化するために、KLダイバージェンスを用いて相互学習を形式化する。
  • このプロセスを反復することで、分類器の予測を精緻化し、人間同士の対人コミュニケーションを模倣して曖昧さを解消する。

実験結果

リサーチクエスチョン

  • RQ1複数分類器間の協働学習は、単一または複数ラベルベースラインと比較して、曖昧な会話感情認識を向上させることができるか?
  • RQ2分類器のコンSENSUSに基づく相互学習は、感情認識における一貫性と精度を向上させるか?
  • RQ3提案手法は、MAS のような専門家による投票アノテーションが存在しないデータセットに対しても汎用的に適用可能か?
  • RQ4感情確率分布(曖昧ラベル)を用いることで、正確なラベルや複数ラベル表現と比較して、性能と一貫性にどのような差が生じるか?
  • RQ5相互学習は、曖昧なデータ上での分類器間一致度をどの程度向上させるか?

主な発見

  • MAS コーパスでは、最先端手法と比較して 3.1% の絶対的精度向上を達成し、最も曇ったクラス(happy)では 42.5% の改善を示した。
  • IEMOCAP では、全体の精度が 2.0% 向上し、全4つの感情カテゴリで2番目の性能を記録。ニュートラルおよびサムネイルの改善幅はそれぞれ 7.0–35.0% にのぼった。
  • FAU-AIBO では、全体の精度が 65.47% に達し、すべてのベースラインを 1.58% から 4.16% まで上回り、IDL および NEG カテゴリで2位を獲得した。
  • 相互学習後、FAU-AIBO における Fleiss Kappa 値は 0.3554 から 0.6054 に上昇し、分類器間の一致度が中程度から著しい水準に向上したことを示した。
  • MCIL は分類器の一貫性を顕著に向上させ、3つのコーパスでそれぞれ 0.15、0.19、0.25 の Kappa 値上昇を達成し、分類器間一致度の向上を示した。
  • 多数決投票やトリトライニングと比較して、曇ったクラスにおいても優れた性能を示し、個々の分類器が一貫性を欠いても頑健であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。