Skip to main content
QUICK REVIEW

[論文レビュー] Learning Representations of Emotional Speech with Deep Convolutional Generative Adversarial Networks

Jonathan Chang, Stefan Scherer|arXiv (Cornell University)|Apr 22, 2017
Speech Recognition and Synthesis参考文献 11被引用数 9
ひとこと要約

本稿では、音声の感情の価値分類を向上させるために、半教師あり表現学習を組み合わせた深層畳み込み生成対抗ネットワーク(DCGAN)を提案する。12時間のラベル付きIEMOCAPデータセットに加えて100時間のラベルなし会議データを活用することで、3クラスの価値タスクで49.80%の精度を達成した。これは最先端の性能と同等であり、活性化を併用したマルチタスク学習は効果を示さなかった。

ABSTRACT

Automatically assessing emotional valence in human speech has historically been a difficult task for machine learning algorithms. The subtle changes in the voice of the speaker that are indicative of positive or negative emotional states are often "overshadowed" by voice characteristics relating to emotional intensity or emotional activation. In this work we explore a representation learning approach that automatically derives discriminative representations of emotional speech. In particular, we investigate two machine learning strategies to improve classifier performance: (1) utilization of unlabeled data using a deep convolutional generative adversarial network (DCGAN), and (2) multitask learning. Within our extensive experiments we leverage a multitask annotated emotional corpus as well as a large unlabeled meeting corpus (around 100 hours). Our speaker-independent classification experiments show that in particular the use of unlabeled data in our investigations improves performance of the classifiers and both fully supervised baseline approaches are outperformed considerably. We improve the classification of emotional valence on a discrete 5-point scale to 43.88% and on a 3-point scale to 49.80%, which is competitive to state-of-the-art performance.

研究の動機と目的

  • 限られたラベル付きデータからの表現学習を用いて、音声の感情的価値分類を向上させること。
  • 大規模なラベルなし音声データを用いた自己教師あり事前学習が、分類器の性能を向上させるかどうかを調査すること。
  • 関連するターゲットとして価値と活性化を用いたマルチタスク学習の有効性を評価すること。
  • 感情認識コンピューティングにおいて、生のスペクトログラムからのエンドツーエンド学習が、従来の特徴工学の手法を上回るかどうかを検証すること。
  • 話者に依存しない評価において、モデルの一般化性能とロバストネスを評価すること。

提案手法

  • DCGANフレームワーク内の識別器として、深層畳み込みニューラルネットワーク(CNN)アーキテクチャを微調整し、判別的な音声表現を学習した。
  • ラベルなしのAMI会議コーパスデータ(100時間)を用いてDCGANを事前学習し、その後IEMOCAPのラベル付きデータで微調整した。
  • 下層特徴をタスク間で共有するように、マルチタスクヘッドを統合し、感情的価値と活性化を同時に予測するようにした。
  • 生成器と識別器間のミニマックス損失に加え、分類ヘッドには交差エントロピー損失を用いてモデルを訓練した。
  • 話者に依存しない分割を用い、独立した訓練・検証・テストセットを確保することで、堅牢な評価を実施した。
  • MFCC やピッチといった手作業で設計された音響特徴を一切使用せず、生のスペクトログラムからのエンドツーエンド学習を実装した。

実験結果

リサーチクエスチョン

  • RQ1大規模なラベルなし音声データを用いた自己教師あり事前学習が、感情的価値分類の性能を向上させるか。
  • RQ2価値と活性化をターゲットとしてマルチタスク学習を実施することで、主な価値分類器の一般化性能と精度が向上するか。
  • RQ3感情認識コンピューティングにおいて、生のスペクトログラムからの表現学習は、従来の特徴ベースのアプローチと比べてどのように異なるか。
  • RQ4関連性のないが大規模な音声データ(例:会議音声)を用いることで、感情的音声の表現がどの程度向上するか。
  • RQ5自己教師あり事前学習による性能向上は、3クラスと5クラスの分類スケールの両方で一貫してロバストか。

主な発見

  • BasicDCGANモデルは、5クラスの感情的価値分類タスクで43.88%の精度を達成し、完全に教師ありのCNNベースラインを顕著に上回った。
  • 3クラススケールでは、49.80%の精度を達成し、これは、テスト話者の会話パートナーのデータを活用するモデルを含む最先端の結果と同等の性能であった。
  • 予測された連続的価値ラベルと実際のラベルとの間に、ピアソン相関係数 ρ = 0.2618(p < .001)を示し、意味のある回帰性能を示した。
  • AMI会議コーパスのラベルなしデータは、特徴学習を顕著に向上させた。完全に教師ありのモデルよりも優れた性能を示した。
  • マルチタスク学習は性能向上に寄与せず、むしろわずかに性能を低下させた。MultitaskCNNは、すべての指標でBasicCNNを下回った。
  • 混同行列の結果、'ネガティブ'クラスは再現率は高いが、精度は低く、'非常にポジティブ'クラスが最高のF1スコア(0.5284)を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。