Skip to main content
QUICK REVIEW

[論文レビュー] Towards adversarial learning of speaker-invariant representation for speech emotion recognition

Ming Tu, Yun Tang|arXiv (Cornell University)|Mar 22, 2019
Emotion and Mood Recognition参考文献 20被引用数 17
ひとこと要約

本稿では、発話者に依存しない表現を学習するため、ドメイン adversarial training (DAT) とクロス勾配訓練 (CGT) を用いた adversarial training を提案する。勾配反転または勾配誘導型データ拡張を用いて、感情分類器と発話者分類器を同時に訓練することで、モデルは発話者固有の要因を分離し、未観測の発話者への一般化性能を向上させる。IEMOCAPでは、DATとCGTがそれぞれベースライン比で5.6%および7.4%の相対的精度向上を達成しており、DATはターゲット発話者データがなくても頑健であることが示された。

ABSTRACT

Speech emotion recognition (SER) has attracted great attention in recent years due to the high demand for emotionally intelligent speech interfaces. Deriving speaker-invariant representations for speech emotion recognition is crucial. In this paper, we propose to apply adversarial training to SER to learn speaker-invariant representations. Our model consists of three parts: a representation learning sub-network with time-delay neural network (TDNN) and LSTM with statistical pooling, an emotion classification network and a speaker classification network. Both the emotion and speaker classification network take the output of the representation learning network as input. Two training strategies are employed: one based on domain adversarial training (DAT) and the other one based on cross-gradient training (CGT). Besides the conventional data set, we also evaluate our proposed models on a much larger publicly available emotion data set with 250 speakers. Evaluation results show that on IEMOCAP, DAT and CGT provides 5.6% and 7.4% improvement respectively, over a baseline system without speaker-invariant representation learning on 5-fold cross validation. On the larger emotion data set, while CGT fails to yield better results than baseline, DAT can still provide 9.8% relative improvement on a standalone test set.

研究の動機と目的

  • 発話者変動が発話感情認識(SER)モデルの一般化性能を阻害するという課題に対処すること。
  • トレーニング中にラベル付きまたはラベルなしのターゲット発話者データを必要とせずに、発話者に依存しない表現を学習すること。
  • ドメイン一般化の観点から、SERにおける adversarial training 策略(DAT および CGT)の有効性を評価すること。
  • IEMOCAPのような小規模データセットおよび250人の発話者を含む大規模な中国語感情データセットにおける、DAT と CGT の性能を比較すること。

提案手法

  • モデルは3段階のアーキテクチャを採用する:TDNNおよびLSTMをベースとする表現学習ネットワークに統計的プーリングを適用し、その後に分離された感情分類および発話者分類ヘッドを設置する。
  • DATでは、発話者分類器に勾配反転層(GRL)を適用し、学習された表現からの発話者情報の最小化を図りつつ、感情分類性能を維持する。
  • CGTでは、敵対的タスクからの勾配を用いてドメインガイドドの摂動を生成し、データ拡張として機能させることでドメイン一般化を向上させる。
  • 表現学習ネットワークは、確率的勾配降下法(Nesterovモーメンタムを用いて)を用い、感情分類および発話者分類の目的関数に基づいてエンドツーエンドで訓練される。
  • トレーニングプロセスは100エポックで実施され、検証セットの性能に基づいて早期停止が適用される。
  • ベースラインのSER専用モデルおよびマルチタスク学習(MTL)ベースラインと比較するための2つのトレーニング戦略(DATおよびCGT)が検討された。

実験結果

リサーチクエスチョン

  • RQ1ターゲット発話者データを必要とせずに、ドメイン adversarial training(DAT)を用いた adversarial training が、未観測の発話者への発話感情認識モデルの一般化性能を向上させることができるか?
  • RQ2勾配誘導型データ拡張に基づくドメイン一般化手法であるクロス勾配訓練(CGT)は、リソースが限られた発話者設定において、ベースラインモデルを上回る性能を示すか?
  • RQ3250人の発話者を含む大規模データセットのように、トレーニング発話者数が増加した場合、DATとCGTの一般化性能はどのように比較されるか?
  • RQ4学習された表現がどれほど発話者に依存しなくなるか、t-SNE埋め込みを用いて可視化できるか?

主な発見

  • IEMOCAPデータセットでは、DATはベースラインのSER専用モデル比で5.6%の相対的精度向上を達成した。一方、CGTは7.4%の相対的向上を示した。
  • 250人の発話者を含む大規模な中国語発話感情データセットでは、DATはスタンドアロンのテストセットで依然として9.8%の相対的精度向上を達成しており、未観測の発話者への頑健性が示された。
  • CGTはIEMOCAPではベースラインを上回ったが、大規模データセットでは性能向上が見られず、トレーニングデータに既に多くの発話者変動が含まれている場合には有効性が低下することが示唆された。
  • t-SNE可視化により、DATが学習された埋め込みから発話者固有の情報を効果的に除去しており、より発話者に依存しない表現が得られていることが確認された。
  • DATでは、検証セットとテストセットの性能差が最小限に抑えられ、未観測の発話者への一般化性能が優れていることが示された。
  • マルチタスク学習(MTL)による感情分類と発話者分類の同時学習は一貫した向上をもたらさず、adversarial regularisationなしでは、adversarial adaptationに比べて効果が劣ることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。