Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

Liwei Chen, Alexander I. Rudnicky|arXiv (Cornell University)|Oct 12, 2021
Speech Recognition and Synthesis参考文献 28被引用数 14
ひとこと要約

本論文は、感情に配慮した事前学習目的を活用して、wav2vec 2.0の微調整手法P-TAPTを提案し、音声感情認識(SER)を向上させる。P-TAPTは文脈的な感情状態を予測するためのタスク適応型事前学習を採用し、IEMOCAPデータセットにおいて、最先端のモデルよりも7.4%の絶対的向上を達成した。特にリソースが限られた状況下で顕著な性能向上を示した。

ABSTRACT

While Wav2Vec 2.0 has been proposed for speech recognition (ASR), it can also be used for speech emotion recognition (SER); its performance can be significantly improved using different fine-tuning strategies. Two baseline methods, vanilla fine-tuning (V-FT) and task adaptive pretraining (TAPT) are first presented. We show that V-FT is able to outperform state-of-the-art models on the IEMOCAP dataset. TAPT, an existing NLP fine-tuning strategy, further improves the performance on SER. We also introduce a novel fine-tuning method termed P-TAPT, which modifies the TAPT objective to learn contextualized emotion representations. Experiments show that P-TAPT performs better than TAPT, especially under low-resource settings. Compared to prior works in this literature, our top-line system achieved a 7.4\% absolute improvement in unweighted accuracy (UA) over the state-of-the-art performance on IEMOCAP. Our code is publicly available.

研究の動機と目的

  • 事前学習データ(ASR)とSERデータとの間のドメインシフトが、事前学習モデルの性能を制限するという問題に対処すること。
  • wav2vec 2.0の微調整を、単純な微調整や特徴抽出を超えて、音声感情認識(SER)の性能を向上させること。
  • データ効率的で感情に配慮した事前学習目的を開発し、特にリソースが限られた状況下でのモデル一般化性能を向上させること。
  • タスク適応型事前学習(TAPT)およびその変種P-TAPTが、通常の微調整および既存の最先端手法を上回ることを検証すること。
  • P-TAPTが、IEMOCAPのような自然に誘発された感情を含む音声において、言語的および感情的コンテンツをどれほど効果的に捉えられるかを評価すること。

提案手法

  • wav2vec 2.0の最終層にグローバル平均プーリング層と分類ヘッドを追加することで、発話レベルのSERを目的とした、通常の微調整(V-FT)を提案する。
  • タスク適応型事前学習(TAPT)を採用し、ターゲットSERデータセット上で事前学習を継続することで、事前学習データと微調整データの間のドメインシフトを低減する。
  • P-TAPTを新たに提案する。これはTAPTの目的関数を変更し、クラスタリングされたwav2vec 2.0表現から得られる擬似ラベルを用いて感情状態を予測するもので、感情に配慮した自己教師あり学習を可能にする。
  • wav2vec 2.0と感情状態推定モジュール間の時間的解像度を合わせるために、ストライド2の別個のCNNを用いる。
  • wav2vec 2.0の文脈的な表現から、クラスタリング手法を用いて感情状態の擬似ラベルを生成し、その後コントラスト型目的関数を用いてモデルを訓練する。
  • P-TAPTの目的関数をターゲットSERデータセット上で事前学習段階で適用することで、音声および感情に配慮した表現を学習可能にする。
Fig. 1 : System overview of our methods. (a) Emotion state estimation phase of P-TAPT. An additional CNN with stride 2 is used to align the time steps between wav2vec and wav2vec 2.0. The output of cluster assignments will be used as pseudo-labels for the P-TAPT objective. (b) Model architecture and
Fig. 1 : System overview of our methods. (a) Emotion state estimation phase of P-TAPT. An additional CNN with stride 2 is used to align the time steps between wav2vec and wav2vec 2.0. The output of cluster assignments will be used as pseudo-labels for the P-TAPT objective. (b) Model architecture and

実験結果

リサーチクエスチョン

  • RQ1wav2vec 2.0の通常の微調整は、IEMOCAPデータセットにおける音声感情認識で、既存の最先端手法を上回ることができるか?
  • RQ2ドメインシフトが事前学習データと微調整データの間に存在する場合、タスク適応型事前学習(TAPT)はwav2vec 2.0のSER性能を顕著に向上させることができるか?
  • RQ3P-TAPTで変更された事前学習目的(マスクされた音声フレームの予測ではなく感情状態の予測)は、リソースが限られたSER設定において、より高い性能とデータ効率をもたらすか?
  • RQ4P-TAPTの性能は、データサイズが異なる場合、特にリソースが限られた状況下で、TAPTやV-FTと比較してどのように異なるか?
  • RQ5データ内の言語的コンテンツ(例:文に特有の感情)がモデル性能に与える影響はどの程度か。また、P-TAPTはTAPTよりもそのようなパターンをより効果的に捉えられるか?

主な発見

  • wav2vec 2.0の通常の微調整(V-FT)は、IEMOCAPで69.9%の未加重正答率(UA)を達成し、特徴抽出としてwav2vec 2.0を用いた先行の最先端手法を上回った。
  • タスク適応型事前学習(TAPT)を適用すると、IEMOCAPでの未加重正答率は73.5%に向上し、ドメイン適応によるドメインシフト低減の有効性が示された。
  • 提案されたP-TAPT手法は、IEMOCAPで74.3%の未加重正答率を達成し、前回の最先端性能比で7.4%の絶対的向上を示した。
  • P-TAPTは優れたデータ効率性を示した:0.5時間の学習データにおける、P-TAPTのV-FT上回る向上率とTAPTのV-FT上回る向上率の比は65.0%であり、リソースが限られた状況下での利点が顕著に表れた。
  • SAVEEデータセットでは、TAPTはV-FTを8.8%上回り、P-TAPTはさらに70.9%の未加重正答率を達成したが、強い言語的・感情的相関のため、TAPTに対する向上率は小さかった。
  • LibriSpeechでの事前学習損失(32.04)は、IEMOCAPでの損失(55.42)よりも顕著に低く、ドメインシフトの存在が確認された。このため、TAPTおよびP-TAPTの適用が正当化された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。