Skip to main content
QUICK REVIEW

[論文レビュー] Learning Discriminative features using Center Loss and Reconstruction as Regularizer for Speech Emotion Recognition

Suraj Tripathi, Abhiram Ramesh|arXiv (Cornell University)|Jun 19, 2019
Speech and Audio Processing参考文献 23被引用数 8
ひとこと要約

本稿では、特徴の判別性と一般化性能を向上させるためにマルチタスク学習を活用し、畳み込みニューラルネットワーク(CNN)に基づく感情認識モデルを提案する。このモデルは、ソフトマックス損失とセンター損失を同時に最適化することで、判別性の高い特徴を学習し、入力特徴の再構成を補助的な正則化タスクとして用いる。その結果、パラメータ数を削減しながらも最先端の性能を達成した。

ABSTRACT

This paper proposes a Convolutional Neural Network (CNN) inspired by Multitask Learning (MTL) and based on speech features trained under the joint supervision of softmax loss and center loss, a powerful metric learning strategy, for the recognition of emotion in speech. Speech features such as Spectrograms and Mel-frequency Cepstral Coefficient s (MFCCs) help retain emotion-related low-level characteristics in speech. We experimented with several Deep Neural Network (DNN) architectures that take in speech features as input and trained them under both softmax and center loss, which resulted in highly discriminative features ideal for Speech Emotion Recognition (SER). Our networks also employ a regularizing effect by simultaneously performing the auxiliary task of reconstructing the input speech features. This sharing of representations among related tasks enables our network to better generalize the original task of SER. Some of our proposed networks contain far fewer parameters when compared to state-of-the-art architectures.

研究の動機と目的

  • メトリック学習を用いて、音声感情認識(SER)のためのより判別性の高い音響特徴を学習すること。
  • 入力音声特徴の補助的再構成タスクを導入することで、過学習を軽減し、SERモデルの一般化性能を向上させること。
  • パフォーマンスを落とさずに、複雑さを低減するための軽量アーキテクチャの設計により、モデルの複雑さを削減すること。
  • マルチタスク学習フレームワークにおいて、センター損失と再構成損失を組み合わせることの有効性を検証すること。
  • 複数のタスク間で共有される表現が、リソースが限られた状況下での感情認識タスクにおいて、より良い一般化をもたらすかどうかを検証すること。

提案手法

  • ソフトマックス損失とセンター損失の両方の監視信号を用いて、スペクトログ램やMFCCなどの音声特徴を入力としてCNNを学習する。
  • センター損失を適用し、同じクラスに属する埋め込みをそのクラスの中心に引き寄せるようにすることで、クラス内分散を最小化する。
  • ボトルネック層から入力音声特徴を再構成する補助的タスクを導入する。
  • 主な分類タスクと再構成タスクの両方に同じ特徴抽出器を共有することで、頑健な表現学習を促進する。
  • 交差エントロピー(ソフトマックス)損失とセンター損失を組み合わせたマルチタスク損失関数を用い、再構成損失を正則化項として利用する。
  • 最先端のモデルよりもパラメータ数を減らした軽量アーキテクチャを採用しながらも、高い性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1ソフトマックス損失とセンター損失を同時に最適化することで、音声感情認識における判別性の高い特徴学習が向上するか?
  • RQ2補助的再構成損失を追加することで、SERにおけるモデルの一般化性能が向上し、過学習が軽減されるか?
  • RQ3マルチタスク学習を用いた場合、軽量CNNアーキテクチャが、パラメータ数を減らしても競争力のある性能を達成できるか?
  • RQ4センター損失と再構成損失の組み合わせが、学習された埋め込み空間におけるクラス内compactnessとクラス間separabilityに与える影響はいかほどか?
  • RQ5分類タスクと再構成タスクの間で共有される表現が、リソースが限られたSERベンチマークでより良いパフォーマンスをもたらすか?

主な発見

  • 提案手法は、パラメータ数を大幅に削減しながらも、音声感情認識ベンチマークで最先端の性能を達成した。
  • ソフトマックス損失とセンター損失を同時に学習させることで、埋め込み空間におけるクラス内クラスタがよりcompactになり、クラス間分離性が向上した。
  • 再構成損失は効果的な正則化子として機能し、特にデータが少ない状況下で一般化性能を向上させ、過学習を軽減した。
  • 標準的なSERデータセットにおいて、パラメータ数を減らしても、既存のアーキテクチャを上回る性能を示した。これは、マルチタスク設計の有効性を示している。
  • センター損失の導入により、学習された特徴の判別力が著しく向上し、分類精度が向上した。
  • アブレーションスタディの結果、センター損失と再構成損失の両方が、性能向上に独立して寄与するとともに、相乗効果をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。