Skip to main content
QUICK REVIEW

[論文レビュー] A Siamese Neural Network with Modified Distance Loss For Transfer Learning in Speech Emotion Recognition

Kexin Feng, Theodora Chaspari|arXiv (Cornell University)|Jun 4, 2020
Emotion and Mood Recognition参考文献 12被引用数 6
ひとこと要約

本稿では、少数のラベル付きデータにおける音声感情認識のための転移学習を向上させるために、修正された距離損失を用いたシames型ニューラルネットワークを提案する。微調整中に同一クラスおよび異なるクラスのペア間の相対的距離を最適化することで、標準的な微調整と比較して未加重平均再現率(UAR)が最大7%向上し、固定層のハイパララメータチューニングよりも、ソースデータの選択がより大きな影響を示した。

ABSTRACT

Automatic emotion recognition plays a significant role in the process of human computer interaction and the design of Internet of Things (IOT) technologies. Yet, a common problem in emotion recognition systems lies in the scarcity of reliable labels. By modeling pairwise differences between samples of interest, a Siamese network can help to mitigate this challenge since it requires fewer samples than traditional deep learning methods. In this paper, we propose a distance loss, which can be applied on the Siamese network fine-tuning, by optimizing the model based on the relevant distance between same and difference class pairs. Our system use samples from the source data to pre-train the weights of proposed Siamese neural network, which are fine-tuned based on the target data. We present an emotion recognition task that uses speech, since it is one of the most ubiquitous and frequently used bio-behavioral signals. Our target data comes from the RAVDESS dataset, while the CREMA-D and eNTERFACE'05 are used as source data, respectively. Our results indicate that the proposed distance loss is able to greatly benefit the fine-tuning process of Siamese network. Also, the selection of source data has more effect on the Siamese network performance compared to the number of frozen layers. These suggest the great potential of applying the Siamese network and modelling pairwise differences in the field of transfer learning for automatic emotion recognition.

研究の動機と目的

  • ラベル付きデータが限られる音声感情認識の課題に対処するため、転移学習を活用する。
  • 少数のターゲットサンプルしか利用できない状況での知識転送の効率を向上させる。
  • ペairワイズ類似度学習を用いたシアンス型ネットワークの少数ショット感情認識における有効性を検証する。
  • ソースデータセット選択とアーキテクチャのハイパーパrameter(例:固定層の数)が微調整性能に与える影響を調査する。
  • 相対的クラス内およびクラス間距離をモデル化する新しい距離損失を提案し、特徴の識別能を向上させる。

提案手法

  • シアンス型ニューラルネットワークを、ソースデータセット(CREMA-D および eNTERFACE’05)で事前学習し、ターゲットの RAVDESS データセットで微調整する。
  • 提案された修正された距離損失は、微調整中に同一クラスペアと異なるクラスペアの特徴埋め込み間の相対的距離を最適化する。
  • 損失関数は、意思決定能力を保持しつつ埋め込み品質を向上させるために、特徴抽出層にのみ適用される。
  • 音声特徴は openSMILE を用いて抽出され、MFCC、エネルギー、ゼロクロッシングレートおよびその一次微分を含む64次元の特徴ベクトルが得られる。
  • 微調整は、固定層の数を変化させたり、ターゲット話者の数(3〜5人)を変更したりして実施され、汎化性能とデータ効率を評価する。
  • 性能評価は、複数のソース・ターゲットコンビネーションにおいて RAVDESS データセットの未加重平均再現率(UAR)を用いて実施される。

実験結果

リサーチクエスチョン

  • RQ1修正された距離損失は、音声感情認識における少数ショット転移学習のシアンス型ネットワークの性能を向上させることができるか?
  • RQ2ソースデータの選択は、クロスドメイン感情認識におけるシアンス型ネットワークの微調整性能にどのように影響を与えるか?
  • RQ3微調整時の固定層の数が、ソースデータセットの選択よりも性能に与える影響が大きいと予想されるか?
  • RQ4ペアワイズ類似度学習によるシアンス型ネットワークは、最小限のラベル付きターゲットデータでドメインシフトをどれほど軽減できるか?
  • RQ5提案された損失関数は、計算コストを増加させることなく、知識転送の効率を向上させることができるか?

主な発見

  • 提案された修正された距離損失により、標準的な微調整と比較して未加重平均再現率(UAR)が最大7%向上し、ソースデータセットに CREMA-D を使用した場合、UAR は 43.4% に達した。
  • 修正損失を用いた微調整は、ベースライン微調整およびオフドメイン学習(それぞれ UAR 32.8% および 29.3%)を上回る性能を示した。
  • ソースデータの選択が固定層の数よりも性能に与える影響が顕著で、CREMA-D が eNTERFACE’05 よりも優れた結果をもたらした。
  • 微調整プロセスに 3〜5 人のターゲット話者を含めると、性能対データ量の比が最良となり、データ不足と分布カバレッジの最適なバランスが示された。
  • インドメイン学習(UAR 50.0%)を上回ることはできなかったが、修正損失を用いたシアンス型ネットワークは、依然として強いポテンシャルを示しており、さらなる改善の余地がある。
  • 本手法は、相対的ペアワイズ距離をモデル化することで、リソースが限られた環境下での特徴の識別能と知識転送の質が向上することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。