Skip to main content
QUICK REVIEW

[論文レビュー] CTL-MTNet: A Novel CapsNet and Transfer Learning-Based Mixed Task Net for the Single-Corpus and Cross-Corpus Speech Emotion Recognition

Xin-Cheng Wen, Jiaxin Ye|arXiv (Cornell University)|Jul 18, 2022
Emotion and Mood Recognition被引用数 11
ひとこと要約

本稿では、単一コーパスおよびクロスコーパス音声感情認識のための、新しいCapsNetと転移学習に基づく混合タスクネットワーク、CTL-MTNetを提案する。自己注意機構を組み込んだ畳み込み-プーリングおよび注意CapsNet(CPAC)モジュールと、マージン乖離不一致(MDD)を用いたコーパス適応敵対モジュール(CAAM)を統合することで、ドメイン不変の感情表現を学習し、4つの多言語SERデータセットにおいて、単一およびクロスコーパス設定の両方で最先端の性能を達成した。

ABSTRACT

Speech Emotion Recognition (SER) has become a growing focus of research in human-computer interaction. An essential challenge in SER is to extract common attributes from different speakers or languages, especially when a specific source corpus has to be trained to recognize the unknown data coming from another speech corpus. To address this challenge, a Capsule Network (CapsNet) and Transfer Learning based Mixed Task Net (CTLMTNet) are proposed to deal with both the singlecorpus and cross-corpus SER tasks simultaneously in this paper. For the single-corpus task, the combination of Convolution-Pooling and Attention CapsNet module CPAC) is designed by embedding the self-attention mechanism to the CapsNet, guiding the module to focus on the important features that can be fed into different capsules. The extracted high-level features by CPAC provide sufficient discriminative ability. Furthermore, to handle the cross-corpus task, CTL-MTNet employs a Corpus Adaptation Adversarial Module (CAAM) by combining CPAC with Margin Disparity Discrepancy (MDD), which can learn the domain-invariant emotion representations through extracting the strong emotion commonness. Experiments including ablation studies and visualizations on both singleand cross-corpus tasks using four well-known SER datasets in different languages are conducted for performance evaluation and comparison. The results indicate that in both tasks the CTL-MTNet showed better performance in all cases compared to a number of state-of-the-art methods. The source code and the supplementary materials are available at: https://github.com/MLDMXM2017/CTLMTNet

研究の動機と目的

  • 異なる話者および言語を有する複数の音声コーパス間で共有される感情表現を学ぶという課題に対処すること。
  • 自己注意機構を用いることで特徴の識別性を向上させることで、単一コーパス音声感情認識の性能を向上させること。
  • 敵対的適応を用いてドメイン不変の表現を学習することで、耐障害性の高いクロスコーパス感情認識を実現すること。
  • 単一およびクロスコーパスSERタスクを同時に効果的に行える統合フレームワークの開発

提案手法

  • 畳み込み-プーリングと自己注意機構を統合した新しいCPACモジュールを提案し、キャプセルの注目を顕著で識別性の高い特徴に誘導する。
  • CPACモジュールをコーパス適応敵対モジュール(CAAM)と統合することで、ドメイン分布の整合性を図り、複数のコーパス間で共通する感情的特徴を抽出する。
  • ドメイン適応損失としてマージン乖離不一致(MDD)を採用し、ソースドメインとターゲットドメインの表現の乖離を最小化する。
  • 単一コーパスおよびクロスコーパスSERの両方の目的を同時に最適化できる混合タスク学習戦略を採用し、1つのネットワークアーキテクチャ内で実現する。
  • 一般化性能および耐障害性を評価するために、4つの多言語SERデータセットを用いてエンドツーエンドでモデルを訓練する。
  • 共有特徴でネットワークを初期化し、特定のコーパスタスクにファインチューニングすることで、転移学習の原則を活用する。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構を備えたCapsNetアーキテクチャは、単一コーパス音声感情認識のための特徴表現を向上させることができるか?
  • RQ2敵対的適応とMDDを用いることで、異なる音声コーパス間でドメイン不変の表現をどれほど効果的に学習できるか?
  • RQ3CPACとCAAMの統合は、従来手法と比較して、クロスコーパス音声感情認識の性能を向上させるか?
  • RQ4統合された混合タスクフレームワークは、多様な言語的および話者ドメインにどれほど一般化するか?

主な発見

  • CTL-MTNetは、評価された4つの多言語SERデータセットすべてで最先端の性能を達成し、単一およびクロスコーパス設定の両方で既存のSOTA手法を上回った。
  • アブレーションスタディの結果、CPACモジュールが特徴の識別性を顕著に向上させたことが確認され、特に微細な感情的キューを捉える能力が向上した。
  • CAAMにMDDを組み合わせることでドメインシフトが効果的に低減され、ソースコーパスから未観測のターゲットコーパスへの一般化性能が強化された。
  • 可視化結果から、モデルが特にクロスコーパス状況において、感情関連の音声セグメントに注目していることが示された。
  • 異なる言語間で一貫した性能向上が確認され、多言語感情表現学習の強靭性が裏付けられた。
  • フルフレームワークはクロスコーパス評価において優れた正確度とF1スコアを達成し、共同学習戦略の有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。