Skip to main content
QUICK REVIEW

[論文レビュー] ConcealNet: An End-to-end Neural Network for Packet Loss Concealment in Deep Speech Emotion Recognition

Mostafa M. Mohamed, Björn W. Schuller|arXiv (Cornell University)|May 15, 2020
Speech and Audio Processing参考文献 36被引用数 11
ひとこと要約

ConcealNet は、マスクに注意を払うメカニズムで包まれた再帰的生成セルを備えたエンド・ツー・エンドのニューラルネットワークであり、パケット損失隠蔽(PLC)をディープラーニングを用いた感情認識(SER)に統合する。短時間の損失が頻発する状況でも、音声再構成および感情予測の両面で顕著な向上を達成しており、双方向型およびストレス学習型のバリエーションが、0置換や補間といったベースラインを上回っている。

ABSTRACT

Packet loss is a common problem in data transmission, including speech data transmission. This may affect a wide range of applications that stream audio data, like streaming applications or speech emotion recognition (SER). Packet Loss Concealment (PLC) is any technique of facing packet loss. Simple PLC baselines are 0-substitution or linear interpolation. In this paper, we present a concealment wrapper, which can be used with stacked recurrent neural cells. The concealment cell can provide a recurrent neural network (ConcealNet), that performs real-time step-wise end-to-end PLC at inference time. Additionally, extending this with an end-to-end emotion prediction neural network provides a network that performs SER from audio with lost frames, end-to-end. The proposed model is compared against the fore-mentioned baselines. Additionally, a bidirectional variant with better performance is utilised. For evaluation, we chose the public RECOLA dataset given its long audio tracks with continuous emotion labels. ConcealNet is evaluated on the reconstruction of the audio and the quality of corresponding emotions predicted after that. The proposed ConcealNet model has shown considerable improvement, for both audio reconstruction and the corresponding emotion prediction, in environments that do not have losses with long duration, even when the losses occur frequently.

研究の動機と目的

  • パケット損失がモデル性能を低下させるため、会話感情認識(SER)におけるエンド・ツー・エンドのPLCソリューションが不足しているという問題に対処すること。
  • 再帰的アーキテクチャ内に直接統合可能なリアルタイムで段階的なPLCを実行するニューラルネットワークの開発。
  • 長時間の損失に対して耐性を高めるために、新しいストレス学習方式を導入すること。
  • 連続する感情アノテーションが付与されたRECOLAデータセットを用いて、PLCがSER性能に与える影響を評価すること。

提案手法

  • 再帰的生成セル $ R $ は、スタックドLSTMとして実装され、損失フレームを特定するためのバイナリマスク $ M_t $ を用いる隠蔽関数 $ F_R $ で包まれる。
  • 損失マスク $ M_t = 0 $ の場合、隠蔽セル $ F_R $ は、過去の状態とマスクされた入力を用いて、隠蔽フレーム $ \hat{\mathbf{x}}_t $ を予測する。
  • 音声フレームに対する再構成損失と感情ラベルに対する交差エントロピー損失を用いて、エンド・ツー・エンドでモデルを訓練する。
  • 双方向型のConcealNetは、前方および後方の隠れ状態を平均化することで、損失隠蔽のための文脈認識を向上させる。
  • ストレス学習方式を導入し、高損失状況(例:$ p_L = 0.9 $)でモデルを学習させることで、長時間損失シーケンスへの一般化能力を向上させる。
  • 完全なシステムは、ConcealNetとエンド・ツー・エンドのSERヘッドを組み合わせ、損失のある入力からの同時音声再構成と感情予測を可能にする。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドのニューラルPLCモジュールは、フレーム損失下でも会話感情認識の性能を向上させることができるか?
  • RQ2古典的なPLCベースライン(例:0置換、線形補間)と比較して、ConcealNetは音声再構成および感情予測においてどの程度優れているか?
  • RQ3双方向処理は、特に長時間損失の状況下でPLC性能を向上させるか?
  • RQ4ストレス学習は、長時間のパケット損失に対するConcealNetの耐性を顕著に向上させるか?
  • RQ5ConcealNetとSERを同時にエンド・ツー・エンドで訓練することで、全体のシステム性能がどの程度向上するか?

主な発見

  • ConcealNet は、中程度の損失(10.16%の損失率)下で、感情予測のCCCを元の値の76.93%(アーザル)から75.99%へ、感情の価値(バレンス)を43.18%から39.81%へと低下させることで、最小限の劣化を示した。
  • 双方向型のConcealNetは、前方のみのバージョンを上回り、10.16%の損失率下でアーザルのCCCが76.86%、バレンスが43.18%を達成した。
  • 高い損失率(例:50.06%および90.15%)下では、ストレス学習済みのConcealNetモデルが非ストレスモデルよりも顕著に優れた性能を示し、特にバレンス予測において顕著であった。
  • 極端な状況($ p_L = 0.9 $)では、0置換ベースラインが音声隠蔽においてConcealNetを上回ったが、ストレス学習により、感情予測が最大10ポイント向上した。
  • ストレス学習方式は、長時間の損失シーケンスに対する耐性を顕著に向上させ、ConcealNetが最大9フレーム連続で損失を回復する状況でも、性能劣化を低減した。
  • ConcealNetとSERヘッドを統合したエンド・ツー・エンドのシステムは、RECOLAデータセットで最先端の性能を達成し、統合的PLCと感情認識の実現可能性と有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。