Skip to main content
QUICK REVIEW

[論文レビュー] Ladder Networks for Emotion Recognition: Using Unsupervised Auxiliary Tasks to Improve Predictions of Emotional Attributes

Srinivas Parthasarathy, Carlos Busso|arXiv (Cornell University)|Apr 28, 2018
Emotion and Mood Recognition参考文献 26被引用数 42
ひとこと要約

本稿では、自己教師あり畳み込み自己符号化器とマルチタスク学習を組み合わせることで、感情的属性(覚醒、価値、優位性)の回帰性能を向上させるラッパーネットワークアーキテクチャを提案する。各層の隠れ表現を再構築するためにスキップ接続を用いることで、MSP-Podcastデータセットにおいて、分離学習、自己符号化器、自己教師あり正則化なしのマルチタスク学習を用いたベースラインを上回る最先端の性能を達成した。

ABSTRACT

Recognizing emotions using few attribute dimensions such as arousal, valence and dominance provides the flexibility to effectively represent complex range of emotional behaviors. Conventional methods to learn these emotional descriptors primarily focus on separate models to recognize each of these attributes. Recent work has shown that learning these attributes together regularizes the models, leading to better feature representations. This study explores new forms of regularization by adding unsupervised auxiliary tasks to reconstruct hidden layer representations. This auxiliary task requires the denoising of hidden representations at every layer of an auto-encoder. The framework relies on ladder networks that utilize skip connections between encoder and decoder layers to learn powerful representations of emotional dimensions. The results show that ladder networks improve the performance of the system compared to baselines that individually learn each attribute, and conventional denoising autoencoders. Furthermore, the unsupervised auxiliary tasks have promising potential to be used in a semi-supervised setting, where few labeled sentences are available.

研究の動機と目的

  • 深層ニューラルネットワークを用いて連続的ない感情的属性(覚醒、価値、優位性)の予測を改善すること。
  • 特に隠れ表現のノイズ除去を目的とした自己教師あり補助タスクが、モデルの正則化および一般化性能の向上に寄与するかどうかを検証すること。
  • 自己教師あり補助タスクと教師ありマルチタスク学習を組み合わせることで、感情認識における有効性を評価すること。
  • 限定的なラベル付きデータを前提とした半教師あり設定において、ラッパーネットワークの可能性を検討すること。

提案手法

  • 教師あり回帰と自己教師ありノイズ除去を同時に学習可能とするために、エンコーダー層とデコーダー層間にスキップ(横方向)接続を持つラッパーネットワークを採用する。
  • 訓練中に各層の隠れ表現に分散σ² = 0.3のノイズを適用することで、モデルのロバスト性を向上させる。
  • 再構築損失として平均二乗誤差を用い、再構築損失と回帰損失の重み付き組み合わせ(λl = 1)を採用することで最適な性能を達成する。
  • マルチタスク学習(MTL)を実装し、全3つの感情的属性を同時に予測する。タスク間で特徴表現を共有することで、効率的な学習を実現する。
  • 隠れ層にはReLU活性化関数、回帰出力には線形出力を使用。正則化のためNADAM最適化法とドロップアウト(p = 0.5)を適用する。
  • 回帰性能の損失関数および評価指標として、一致相関係数(CCC)を用いる。

実験結果

リサーチクエスチョン

  • RQ1隠れ表現の再構築を目的とした自己教師あり補助タスクが、感情的属性回帰の性能向上に寄与するか?
  • RQ2自己教師ありノイズ除去と教師ありマルチタスク学習を組み合わせることで、感情認識におけるモデルの一般化性能はどのように変化するか?
  • RQ3ラッパーネットワークアーキテクチャは、標準的な自己符号化器やマルチタスク学習ベースラインを上回る性能を示すか?
  • RQ4自己教師あり事前学習によるラッパーネットワークが、リソースが限られた感情認識の半教師あり学習において、どの程度の恩恵をもたらすか?

主な発見

  • Ladder+MTLモデルは、覚醒(CCC = 0.803 ± 0.002)、価値(CCC = 0.458 ± 0.004)、優位性(CCC = 0.746 ± 0.001)の各タスクで最高のテスト性能を達成した。
  • ラッパーネットワークは自己教師あり自己符号化器ベースライン(覚醒のCCC = 0.770 ± 0.004)を顕著に上回り、自己符号化器特徴のみでは回帰に不十分であることが示された。
  • Ladder+STLモデルは、価値(CCC = 0.765 ± 0.002)で最高の性能を達成し、MTLベースラインを上回った。これは、自己教師あり正則化が特にこの属性に有益である可能性を示唆している。
  • すべてのラッパーネットワークバリエーションが、ベースラインと比較して統計的に有意な改善を示した(p < 0.05)。自己教師あり補助タスクの表現学習における価値が確認された。
  • Ladder+MTLモデルが最も包括的な性能を示し、自己教師ありおよび教師あり補助タスクを組み合わせることで、より強固な特徴表現が得られることを示した。
  • 結果から、ラッパーネットワークは半教師あり設定に効果的に拡張可能であり、ラベル付きデータが限られた状況でも、大量の未ラベルデータを活用して性能向上が図れることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。