Skip to main content
QUICK REVIEW

[論文レビュー] Addressing Ambiguity of Emotion Labels Through Meta-Learning

Takuya Fujioka, Dario Bertero|arXiv (Cornell University)|Nov 6, 2019
Face and Expression Recognition参考文献 19被引用数 10
ひとこと要約

本稿では、音声感情認識におけるトレーニング中に、曖昧な感情ラベルを動的に補正し、サンプルの重要度を推定するメタラーニング手法を提案する。BLSTMとアテンションモデル、学習されたラベル分布($m{L}$)、サンプル重み($m{w}$)を交互に最適化することで、IEMOCAPデータセット上で性能が向上し、重み付き正確度65.9%、不加重正確度61.4%を達成。ベースラインのBLSTMとアテンションモデルよりそれぞれ2.5ポイントおよび2.7ポイント高い。

ABSTRACT

Emotion labels in emotion recognition corpora are highly noisy and ambiguous, due to the annotators' subjective perception of emotions. Such ambiguity may introduce errors in automatic classification and affect the overall performance. We therefore propose a dynamic label correction and sample contribution weight estimation model. Our model is based on a standard BLSTM model with attention with two extra parameters. The first learns a new corrected label distribution, and is aimed to fix the inaccurate labels from the dataset. The other instead estimates the contribution of each sample to the training process, and is aimed to ignore the ambiguous and noisy samples while giving higher weight to the clear ones. We train our model through an alternating optimization method, where in the first epoch we update the neural network parameters, and in the second we keep them fixed to update the label correction and sample importance parameters. When training and evaluating our model on the IEMOCAP dataset, we obtained a weighted accuracy (WA) and unweighted accuracy (UA) of respectively 65.9% and 61.4%. This yielded an absolute improvement of 2.5%, 2.7% respectively compared to a BLSTM with attention baseline, trained on the corpus gold labels.

研究の動機と目的

  • 音声感情認識データセットにおける人間アノテーションの高ノイズ性と曖昧性に対処すること。
  • トレーニング中に誤標記や曖昧な発話によって引き起こされるモデル性能の低下を軽減すること。
  • トレーニング中にラベルを動的に補正し、サンプルの寄与度重みを推定することで分類のロバスト性を向上させること。
  • 感情認識データセットにおけるクラス不均衡や主観的ラベリングバイアスの影響を軽減すること。
  • 反復的ラベル補正とサンプル重み付けを通じてノイズラベルから学習することで、既存のベースラインを上回ること。

提案手法

  • 本手法は、ベースとなる感情分類モデルとしてBLSTMとアテンションを用いる。
  • 各サンプルに対して2つの学習可能なパラメータを導入する:誤ったアノテーションを是正するための修正ラベル分布$m{L}_n$、曖昧なサンプルを低減するためのサンプル寄与度重み$m{w}_n$。
  • トレーニングは交互最適化により進行する:まずニューラルネットワークパラメータを更新し、次にそれらを固定した上で$m{L}_n$と$m{w}_n$を全体損失を最小化するように更新する。
  • ラベル補正$m{L}_n$は、予測ラベルと修正ラベルの間の交差エントロピー損失を最小化するように学習される。
  • サンプル重み$m{w}_n$は、曇ったサンプルの損失寄与度を低減するように最適化され、明確で信頼性の高いサンプルに高い重みが割り当てられる。
  • フレームワークは、2段階の交互最適化スケジュールに従い、IEMOCAPデータセット上でエンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1トレーニング中に動的にラベル補正を実施することで、音声感情認識における曇った・ノイズの高いラベルの影響を軽減できるか?
  • RQ2個々のサンプルの寄与度重みを学習することで、不均衡でノイズの高いデータセット上でのモデルのロバスト性と性能が向上するか?
  • RQ3提案されたラベル補正とサンプル重み付けメカニズムが、異なる感情クラスに与える影響は何か?
  • RQ4学習されたサンプル重みによって、『ハッピー』のような非常に曇ったクラスの影響をどの程度軽減できるか?
  • RQ5提案されたメタラーニングアプローチは、静的ラベル補正やデータ拡張手法に比べ、正確度とF1スコアの両面で優れているか?

主な発見

  • 提案モデルは、IEMOCAPデータセットで重み付き正確度65.9%、不加重正確度61.4%を達成し、BLSTMとアテンションのベースラインよりそれぞれ2.5ポイントおよび2.7ポイントの絶対的向上を示した。
  • ハッピー、サッドネス、ニュートラル、アングリーの各クラスで、F1スコアがそれぞれ+0.5%、+2.1%、+2.4%、+1.9%向上した。
  • ハッピークラスの精度が14.6%上昇し、元のラベルに高い曇りが存在しても他のクラスと良好に分離されたことを示した。
  • ラベル補正機構は、頻繁にハッピーをサッドネスやニュートラルに再ラベル付けしており、このクラスに高い曇りが存在することを反映している。
  • ハッピーのサンプルに対しては、サンプル重み$m{w}_n$が顕著に低く抑えられ、トレーニング中に低信頼性・高曇りであることが示された。
  • $m{L}$と$m{w}$の更新前に元のラベルでモデルを事前学習しても性能向上が得られず、ノイズの高いラベルに初期にさらされることでバイアスが導入される可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。