[論文レビュー] EmoInHindi: A Multi-label Emotion and Intensity Annotated Dataset in Hindi for Emotion Recognition in Dialogues
本稿では、精神的健康および法的カウンセリングを想定したWizard-of-Ozフレームワークを用いて作成された、1,814件のヒンディー語対話(44,247発話)からなる大規模なマルチラベル感情および強度アノテーション付きデータセット、EmoInHindiを紹介する。C-Fourier-TransformerおよびC-Attention-Transformerモデルを用いた強力な文脈的ベースラインを提案し、単一ラベル感情および強度認識で66.24%のF1スコアを達成し、低リソース言語における対話的感情認識分野で新たな最先端性能を達成した。
The long-standing goal of Artificial Intelligence (AI) has been to create human-like conversational systems. Such systems should have the ability to develop an emotional connection with the users, hence emotion recognition in dialogues is an important task. Emotion detection in dialogues is a challenging task because humans usually convey multiple emotions with varying degrees of intensities in a single utterance. Moreover, emotion in an utterance of a dialogue may be dependent on previous utterances making the task more complex. Emotion recognition has always been in great demand. However, most of the existing datasets for multi-label emotion and intensity detection in conversations are in English. To this end, we create a large conversational dataset in Hindi named EmoInHindi for multi-label emotion and intensity recognition in conversations containing 1,814 dialogues with a total of 44,247 utterances. We prepare our dataset in a Wizard-of-Oz manner for mental health and legal counselling of crime victims. Each utterance of the dialogue is annotated with one or more emotion categories from the 16 emotion classes including neutral, and their corresponding intensity values. We further propose strong contextual baselines that can detect emotion(s) and the corresponding intensity of an utterance given the conversational context.
研究の動機と目的
- ヒンディー語のような低リソースインド言語において、大規模でマルチラベルかつ強度アノテーション付きの会話データセットが不足しているという問題に対処すること。
- 以前の発話に依存する感情状態を考慮した文脈に適した感情認識を可能にすること。
- ヒンディー語発話における複数の感情とその強度(0–3)を検出するための堅牢なニューラルベースラインの開発。
- 精神的健康や法的カウンセリングなど、感受性の高い分野における感情知能を持つ会話エージェントの開発を支援すること。
- 低リソース言語環境におけるマルチラベル感情および強度認識のベンチマークを確立すること。
提案手法
- データセットは、精神的健康および法的支援の文脈におけるユーザーとカウンセラー間のリアルな対話を模擬するWizard-of-Ozフレームワークを用いて収集された。
- 各発話は、16種類の感情クラス(例:喜び、悲しみ、怒り)の1つ以上と、0–3のスケールでの強度値でアノテートされた。
- 提案されたモデルは、2層のTransformerエンコーダ、300次元の埋め込み、初期値0.003のAdam最適化法を用いている。
- 主に2つのモデルが評価された:C-Attention-TransformerとC-Fourier-Transformer。両モデルとも負の対数尤度損失と、30エポック後に早期停止を適用している。
- モデルは、現在の発話に加え、それまでの会話履歴(t−1まで)を処理し、マルチラベル感情および強度出力を予測する。
- ハイパーパrameterはグリッドサーチで最適化され、学習のバッチサイズは32に設定された。
実験結果
リサーチクエスチョン
- RQ1Wizard-of-Oz手法を用いて、ヒンディー語対話において大規模でマルチラベルかつ強度アノテーション付きのデータセットを効果的に構築できるか?
- RQ2文脈的モデルは、ヒンディー語会話テキストにおいて複数の感情とその強度を認識する上でどの程度の性能を示すか?
- RQ3強力なニューラルベースラインと従来の手法との間には、低リソース言語における感情認識でどの程度の性能差があるか?
- RQ4会話履歴を組み込むことで、ヒンディー語対話における感情および強度予測の性能はどのように向上するか?
- RQ5特に語彙的曖昧性や感情的文脈の変化によって引き起こされる主な失敗モードは何か?
主な発見
- C-Fourier-Transformerモデルは、単一ラベル感情および強度認識で66.24%の最高F1スコアを達成し、すべてのベースラインを上回った。
- C-Fourier-Transformerモデルは、精度65.98%、再現率66.52%、F1スコア66.24%を達成し、bc-LSTMベースライン比で6.82ポイントの向上を示した。
- C-Fourier-Transformerモデルは、マルチラベル感情予測においてハミングロス0.055%、ジャコーディインデックス0.055%を達成し、両指標で他のモデルを上回った。
- 従来手法と比較して顕著な改善が見られた:正解率+6.19ポイント、F1スコア+6.82ポイント、再現率+6.8ポイントの向上。
- 誤差解析の結果、感情的な言葉(例:'dear' は喜びに関連づけられるが、文脈によってはそれ以外の感情を示す場合がある)により、モデルが誤って感情を分類することがあることが判明した。
- データセットであるEmoInHindiは、マルチラベル感情および強度アノテーション付きのヒンディー語会話データセットとして、公開済みで最大規模であり、1,814件の対話と44,247件の発話が含まれている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。