[論文レビュー] EmoWOZ: A Large-Scale Corpus and Labelling Scheme for Emotion Recognition in Task-Oriented Dialogue Systems
EmoWOZは、83,000件のユーザー発話に対する感情ラベルを含む、11,000件を超えるタスク指向対話のラベル付きコーパスを提供する大規模かつ公開可能なコーパスであり、OCCモデルに基づく新しい7段階の感情スキームを採用している。本研究では、感情ラベルの付与が共同目標正解率(JGA)を1.0%向上させることを示し、感情認識を組み込んだタスク指向対話システムにおけるコーパスの有効性を検証した。
The ability to recognise emotions lends a conversational artificial intelligence a human touch. While emotions in chit-chat dialogues have received substantial attention, emotions in task-oriented dialogues remain largely unaddressed. This is despite emotions and dialogue success having equally important roles in a natural system. Existing emotion-annotated task-oriented corpora are limited in size, label richness, and public availability, creating a bottleneck for downstream tasks. To lay a foundation for studies on emotions in task-oriented dialogues, we introduce EmoWOZ, a large-scale manually emotion-annotated corpus of task-oriented dialogues. EmoWOZ is based on MultiWOZ, a multi-domain task-oriented dialogue dataset. It contains more than 11K dialogues with more than 83K emotion annotations of user utterances. In addition to Wizard-of-Oz dialogues from MultiWOZ, we collect human-machine dialogues within the same set of domains to sufficiently cover the space of various emotions that can happen during the lifetime of a data-driven dialogue system. To the best of our knowledge, this is the first large-scale open-source corpus of its kind. We propose a novel emotion labelling scheme, which is tailored to task-oriented dialogues. We report a set of experimental results to show the usability of this corpus for emotion recognition and state tracking in task-oriented dialogues.
研究の動機と目的
- タスク指向対話における大規模で公開可能な感情ラベル付きコーパスの不足を解消すること。
- 基本的なセンチメント極性を超えて、ユーザーの目標に関連する文脈依存感情を捉える、特化した感情ラベル付けスキームの開発。
- 感情認識および下流タスクのためのベンチマークデータセットを提供することで、感情認識を組み込んだ対話システムの研究を可能にすること。
- 感情ラベルが対話状態追跡および強化学習フィードバック信号の改善にどの程度寄与するかを調査すること。
提案手法
- MultiWOZを拡張し、複数のドメインにまたがるウィザード・オブ・オズ型および人間-機械対話の11,000件を超える対話を含むEmoWOZを構築した。
- OCCモデルに基づく7段階の感情ラベル付けスキームを設計し、感情の価値、行動、誘発要因(例:恐怖、不満、満足)を捉えた。
- 83,000件のユーザー発話を手動でラベル付けし、高いアノテーター間一貫性と目標関連感情状態のカバーを確保した。
- BERTのような文脈エンコーダーを用いた感情認識モデルを訓練し、各感情クラスにおける正確性、再現率、F1スコアを評価した。
- マルチタスク学習において感情認識を補助タスクとして統合し、DSTと感情予測の共同学習により対話状態トラッカーを微調整した。
- 感情ラベルの有無を比較することで、対話状態追跡への影響を、共同目標正解率(JGA)を用いて評価した。
実験結果
リサーチクエスチョン
- RQ1タスク指向対話における大規模で公開可能な感情ラベル付きコーパスを構築し、下流研究を支援できるか?
- RQ2新規に提案されたOCCベースの感情ラベル付けスキームは、タスク指向対話における目標関連感情をどの程度的確に捉えられるか?
- RQ3感情認識は、タスク指向対話システムにおける対話状態追跡性能をどの程度向上させられるか?
- RQ4WOZスタイルの対話と機械生成ポリシー対話は、感情分布および感情認識に向けた有用性においてどのように異なるか?
主な発見
- EmoWOZは11,000件を超える対話と、ユーザー発話に対する83,000件の感情ラベルを含み、タスク指向対話における感情認識分野で最大級のオープンソースコーパスである。
- 提案された7段階の感情スキームは、恐怖、不満、満足といった文脈依存感情を的確に捉えており、高いラベル一貫性とユーザーの目標との関連性を示している。
- EmoWOZで学習した感情認識モデルは、テストセットでマクロF1スコア0.62を達成し、タスク指向対話における微細な目標関連感情の認識可能性を示している。
- MultiWOZの学習にEmoWOZデータを追加したことで、'不満'の再現率が29.1%向上し、'恐怖'と'興奮'の正確性もそれぞれ7.5%および7.1%向上した。これは、データの補完的有用性を示している。
- 感情認識を補助タスクとして統合した結果、対話状態トラッカーの共同目標正解率(JGA)は53.7%から54.7%に上昇し、統計的有意性(p < 0.02)が確認された。
- 結果から、感情ラベルは特にユーザーのいらだちや不満を検出するうえで、対話状態追跡に意味のある監視信号を提供することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。