[論文レビュー] Adding Chit-Chat to Enhance Task-Oriented Dialogues
本論文では、人間とAIの協働によるデータ収集手法を用いて文脈的に適切な雑談応答を統合することで、タスク指向対話の質を向上させる Accentor というフレームワークを提案する。このアプローチでは、事前学習済みモデルを用いて多様な雑談候補を生成し、低品質なものをフィルタリングした後、根拠を添えた人間によるアノテーションを実施することで、SGD および MultiWOZ 2.1 から合計 23.8K の拡張対話データを構築した。人的評価では、会話の魅力、興味の持続、知識の豊かさ、人間らしさの面で顕著な向上が確認された一方で、タスク性能は競争力のある水準を維持した。
Existing dialogue corpora and models are typically designed under two disjoint motives: while task-oriented systems focus on achieving functional goals (e.g., booking hotels), open-domain chatbots aim at making socially engaging conversations. In this work, we propose to integrate both types of systems by Adding Chit-Chat to ENhance Task-ORiented dialogues (ACCENTOR), with the goal of making virtual assistant conversations more engaging and interactive. Specifically, we propose a Human AI collaborative data collection approach for generating diverse chit-chat responses to augment task-oriented dialogues with minimal annotation effort. We then present our new chit-chat-based annotations to 23.8K dialogues from two popular task-oriented datasets (Schema-Guided Dialogue and MultiWOZ 2.1) and demonstrate their advantage over the originals via human evaluation. Lastly, we propose three new models for adding chit-chat to task-oriented dialogues, explicitly trained to predict user goals and to generate contextually relevant chit-chat responses. Automatic and human evaluations show that, compared with the state-of-the-art task-oriented baseline, our models can code-switch between task and chit-chat to be more engaging, interesting, knowledgeable, and humanlike, while maintaining competitive task performance.
研究の動機と目的
- タスク指向対話システムとオープンドメインチャットボットの間のギャップを埋め、会話の没入感を向上させるために雑談を統合すること。
- 人間によるアノテーションの負荷を最小限に抑えるために、人間とAIの協働パイプラインを用いて、タスク指向対話用の高品質な雑談応答を生成すること。
- より人間らしく、魅力的な対話を実現するため、タスク指向の目的と自然な雑談の間で動的に切り替え可能なモデルを開発すること。
- SGD および MultiWOZ 2.1 から抽出した 23.8K の対話に、雑談アノテーションを付与した、新たに公開可能なデータセットの構築。
提案手法
- 2段階の候補生成プロセス:まず事前学習済み生成モデルを用いて多様な雑談応答を生成し、次に独自に微調整した分類器を用いて低品質な候補をフィルタリングする。
- フィルタリング済み候補に対して、人間が『良い』または『悪い』とラベル付けし、根拠を添えることで文脈的関連性と品質を保証する。
- 拡張データセットを用いて、エンドツーエンドおよび2種類のコードスイッチャー構造を持つ3つのニューラルモデルを訓練し、ユーザーの目的追跡と雑談応答生成の両方を統合的に最適化する。
- ACUTE-Eval を用いた自動評価と、4軸(魅力、興味、知識、人間らしさ)における人的評価の両方を実施。
- 1ターン内でのタスク指向応答と雑談応答の動的切り替えを可能にする統一的な学習目的関数の採用。
- 拡張データセットを用いて事前学習済み言語モデルを微調整し、タスク性能と会話品質の両方を向上させる。
実験結果
リサーチクエスチョン
- RQ1最小限の人的アノテーションで、タスク指向対話に効果的かつ効率的に雑談応答を生成できるか?
- RQ2文脈的に適切な雑談を追加することで、人間の評価において会話の魅力、知識、人間らしさの面で質の向上が見られるか?
- RQ3機能的性能を損なわせることなく、モデルがタスク指向応答と雑談応答を動的に切り替えられるか?
- RQ4提案する人間とAIの協働データ収集パイプラインは、完全に人的アノテーションを行う方法や、完全に自動化された方法と比較して、コストと品質の面でどのように差がつくか?
主な発見
- 人的評価の結果、雑談を追加した対話は、魅力、興味、知識、人間らしさの4軸すべてにおいて、元の対話よりも顕著に好まれていることが示された。
- 提案されたモデルは、人的評価指標において最先端のベースラインを上回った一方で、目的追跡の正確性やアクション決定のF1スコアは競争力のある水準を維持した。
- 人間とAIの協働によるデータ収集手法により、人的アノテーションの前に低品質な候補をフィルタリングしたため、アノテーションの負荷が軽減され、効率性が向上した。
- 新たに構築されたデータセット、accentor-SGD および accentor-MultiWOZ 2.1 には、文脈的に適切な雑談を追加した合計 23.8K の対話が含まれており、タスクと雑談の両方のコンponentsを明示的にアノテートした最初のデータセットである。
- コードスイッチャー・モデルは、対話の文脈とユーザーの目的に適した適切な雑談応答を生成する能力を示した。
- ACUTE-Eval を用いた自動評価では、拡張済み対話がより魅力的で人間らしいことが確認され、すべての評価次元で統計的に有意な向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。