Skip to main content
QUICK REVIEW

[論文レビュー] Simulated Chats for Task-oriented Dialog: Learning to Generate Conversations from Instructions.

Biswesh Mohapatra, Gaurav Pandey|arXiv (Cornell University)|Oct 20, 2020
Topic Modeling参考文献 19被引用数 8
ひとこと要約

この論文では、GPT-2ベースのシミュレーションフレームワークを提案する。このフレームワークは、実際のヒューマン生成対話データとその指示を少量用いて、ユーザーボットとエージェントボットを訓練することで、クラウドソーシングによるデータ収集をエミュレートし、タスク指向対話生成を行う。この手法は、低リソースおよび全体的なタスクパフォーマンスの両方を著しく向上させ、タスク指向対話データ作成におけるクラウドソーシングプロセスを完全にシミュレートする最初のアプローチである。

ABSTRACT

Popular task-oriented dialog data sets such as MultiWOZ (Budzianowski et al. 2018) are created by providing crowd-sourced workers a goal instruction, expressed in natural language, that describes the task to be accomplished. Crowd-sourced workers play the role of a user and an agent to generate dialogs to accomplish tasks involving booking restaurant tables, making train reservations, calling a taxi etc. However, creating large crowd-sourced datasets can be time consuming and expensive. To reduce the cost associated with generating such dialog datasets, recent work has explored methods to automatically create larger datasets from small this http URL this paper, we present a data creation strategy that uses the pre-trained language model, GPT2 (Radford et al. 2018), to simulate the interaction between crowd-sourced workers by creating a user bot and an agent bot. We train the simulators using a smaller percentage of actual crowd-generated conversations and their corresponding goal instructions. We demonstrate that by using the simulated data, we achieve significant improvements in both low-resource setting as well as in over-all task performance. To the best of our knowledge we are the first to present a model for generating entire conversations by simulating the crowd-sourced data collection process

研究の動機と目的

  • クラウドソーシングプロセスをシミュレートすることで、大規模なタスク指向対話データセットを構築するコストと時間を削減すること。
  • ヒューマンアノテートされた対話データ収集の高コストとスケーラビリティの制限を解決すること。
  • 言語モデルによって生成された合成対話が、実際のヒューマン生成データを効果的に補完できるかどうかを検討すること。
  • シミュレートされた対話を訓練データとして用いることで、低リソース環境におけるモデルパフォーマンスを向上させること。
  • 指示からユーザーやエージェントの役割を模倣して、完全な会話を生成する方法の実現可能性を示すこと。

提案手法

  • 実際のヒューマン生成対話の少量のサブセットとその対応する目的指示を用いて、GPT-2を微調整し、ユーザーボットおよびエージェントボットとしての動作を実現する。
  • 事前学習済み言語モデルを用いて、ユーザとエージェント間の対話をシミュレートし、実際のクラウドソーシング会話に類似した完全な対話を生成する。
  • 実際のクラウドソーシング会話のわずかなパcent(パーセント)のみを用いてシミュレータを訓練することで、アノテーション依存性を低減する。
  • 目的指示をユーザーボットおよびエージェントボットにプロンプトすることで、スケーラブルなデータ生成を可能にする合成対話を生成する。
  • シミュレートされた対話を、下流のタスク指向対話モデルの事前学習または微調整に用いる。
  • 実データとシミュレートデータの混合データで訓練されたモデルのパフォーマンスを、低リソースおよびフルデータ設定の両方で評価する。

実験結果

リサーチクエスチョン

  • RQ1言語モデルは、現実的なタスク指向対話を生成するために、クラウドソーシングプロセスをシミュレートできるか?
  • RQ2低リソース環境におけるモデルパフォーマンス向上に、シミュレートされたデータはどの程度効果的か?
  • RQ3実データとシミュレートデータを組み合わせることで、実データのみを使用した場合よりも全体的なパフォーマンスが向上するか?
  • RQ4シミュレートされた対話は、未学習のタスクに一般化可能であり、実際の人間の相互作用と一貫性を保っているか?
  • RQ5実データとシミュレートデータの割合を変化させた場合、モデルパフォーマンスにどのような影響があるか?

主な発見

  • 提案手法は、シミュレートされた対話を活用することで、低リソース環境において顕著なパフォーマンス向上を達成した。
  • 実データとシミュレートデータの混合データで訓練されたモデルは、実データのみで訓練されたモデルよりも、低リソースおよびフルデータの両方の状況で優れたパフォーマンスを示した。
  • シミュレートされた対話は、モデルの一般化性能を向上させ、高価なヒューマンアノテートデータへの依存を低減するのに効果的であった。
  • 本手法は、言語モデルを用いてタスク指向対話データ作成におけるクラウドソーシングプロセスを完全にシミュレートする最初のアプローチである。
  • 実対話の少量のデータでGPT-2を微調整することで、高品質な合成会話を生成でき、下流の訓練に有用であった。
  • 本手法はデータ収集コストを低減しつつ、評価指標のあらゆる面でモデルパフォーマンスを維持または向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。