Skip to main content
QUICK REVIEW

[論文レビュー] A Hybrid Task-Oriented Dialog System with Domain and Task Adaptive Pretraining

Boliang Zhang, Ying Lyu|arXiv (Cornell University)|Feb 8, 2021
Topic Modeling参考文献 26被引用数 5
ひとこと要約

本論文は、ドメインおよびタスク適応的事前学習を用いてGPT-2を微調整し、マルチドメイン対話タスクに適応するハイブリッドエンドツーエンドのタスク指向対話システムを提示する。対話固有のデータセットで事前学習し、NLU、DST、NLGを同時に最適化するマルチタスク微調整により、最先端の性能を達成し、人間評価の平均成功率91%でDSTC9の共有タスクで1位タイを達成した。

ABSTRACT

This paper describes our submission for the End-to-end Multi-domain Task Completion Dialog shared task at the 9th Dialog System Technology Challenge (DSTC-9). Participants in the shared task build an end-to-end task completion dialog system which is evaluated by human evaluation and a user simulator based automatic evaluation. Different from traditional pipelined approaches where modules are optimized individually and suffer from cascading failure, we propose an end-to-end dialog system that 1) uses Generative Pretraining 2 (GPT-2) as the backbone to jointly solve Natural Language Understanding, Dialog State Tracking, and Natural Language Generation tasks, 2) adopts Domain and Task Adaptive Pretraining to tailor GPT-2 to the dialog domain before finetuning, 3) utilizes heuristic pre/post-processing rules that greatly simplify the prediction tasks and improve generalizability, and 4) equips a fault tolerance module to correct errors and inappropriate responses. Our proposed method significantly outperforms baselines and ties for first place in the official evaluation. We make our source code publicly available.

研究の動機と目的

  • マルチドメイン・マルチゴールの状況において、エラー伝搬と高い工学的コストに悩まされるパイプライン型タスク指向対話システムの限界を克服する。
  • GPT-2のような汎用言語モデルとタスク指向対話の間のドメインギャップを埋めるために、事前学習を対話固有の分布に適応させる。
  • 1つの自己回帰的シーケンスモデル内で自然言語理解(NLU)、対話状態追跡(DST)、応答生成(NLG)を同時に学習することで、エンドツーエンド対話システムの性能を向上させる。
  • ヒューリスティックな前処理/後処理と障害耐性モジュールを導入し、モデルの誤りを是正することで、耐性と人間らしい出力を向上させる。
  • ドメイン適応的事前学習とマルチタスク微調整の組み合わせを用いて、DSTC9のエンドツーエンドマルチドメインタスク完了チャレンジで最高のパフォーマンスを達成する。

提案手法

  • 外部の対話データセット(例:Schema-Guided Dialog や Taskmaster)を用いて、GPT-2をドメイン適応的事前学習(DAPT)により微調整し、対話固有の言語パターンにモデルを適合させる。
  • タスク適応的事前学習(TAPT)を実装し、タスク固有の対話データで事前学習することで、タスク指向対話にさらに適合させるが、本研究では効果が認められなかった。
  • マルチウーズ2.1データセット上で、信念状態生成、応答生成、ネガティブサンプル識別を同時に最適化する1つのシーケンス・ツー・シーケンスの目的関数を用いてマルチタスク微調整を実施する。
  • 対話履歴、信念状態、データベースの結果、応答を連結したフラットな入力形式を採用し、単一の自己回帰的シーケンスとして統合的にモデリングする。
  • ヒューリスティックな前処理を導入し、エージェントの発話からデキシファイ・ノーマライズドテンプレートに変換し、後処理で出力を一貫性と読みやすさの観点から精錬する。
  • 障害耐性モジュールを導入し、一貫性のないエンティティ参照や事実の捏造(ホールーシュレーション)などのモデル誤りを検出し是正することで、応答の信頼性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ドメイン適応的事前学習は、タスク指向対話設定において、事前学習済み言語モデルの性能を顕著に向上させるか?
  • RQ2マルチドメイン対話ベンチマークで微調整する際、タスク適応的事前学習はモデル性能をさらに向上させるか?
  • RQ3NLU、DST、NLGの共同目的関数を用いたマルチタスク微調整は、エンドツーエンド対話システムにおいてどの程度効果的か?
  • RQ4ヒューリスティックな前処理/後処理ルールは、出力の一般化能力と人間らしい自然さをどの程度向上させるか?
  • RQ5障害耐性メカニズムは、モデル生成誤りを効果的に是正し、人間評価での成功確率を向上させられるか?

主な発見

  • 提案されたシステムは、人間評価において平均91%の成功率を達成し、DSTC9の共有タスクで1位タイを記録した。
  • ドメイン適応的事前学習(DAPT)のみで、ベースライン比で自動評価の成功率が3%向上し、ドメイン固有の適応による顕著な向上を示した。
  • タスク適応的事前学習(TAPT)は性能向上に寄与せず、むしろわずかに成績を低下させた。これは、DAPTが既に適用されている状況ではTAPTが有益でない可能性を示唆している。
  • DAPTとTAPTの組み合わせは、DAPT単体と同等の性能を示し、本設定ではDAPTが優位かつ最も効果的な適応戦略であることを示した。
  • ヒューリスティックな前処理/後処理と障害耐性モジュールの導入により、応答の質と一貫性が顕著に向上し、高水準の人間評価スコアに貢献した。
  • 自動評価においても、強いベースラインを上回り、成功率とブックレートで2位を記録し、全指標で優れたパフォーマンスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。