Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-Grounded Dialogue Generation with Pre-trained Language Models

Xueliang Zhao, Wei Wu|arXiv (Cornell University)|Oct 17, 2020
Topic Modeling参考文献 58被引用数 5
ひとこと要約

本稿では、最大シーケンス長の制約下で長い重複する知識入力を処理するため、BERTベースの知識選択モジュールと事前学習言語モデル(GPT-2)を統合した知識に基づく対話生成モデル、KnowledGPTを提案する。無人ラベル付き対話データを用いて、知識選択と応答生成を同時に最適化することで、2つのベンチマークで最先端の性能を達成し、自動評価指標および人間評価の両面で先行手法を上回った。

ABSTRACT

We study knowledge-grounded dialogue generation with pre-trained language models. To leverage the redundant external knowledge under capacity constraint, we propose equipping response generation defined by a pre-trained language model with a knowledge selection module, and an unsupervised approach to jointly optimizing knowledge selection and response generation with unlabeled dialogues. Empirical results on two benchmarks indicate that our model can significantly outperform state-of-the-art methods in both automatic evaluation and human judgment.

研究の動機と目的

  • 最大シーケンス長の制約がある事前学習言語モデルに、長い重複する外部知識を統合する課題に対処すること。
  • 高価な人手による知識選択アノテーションに依存するか、事前学習モデルと互換性のない既存の知識に基づく対話モデルの限界を克服すること。
  • 人手によるアノテーションの知識選択データを一切必要とせず、無人ラベル付き対話を用いて、知識選択と応答生成を同時に最適化するエンドツーエンドのフレームワークを開発すること。
  • 生成の前に関連する知識スニペットを選択することで、ノイズを低減し、一貫性と事実の関連性を向上させることで、応答品質を向上させること。

提案手法

  • 対話文脈に基づいて、長い重複する知識入力から関連する知識スパンを抽出するBERTベースの知識選択モジュールを導入する。
  • 知識選択を系列予測タスクとして扱い、事前学習技術の適用と推論時の動的選択を可能にする。
  • 2段階の訓練戦略を採用する:まず、ヒューリスティックルールを用いて偽の正例知識を生成し、次に強化学習とカリキュラム学習を用いて知識選択と応答生成を同時に微調整する。
  • 生成された応答の尤度を最大化するのと、応答モデルからのフィードバックを用いて知識選択を改善するのを交互に最適化する共同最適化目的関数を採用する。
  • T_maxを用いた終了基準を実装し、選択された知識トークン数を制限することで、再現率とノイズのバランスを取る。
  • 応答生成には事前学習済みのGPT-2を活用し、知識選択モジュールを介して知識入力をフィルタリング・圧縮することで、モデルのコンテキスト長に収める。

実験結果

リサーチクエスチョン

  • RQ1人手による知識選択アノテーションデータを必要とせず、無人ラベル付き対話を用いて、知識選択と応答生成を同時に最適化するエンドツーエンドのフレームワークは、性能を発揮できるか?
  • RQ2知識選択と応答生成を同時に最適化することで、分離して訓練するか強力なベースラインと比較して、対話品質はどのように向上するか?
  • RQ3冗長な知識入力からのノイズ低減に、知識選択モジュールが果たす影響は何か?
  • RQ4T_max(選択可能な知識トークンの最大数)の選択が、応答品質と知識再現率のトレードオフにどのように影響するか?
  • RQ5実際のアノテーションが利用できない状況で、ヒューリスティックから得られる偽の正例知識は、効果的な共同学習を可能にするか?

主な発見

  • KnowledGPTは、Wizard of WikipediaおよびCMU_DoGの2つのベンチマークにおいて、自動評価指標および人間評価指標の両面で、最先端の手法を顕著に上回った。
  • Wizard of Wikipediaのテスト・シーングセットでは、KnowledGPTは応答F1スコア28.0を達成し、SKT(26.8)およびDRD(25.4)を上回り、GPT-2 trunc(19.2)より低いパープレキシティ(17.2)を示した。
  • 人間評価では、文脈の一貫性と知識の関連性の両面で、KnowledGPTがベースラインを上回っており、著しいアノテータ間一致度(kappa ≥ 0.6)を示した。
  • アブレーションスタディにより、偽の正例ステージが、文脈と知識が強く相関するWizardにおいて、性能向上に不可欠であることが確認された。
  • T_maxを増加させることで性能は向上するが、最適値を超えるとノイズ増加によりF1スコアが低下し、再現率と品質のトレードオフが顕在化した。
  • 共同最適化とカリキュラム学習は有効である:両方の段階を削除すると性能が低下し、エンドツーエンド学習の価値が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。