Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Injection into Dialogue Generation via Language Models

Yi-Lin Tuan, Wei Wei|arXiv (Cornell University)|Apr 30, 2020
Topic Modeling参考文献 48被引用数 7
ひとこと要約

本稿では、外部知識が限られた状況下でも一貫性があり情報豊かな応答を生成できるようにする二段階の知識注入フレームワーク、InjKを提案する。本手法は、関連知識の推論と応答生成を同時に学習することで、知識が不足する状況下でも、潜在的知識変数を用いて確率的因果関係をモデル化し、応答の perplexity を顕著に低減させ、一貫性と情報性を向上させる。

ABSTRACT

Dialogue generation has been successfully learned from scratch by neural networks, but tends to produce the same general response, e.g., "what are you talking about?", in many conversations. To reduce this homogeneity, external knowledge such as the speaker's profile and domain knowledge is applied as an additional condition to diversify a model's output. The required knowledge to develop an effective conversation, however, is not always available, which is different from prior work's assumption that a model always has acquired sufficient knowledge before chatting. This problem can be detrimental when applying a dialogue model like this chatting online with unconstrained people and topics, because the model does not have the needed knowledge. To address this problem, we propose InjK, which is a two-stage approach to inject knowledge into a dialogue generation model. First, we train a large-scale language model and query it as textual knowledge. Second, we frame a dialogue generation model to sequentially generate textual knowledge and a corresponding response. Empirically, when a dialogue generation model can only access limited knowledge, our method outperforms prior work by producing more coherent and informative responses.

研究の動機と目的

  • 推論時において外部知識が利用可能な状況が限られる実世界の対話システムにおける知識不足という重要な問題に対処すること。
  • 訓練データに事前にアノテートされた知識に依存しない統合的アプローチを提案し、知識が希少な状況下でも効果的な応答生成を可能にすること。
  • 観測されない知識と対話応答の間の確率的因果関係をモデル化し、知識不足に対する耐性を高めること。
  • 推論時における知識不足の影響を評価し、現在のモデルが低知識条件下で失敗することを示すこと。

提案手法

  • InjKは二段階のプロセスを採用する。まず、大規模言語モデルを用いて対話文脈から候補知識を生成し、次に、対話履歴と推定された知識に条件づけて応答生成を行う。
  • 本手法は、観測されない知識を表す潜在変数を導入し、ポリシー勾配とカルバック・ライブラー発散(KLD)正則化を用いた変分オートエンコーダーでモデル化する。
  • 意味的コンテンツをドメイン固有の知識空間にマッピングすることで、入力発話から知識を分離し、欠落しているまたは暗黙の知識についての推論を可能にする。
  • 強化学習の目的関数を用いて、知識生成と応答生成を同時に最適化し、情報性が高く文脈に適した知識を生成するよう促進する。
  • 知識の可用性に対するモデル感受性を測定するため、さまざまな知識長における perplexity の標準偏差として定義される知識ギャップ指標を用いる。
  • 本手法は Personachat および LIGHT データセットを用いて評価され、知識の可用性レベルが異なる状況下での性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1推論時における知識不足は、既存の知識に基づく対話モデルの性能にどのように影響を与えるか?
  • RQ2訓練時に事前にアノテートされた知識に依存せず、外部知識が限られている、あるいは存在しない状況下でも、高品質な応答を生成できるか?
  • RQ3潜在的知識を確率的変数としてモデル化することで、応答の一貫性と情報性にどのような影響を与えるか?
  • RQ4本手法は、知識不足に対する耐性という観点から、最先端のベースラインと比較してどのように差をつけるか?
  • RQ5モデルの性能が外部知識の可用性にどれほど依存しているか、そしてその依存度をどのように低減できるか?

主な発見

  • 知識が限られた状況下で、MLE や CVAE ベースラインと比較して InjK は、より低い perplexity とより高い人間評価スコアを示し、応答の一貫性と情報性が顕著に向上する。
  • 知識長の変動にかかわらず安定した性能を維持し、特に KGuide や KGround と比較して、知識ギャップ(perplexity の標準偏差)が小さいことが示された。
  • アブレーションスタディの結果、ポリシー勾配項または KLD 項を削除すると性能が低下し、両者が知識と応答の同時生成において重要であることが確認された。
  • InjK は訓練段階および推論段階の両方で最小の知識ギャップを達成しており、知識不足に対する耐性が強いことが示された。
  • 人間評価では中程度のアノテーター間一致度(Fleiss’ kappa)が得られ、低知識条件下でも InjK がベースラインと比較して一貫性があり文脈に適した応答を生成することが確認された。
  • 結果から、訓練時および推論時における知識不足の考慮が、より認知的に妥当でユーザーフレンドリーな対話システムの構築に寄与することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。