Skip to main content
QUICK REVIEW

[論文レビュー] KGPT: Knowledge-Grounded Pre-Training for Data-to-Text Generation

Wenhu Chen, Yu Su|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 49被引用数 5
ひとこと要約

KGPTは、大規模なウェブコーパス(知識サブグラフ, テキスト)ペアを用いて事前学習を行う知識に基づくフレームワークを提案する。このフレームワークにより、少量の例やゼロショットでの性能が強く向上し、ラベル付きデータの必要量をベースラインと比較して最大15倍まで削減できる。WebNLGでは微調整例を一切使用せずに30以上のROUGE-Lを達成する。

ABSTRACT

Data-to-text generation has recently attracted substantial interests due to its wide applications. Existing methods have shown impressive performance on an array of tasks. However, they rely on a significant amount of labeled data for each task, which is costly to acquire and thus limits their application to new tasks and domains. In this paper, we propose to leverage pre-training and transfer learning to address this issue. We propose a knowledge-grounded pre-training (KGPT), which consists of two parts, 1) a general knowledge-grounded generation model to generate knowledge-enriched text. 2) a pre-training paradigm on a massive knowledge-grounded text corpus crawled from the web. The pre-trained model can be fine-tuned on various data-to-text generation tasks to generate task-specific text. We adopt three settings, namely fully-supervised, zero-shot, few-shot to evaluate its effectiveness. Under the fully-supervised setting, our model can achieve remarkable gains over the known baselines. Under zero-shot setting, our model without seeing any examples achieves over 30 ROUGE-L on WebNLG while all other baselines fail. Under the few-shot setting, our model only needs about one-fifteenth as many labeled examples to achieve the same level of performance as baseline models. These experiments consistently prove the strong generalization ability of our proposed framework https://github.com/wenhuchen/KGPT.

研究の動機と目的

  • 大量のラベル付きデータセットに依存するデータ対テキスト生成の高コスト問題を軽減すること。
  • 最小限のラベル付き例で新しいドメインやタスクに効果的に適応できる汎用モデルを開発すること。
  • 知識グラフに基づく事前学習により、神経的テキスト生成における事実の整合性と一般化性能を向上させること。
  • ウェブクロールドのテキストとリンクされた知識トリプルを用いた遠隔監視による事前学習の有効性を調査すること。

提案手法

  • Wikipediaのハイパーリンク付き文をクロールし、エンティティをWikiDataにリンクすることで、1ホップの知識トリプルを抽出し、大規模な知識に基づくコーパス(KGText)を構築する。
  • 意味的重なりが高く、妥当なテキスト-知識の整合性を持つものを選択する戦略を設計し、遠隔監視におけるノイズを低減する。
  • 下流タスクとKGTextの入力形式を統一し、共同事前学習に適した一般化された入力構造を構築する。
  • 知識サブグラフと自然言語テキストの両方を共有表現空間に符号化する新しいKGPTアーキテクチャを提案する。
  • 知識の根拠に基づいたマスク言語モデルの目的関数を用いて、KGTextコーパス上でKGPTを事前学習する。
  • 完全教師あり、少サンプル、ゼロショットの設定下で、下流のデータ対テキストタスク(WebNLG、E2ENLG、WikiBio)に対して事前学習済みのKGPTを微調整する。

実験結果

リサーチクエスチョン

  • RQ1知識に基づく事前学習フレームワークは、データ対テキスト生成におけるラベル付きデータの必要量を顕著に削減できるか?
  • RQ2ゼロショット設定において、KGPTは未学習のドメインや知識入力に対してどれほど一般化できるか?
  • RQ3ウェブクロールドのデータを用いた遠隔監視による事前学習は、事実の整合性と生成品質をどの程度向上させるか?
  • RQ4事前学習により、目標とする性能水準に到達するためのサンプル複雑性はどの程度低減できるか?

主な発見

  • ゼロショット設定下で、KGPTはWebNLGで30以上のROUGE-Lを達成するが、非事前学習ベースラインはすべて0のスコアで完全に失敗する。
  • 少サンプル設定下で、KGPTは訓練データの0.1%のみでBLEUスコア40以上を達成するが、ベースラインモデルはごみのような出力を生成する。
  • WebNLG、E2ENLG、WikiBioの全3データセットにおいて、KGPTは目標BLEU-4スコア30に到達するためのラベル付き例の必要数を約15倍まで削減する。
  • 人的評価では、事前学習済みのKGPTが非事前学習モデルと比較して、はるかに事実に整合性のある出力を生成し、幻覚を著しく低減していることが示された。
  • 完全教師あり設定下で、KGPTはTemplate-GPT-2やSwitch-GPT-2を含む強力なベースラインを、全3つのベンチマークデータセットで上回った。
  • わずか50件の訓練例での微調整でも、KGPTは強い少サンプル一般化性能を維持しており、その堅牢性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。