Skip to main content
QUICK REVIEW

[논문 리뷰] KGPT: Knowledge-Grounded Pre-Training for Data-to-Text Generation

Wenhu Chen, Yu Su|arXiv (Cornell University)|2020. 10. 05.
Topic Modeling참고 문헌 49인용 수 5
한 줄 요약

KGPT는 (지식 서브그래프, 텍스트) 쌍으로 구성된 대규모 원천 감독 웹 코퍼스를 활용하여 지식 기반 사전 훈련 프레임워크를 제안한다. 이는 모델을 사전 훈련시켜 소수의 예시 및 제로샷 성능을 향상시킨다. 기존의 기준 대비 레이블이 필요한 데이터를 최대 15배 감소시키며, 피드백 없이도 WebNLG에서 30 이상의 ROUGE-L 점수를 기록한다.

ABSTRACT

Data-to-text generation has recently attracted substantial interests due to its wide applications. Existing methods have shown impressive performance on an array of tasks. However, they rely on a significant amount of labeled data for each task, which is costly to acquire and thus limits their application to new tasks and domains. In this paper, we propose to leverage pre-training and transfer learning to address this issue. We propose a knowledge-grounded pre-training (KGPT), which consists of two parts, 1) a general knowledge-grounded generation model to generate knowledge-enriched text. 2) a pre-training paradigm on a massive knowledge-grounded text corpus crawled from the web. The pre-trained model can be fine-tuned on various data-to-text generation tasks to generate task-specific text. We adopt three settings, namely fully-supervised, zero-shot, few-shot to evaluate its effectiveness. Under the fully-supervised setting, our model can achieve remarkable gains over the known baselines. Under zero-shot setting, our model without seeing any examples achieves over 30 ROUGE-L on WebNLG while all other baselines fail. Under the few-shot setting, our model only needs about one-fifteenth as many labeled examples to achieve the same level of performance as baseline models. These experiments consistently prove the strong generalization ability of our proposed framework https://github.com/wenhuchen/KGPT.

연구 동기 및 목표

  • 대규모 레이블이 부여된 데이터셋에 대한 의존도를 줄임으로써 데이터 텍스트 생성의 높은 레이블링 비용 문제를 해결한다.
  • 소량의 레이블 예시로도 새로운 도메인과 작업에 효과적으로 적응할 수 있는 일반적인 목적의 모델을 개발한다.
  • 지식 그래프에 기반한 사전 훈련을 통해 신경망 텍스트 생성의 사실 일관성과 일반화 능력을 향상시킨다.
  • 웹 크롤링된 텍스트와 연결된 지식 트리플을 활용한 원천 감독 사전 훈련의 효과성을 탐색한다.

제안 방법

  • 하이퍼링크가 연결된 위키백과 문장을 크롤링하고 엔티티를 위키데이터에 연결하여 1단계 지식 트리플을 추출함으로써 대규모 지식 기반 코퍼스(KGText)를 구축한다.
  • 의미적 유사도가 높은 일관된 텍스트-지식 매핑만을 유지하기 위한 선택 전략을 설계하여 원천 감독의 노이즈를 감소시킨다.
  • 다양한 최종 작업과 KGText 간의 입력 형식을 통합하여 공동 사전 훈련을 위한 일반화된 입력 구조를 정의한다.
  • 지식 서브그래프와 자연어 텍스트를 동일한 표현 공간에 인코딩하는 새로운 KGPT 아키텍처를 제안한다.
  • 지식 기반 사전 훈련을 위해 마스킹 언어 모델링 목적함수를 사용하여 KGText 코퍼스에서 KGPT를 사전 훈련한다.
  • 완전 지도 학습, 소수의 예시, 제로샷 설정에서의 최종 데이터 텍스트 생성 작업(WebNLG, E2ENLG, WikiBio)에 대해 사전 훈련된 KGPT를 미세 조정한다.

실험 결과

연구 질문

  • RQ1지식 기반 사전 훈련 프레임워크가 데이터 텍스트 생성에서 레이블이 필요한 데이터의 양을 크게 줄일 수 있는가?
  • RQ2제로샷 설정에서 KGPT는 새로운 도메인과 지식 입력에 대해 얼마나 잘 일반화되는가?
  • RQ3웹에서 크롤링한 데이터를 원천 감독으로 사용해 사전 훈련하면 사실 일관성과 생성 품질이 얼마나 향상되는가?
  • RQ4사전 훈련을 통해 목표 성능 수준에 도달하기 위해 필요한 샘플 복잡도는 얼마나 감소하는가?

주요 결과

  • 제로샷 설정에서 KGPT는 WebNLG에서 30 이상의 ROUGE-L 점수를 기록했으며, 모든 사전 훈련되지 않은 기준 모델은 점수 0으로 완전히 실패했다.
  • 소수의 예시 설정에서 KGPT는 훈련 데이터의 0.1%만으로도 BLEU 점수 40 이상을 기록했으며, 기준 모델들은 난잡한 텍스트를 생성했다.
  • WebNLG, E2ENLG, WikiBio 전반에서 KGPT는 목표 BLEU-4 점수 30을 달성하기 위해 필요한 레이블 예시 수를 약 15배 감소시켰다.
  • 인간 평가 결과, 사전 훈련된 KGPT는 사전 훈련되지 않은 모델보다 사실 일관성이 뛰어나며 환각 현상을 크게 줄였다.
  • 완전 지도 학습 설정에서 KGPT는 Template-GPT-2와 Switch-GPT-2를 포함한 경쟁 기준 모델들을 모두 초월하여 세 가지 벤치마크 데이터셋에서 모두 뛰어난 성능을 보였다.
  • 50개의 훈련 예시로도 미세 조정했을 때 모델이 강력한 소수의 예시 일반화 능력을 유지함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.