Skip to main content
QUICK REVIEW

[논문 리뷰] Are Pre-trained Language Models Knowledgeable to Ground Open Domain Dialogues?

Yufan Zhao, Wei Wu|arXiv (Cornell University)|2020. 11. 19.
Topic Modeling참고 문헌 21인용 수 9
한 줄 요약

이 논문은 외부 지식 소스 없이도 사전 훈련된 언어 모델(PLM)이 개방형 대화 생성을 위한 내부 지식 기반으로 기능할 수 있는지 조사한다. DialoGPT와 GPT-2와 같은 PLM을 몇몇 지식이 풍부한 대화 데이터로 미세조정함으로써, 외부 지식을 필요로 하는 최첨단 모델들과 경쟁할 수 있는 응답을 생성하는 것을 확인하였다. 이는 PLM이 지능적이고 일관되며 특정한 대화 생성을 위해 충분한 지식을 내재하고 있음을 보여준다.

ABSTRACT

We study knowledge-grounded dialogue generation with pre-trained language models. Instead of pursuing new state-of-the-art on benchmarks, we try to understand if the knowledge stored in parameters of the pre-trained models is already enough to ground open domain dialogues, and thus allows us to get rid of the dependency on external knowledge sources in generation. Through extensive experiments on benchmarks, we find that by fine-tuning with a few dialogues containing knowledge, the pre-trained language models can outperform the state-of-the-art model that requires external knowledge in automatic evaluation and human judgment, suggesting a positive answer to the question we raised.

연구 동기 및 목표

  • 사전 훈련된 언어 모델(PLM)이 외부 지식 소스에 의존하지 않고도 개방형 대화를 지식 기반으로 만들 수 있는 충분한 지식을 내재하고 있는지 조사하는 것.
  • 소수의 지식이 풍부한 대화 데이터로 PLM를 미세조정함으로써, 외부 지식을 사용하는 모델들과 동일한 정보성과 관련성의 응답을 생성할 수 있는지 평가하는 것.
  • DialoGPT, GPT-2와 같은 PLM의 성능을 외부 지식에 의존하는 최첨단 모델과 비교하여 자동 평가 지표와 인간 평가를 통해 평가하는 것.
  • 특히 숫자, 시간, 위치와 같은 세부 정보에서 사실 기반 지식을 유지하고 정확히 적용하는 데 있어 PLM의 한계를 이해하는 것.

제안 방법

  • Wizard of Wikipedia, CMU DoG, Topical-Chat 세 가지 벤치마크의 훈련 데이터에서 지식이 포함된 대화 데이터만을 사용하여 대규모 사전 훈련된 언어 모델(DialoGPT 및 GPT-2)을 미세조정한다.
  • 훈련 및 추론 과정에서 외부 지식 소스를 제거하고, 모델 파rameter에 내장된 지식에만 의존한다.
  • 기준 모델과의 응답 품질 비교를 위해 BLEU, ROUGE, F1, Perplexity(PPL)와 같은 자동 평가 지표를 사용한다.
  • 500개의 샘플 테스트 컨텍스트에 대해 인간 평가를 실시하여 유창성, 일관성, 지식 존재 여부, 관련성, 정확성 등을 네 명의 평가자로부터 이진 레이블로 평가한다.
  • 평가자 간 일致도를 측정하기 위해 Fleiss의 카파 값을 사용하여 인간 평가의 신뢰성을 확보한다.
  • 외부 지식을 사용하는 강력한 기준 모델(DRD)과 비교하기 위해 대화 데이터로 미세조정한 모델(DialoGPT finetune, GPT-2 finetune)의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 언어 모델은 외부 지식 소스에 접근할 수 없을 때에도 개방형 대화에서 지식 기반의 응답을 생성할 수 있는가?
  • RQ2소수의 지식이 풍부한 대화 데이터로 미세조정할 경우, PLM의 관련성 있고 사실적인 응답 생성 능력이 어느 정도 향상되는가?
  • RQ3자동 평가와 인간 평가를 통해 외부 지식에 의존하는 최첨단 모델과 비교했을 때, PLM의 성능과 사실 정확도는 어떻게 되는가?
  • RQ4특히 숫자, 시간, 위치와 같은 사실적 세부 정보에서 PLM의 지식 기반 대화에서의 주요 실패 유형은 무엇인가?

주요 결과

  • 몇몇 지식이 풍부한 대화 데이터로 미세조정한 후, DialoGPT finetune는 CMU DoG 벤치마크에서 F1 지표를 비롯한 자동 평가 지표에서 최첨단 모델 DRD를 능가한다.
  • 인간 평가 결과, 미세조정된 PLM는 높은 유창성과 일관성을 보이며 관련 지식을 효과적으로 전달하지만, 특정 세부 정보에서 사실 오류를 범할 수 있다.
  • 인간 평가 결과, 평가자 간 상당한 일致도가 확인되었으며(Fleiss의 카파 값 전부 > 0.6), 평가 과정의 신뢰성이 검증되었다.
  • 개선된 성능에도 불구하고, 미세조정된 PLM는 종종 지식 조각을 어색하게 조합하거나 일반적인 응답을 생성하는 경우가 있어, 체계적인 지식 통합의 과제를 드러낸다.
  • 결과적으로, 사전 훈련된 언어 모델는 개방형 대화를 지식 기반으로 만들기에 충분한 지식을 내재하고 있으며, 특히 주제별 대화 데이터로 미세조정할 경우 외부 지식 소스에 대한 의존도를 줄일 수 있다.
  • GPT-2 finetune는 DialoGPT finetune보다 성능이 열 劣하나, 이는 미세조정 데이터의 크기가 작고, 모델가 대화 전용 사전 훈련을 하지 않았기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.