Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge-Grounded Dialogue Generation with Pre-trained Language Models

Xueliang Zhao, Wei Wu|arXiv (Cornell University)|2020. 10. 17.
Topic Modeling참고 문헌 58인용 수 5
한 줄 요약

이 논문은 최대 시퀀스 길이 제약 조건 하에서 긴, 중복된 지식 입력을 처리하기 위해 BERT 기반 지식 선택 모듈과 사전 훈련된 언어 모델(GPT-2)을 통합한 지식 기반 대화 생성 모델인 KnowledGPT를 제안한다. 비정답 대화 데이터를 사용한 비지도 학습 방식으로 지식 선택과 응답 생성을 동시에 최적화함으로써, 두 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 자동 평가 지표와 인간 평가 모두에서 이전 방법들을 능가한다.

ABSTRACT

We study knowledge-grounded dialogue generation with pre-trained language models. To leverage the redundant external knowledge under capacity constraint, we propose equipping response generation defined by a pre-trained language model with a knowledge selection module, and an unsupervised approach to jointly optimizing knowledge selection and response generation with unlabeled dialogues. Empirical results on two benchmarks indicate that our model can significantly outperform state-of-the-art methods in both automatic evaluation and human judgment.

연구 동기 및 목표

  • 사전 훈련된 언어 모델의 최대 시퀀스 길이 제약 조건 하에서 긴, 중복된 외부 지식을 통합하는 데 도전하는 것.
  • 비용이 많이 드는 인간 레이블이 필요한 지식 선택에 의존하거나 사전 훈련된 모델과 호환되지 않는 기존 지식 기반 대화 모델의 한계를 극복하는 것.
  • 사용자 레이블이 없는 대화 데이터만을 사용하여 지식 선택과 응답 생성을 동시에 최적화하는 비지도, 종단 간 프레임워크를 개발하는 것.
  • 생성 전에 관련 지식 스니펫을 선택하여 노이즈를 줄이고 일관성과 사실적 관련성을 향상시킴으로써 응답 품질을 향상시키는 것.

제안 방법

  • 대화 맥락을 기반으로 긴, 중복된 지식 입력에서 관련 지식 스퍼널을 선택하는 데 BERT 기반의 지식 선택 모듈을 도입한다.
  • 지식 선택을 시퀀스 예측 작업으로 간주하여 사전 훈련 기법의 활용과 추론 시 동적 선택을 가능하게 한다.
  • 이중 단계 훈련 전략을 적용한다: 첫 번째 단계에서는 히ュ리스틱 규칙을 통해 가짜 정답 지식을 생성하고, 두 번째 단계에서는 강화 학습과 커리큘럼 학습을 사용하여 지식 선택과 응답 생성을 동시에 미세 조정한다.
  • 생성된 응답의 최대 우도를 극대화하고, 응답 모델의 피드백을 통해 지식 선택을 향상시키는 공동 최적화 목표를 구현한다.
  • T_max를 사용한 종료 기준을 도입하여 선택된 지식 토큰 수를 제한함으로써 재현율과 노이즈 사이의 균형을 맞춘다.
  • 모델의 맥락 길이에 맞게 지식 입력을 압축하고 압축된 지식을 필터링하기 위해 사전 훈련된 GPT-2를 응답 생성에 활용한다.

실험 결과

연구 질문

  • RQ1사용자 레이블이 없는 지식 선택 데이터가 필요 없이 비지도, 종단 간 프레임워크가 지식 선택과 응답 생성을 동시에 최적화할 수 있는가?
  • RQ2지식 선택과 응답 생성을 동시에 최적화하는 것이 별도 훈련 또는 강력한 베이스라인 대비 대화 품질을 어떻게 향상시키는가?
  • RQ3긴 형식의 대화에서 중복된 지식 입력으로 인한 노이즈를 줄이기 위해 지식 선택 모듈이 어떤 영향을 미치는가?
  • RQ4선택된 지식 토큰의 최대 수(T_max)를 선택할 경우, 응답 품질과 지식 재현율 사이의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5실제 애너테이션 자료가 없을 경우, 히ュ리스틱으로 유도한 가짜 정답 지식이 공동 훈련에 효과적으로 기여할 수 있는가?

주요 결과

  • KnowledGPT는 Wizard of Wikipedia와 CMU_DoG 두 벤치마크에서 자동 평가 지표와 인간 평가 지표 모두에서 최신 기술 수준(SOTA) 방법들을 크게 능가한다.
  • Wizard of Wikipedia 테스트 시도 세트에서 KnowledGPT는 응답 F1 스코어 28.0을 기록하여 SKT(26.8)와 DRD(25.4)를 앞서며, GPT-2 트렁케이션(19.2)보다 낮은 퍼플렉서티(17.2)를 확보했다.
  • 인간 평가 결과, KnowledGPT는 맥락 일관성과 지식 관련성에서 베이스라인 대비 뛰어난 성능을 보였으며, 평가자 간 일치도가 높게 유지되었다(kappa ≥ 0.6).
  • 아블레이션 연구 결과, 가짜 정답 단계가 맥락과 지식이 강하게 관련된 Wizard에서 성능 향상에 필수적임을 확인했다.
  • T_max를 증가시킬수록 성능은 일정 수준까지 향상되지만, 최적값을 초과하면 노이즈 증가로 인해 F1 스코어가 감소함을 확인하여 재현율과 품질 사이의 트레이드오프를 입증했다.
  • 공동 최적화와 커리큘럼 학습은 효과적임을 확인: 두 단계 중 하나를 제거할 경우 성능 저하가 발생하여 종단 간 훈련의 가치를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.