Skip to main content
QUICK REVIEW

[논문 리뷰] MEGATRON-CNTRL: Controllable Story Generation with External Knowledge Using Large-Scale Language Models

Peng Xu, Mostofa Patwary|arXiv (Cornell University)|2020. 10. 02.
Topic Modeling참고 문헌 34인용 수 12
한 줄 요약

이 논문은 외부 지식을 키워드 기반 검색과 맥락 기반 순위 매기기를 통해 통합함으로써 유창성, 일관성 및 제어성을 향상시키는 제어 가능한 스토리 생성 프레임워크인 Megatron-Cntrl을 제안한다. 124M에서 8.3B 파라미터로 확장함으로써 인간 평가에서 93.0%의 일관성과 91.5%의 제어성을 달성하여 ROC 스토리 데이터셋에서 이전 작업을 능가한다.

ABSTRACT

Existing pre-trained large language models have shown unparalleled generative capabilities. However, they are not controllable. In this paper, we propose MEGATRON-CNTRL, a novel framework that uses large-scale language models and adds control to text generation by incorporating an external knowledge base. Our framework consists of a keyword predictor, a knowledge retriever, a contextual knowledge ranker, and a conditional text generator. As we do not have access to ground-truth supervision for the knowledge ranker, we make use of weak supervision from sentence embedding. The empirical results show that our model generates more fluent, consistent, and coherent stories with less repetition and higher diversity compared to prior work on the ROC story dataset. We showcase the controllability of our model by replacing the keywords used to generate stories and re-running the generation process. Human evaluation results show that 77.5% of these stories are successfully controlled by the new keywords. Furthermore, by scaling our model from 124 million to 8.3 billion parameters we demonstrate that larger models improve both the quality of generation (from 74.5% to 93.0% for consistency) and controllability (from 77.5% to 91.5%).

연구 동기 및 목표

  • 스토리 생성을 위한 대규모 미사전학습 언어 모델에서의 제어성 부족과 지식 통합 부족 문제를 해결한다.
  • 맥락에서 유도된 해석 가능한 키워드를 사용하여 스토리 생성에 대해 동적이고 세밀한 제어를 가능하게 한다.
  • 다단계 프레임워크를 통해 관련 외부 지식을 통합하여 스토리 품질을 향상시킨다.
  • 모델 확장을 통해 생성 품질과 제어성 향상이 가능함을 입증한다.

제안 방법

  • 현재 맥락을 바탕으로 다음 스토리 문장에 적합한 해석 가능한 키워드를 생성하기 위해 키워드 예측기 사용.
  • 예측된 키워드를 사용해 외부 지식 기반에서 지식 삼중항을 검색.
  • 스토리 맥락에 대한 관련성에 따라 검색된 지식을 필터링하고 재순위 매기기 위해 맥락 기반 지식 순위 매기기 적용.
  • 지식 순위 매기기를 지도 학습 없이 문장 임베딩에서 유도된 약한 지도 신호를 사용해 훈련.
  • 스토리의 맥락과 상위 순위 지식 문장을 기반으로 텍스트 생성기를 조건화하여 일관성 있고 지식 기반의 스토리 이어짐 생성.
  • 모델을 124M에서 8.3B 파라미터로 확장하여 모델 크기의 영향을 품질과 제어성에 대해 연구.

실험 결과

연구 질문

  • RQ1외부 지식가 대규모 언어 모델에 효과적이고 동적으로 통합되어 스토리 생성 품질을 향상시킬 수 있는가?
  • RQ2키워드 기반 제어가 일관성과 유창성을 유지하면서 스토리 생성을 얼마나 잘 이끌 수 있는가?
  • RQ3모델 확장은 생성된 스토리의 품질과 제어성에 어떤 영향을 미치는가?
  • RQ4지표 레이블 없이 문장 임베딩에서 유도된 약한 지도 신호로 맥락 기반 지식 순위 매기기를 효과적으로 훈련시킬 수 있는가?

주요 결과

  • 124M 파라미터에서 Megatron-Cntrl는 74.5%의 일관성으로 스토리를 생성하며, 8.3B 파라미터로 확장 시 93.0%로 향상된다.
  • 인간 평가 결과, 키워드를 그 반대어로 교체했을 때 91.5%의 스토리가 성공적으로 제어됨을 확인했다.
  • ROC 스토리 데이터셋에서 기존 최고 수준의 방법에 비해 반복을 줄이고 다양성을 높였다.
  • 모델 확장에 따라 제어성과 스토리 품질이 둘 다 크게 향상되어 크기와 성능 간 강한 상관관계를 보였다.
  • 문장 임베딩에서 유도된 약한 지도 신호로 훈련된 맥락 기반 지식 순위 매기기는 노이즈가 많은 지식을 효과적으로 걸러내고 관련성을 향상시켰다.
  • 가장 해석 가능한 키워드를 통해 스토리 생성에 대해 동적이고 세밀한 제어를 가능하게 하였으며, 124M 파라미터에서 77.5%의 경우, 8.3B 파라미터에서 91.5%의 경우 반대어 기반 제어가 성공적으로 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.