Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Story Generation with Multi-task Objectives in Variational Autoencoders

Zhuohan Xie, Trevor Cohn|arXiv (Cornell University)|2021. 11. 15.
Topic Modeling참고 문헌 28인용 수 4
한 줄 요약

이 논문은 스토리 생성을 향상시키기 위해 BERT와 GPT-2를 결합한 도메인 특화 변동형 오토인코더(VAE)를 제안한다. 이 모델은 스토리 주제 예측과 논의 관계 식별이라는 두 가지 보조 목표를 도입하여 더 정보적인 잠재 변수를 학습한다. 개선된 VAE는 여러 데이터셋에서 GPT-2와 일반 VAE보다 더 우수한 품질-다양성 트레이드오프를 달성한다.

ABSTRACT

GPT-2 has been frequently adapted in story generation models as it provides powerful generative capability. However, it still fails to generate consistent stories and lacks diversity. Current story generation models leverage additional information such as plots or commonsense into GPT-2 to guide the generation process. These approaches focus on improving generation quality of stories while our work look at both quality and diversity. We explore combining BERT and GPT-2 to build a variational autoencoder (VAE), and extend it by adding additional objectives to learn global features such as story topic and discourse relations. Our evaluations show our enhanced VAE can provide better quality and diversity trade off, generate less repetitive story content and learn a more informative latent variable.

연구 동기 및 목표

  • 스토리 생성에서 GPT-2의 한계, 특히 낮은 다양성과 스토리 라인의 일관성 부족 문제를 해결하기 위해.
  • 전반적인 스토리 특징을 통합함으로써 VAE의 잠재 변수의 정보성 향상을 위해.
  • 스토리 주제와 논의 품질을 포착하도록 VAE를 이끄는 다중 작업 학습 목표를 탐색하기 위해.
  • GPT-2와 일반 VAE보다 스토리 생성 과업에서 품질-다양성 트레이드오프 성능이 뛰어난 도메인 특화 VAE를 개발하기 위해.

제안 방법

  • 도메인 특화 스토리 데이터로 미리 훈련된 BERT를 인코더로, GPT-2를 디코더로 사용하여 VAE를 구축한다.
  • 잠재 변수가 스토리 주제 분류와 원본 대비 손상된 스토리 식별을 함께 최적화하는 다중 작업 학습 프레임워크를 도입한다.
  • 일반적인 생성 오류를 시뮬레이션하기 위해 음성 샘플링 전략을 사용하여 모델이 논의 수준의 일관성을 학습할 수 있도록 한다.
  • 다양한 초모수 설정에서 생성 품질과 다양성을 평가하기 위해 top-p 샘플링을 다양한 p값으로 적용한다.
  • 재구성 손실, KL 발산 및 두 가지 보조 목표를 조합하여 잠재 공간을 정규화하기 위해 VAE를 훈련한다.
  • 스토리 데이터셋에서 VAE를 피지컬러닝하고, 음성 코퍼스 BLEU, 자기 BLEU, 논의 품질에 대한 ROC AUC와 같은 지표를 사용해 평가한다.

실험 결과

연구 질문

  • RQ1표준 GPT-2보다 BERT와 GPT-2로 구성된 VAE가 스토리 생성을 위한 더 정보적인 잠재 표현을 학습할 수 있는가?
  • RQ2주제 모델링과 논의 품질에 대한 보조 목표를 추가하면 스토리 생성의 품질-다양성 트레이드오프가 향상되는가?
  • RQ3잠재 공간이 국소 패턴이 아닌 전반적인 스토리 특징인 주제와 일관성과 같은 특징을 효과적으로 포착할 수 있는가?
  • RQ4제안된 다중 작업 VAE는 다양한 데이터셋에서 GPT-2와 일반 VAE에 비해 생성 품질과 다양성 측면에서 어떻게 비교되는가?

주요 결과

  • 모든 테스트 데이터셋에서 Figure 3의 트레이드오프 곡선을 통해 볼 수 있듯이, 개선된 VAE(VAE + t, VAE + d, VAE + td)는 GPT-2와 일반 VAE보다 더 우수한 품질-다양성 트레이드오프를 달성한다.
  • 주제 모델링(VAE + t)과 논의 식별(VAE + d)을 통한 VAE는 모두 일반 VAE를 뛰어넘었으며, 병합된 목표(VAE + td)가 대부분의 데이터셋에서 가장 뛰어난 성능을 보였다.
  • 논의 식별에 대해 AUC가 0.75, 주제 예측에 대해 0.25를 기록하여 전반적인 스토리 특징을 효과적으로 학습한 것으로 나타났다.
  • 낮은 p값(예: p=0.4)에서 4-그램 반복에 대한 자기 BLEU 점수가 강화된 VAE에서 유의미하게 낮아져 반복 감소와 높은 다양성의 증거가 되었다.
  • 높은 p값(예: p=1.0)에서는 GPT-2를 포함한 모든 모델이 인간이 작성한 스토리의 자기 BLEU 점수(0.021)에 가까워졌지만, 강화된 VAE는 낮은 p값에서도 더 뛰어난 품질을 유지했다.
  • AE 기반 모델은 낮은 반복성에도 불구하고 비일관된 스토리를 생성했으며, 이는 낮은 자기 BLEU가 높은 품질을 의미하지는 않음을 확인했고, 제안된 VAE가 품질과 다양성의 균형을 효과적으로 확보하고 있음을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.