Skip to main content
QUICK REVIEW

[논문 리뷰] Creative GANs for generating poems, lyrics, and metaphors

Asir Saeed, Suzana Ilić|arXiv (Cornell University)|2019. 09. 20.
Topic Modeling참고 문헌 25인용 수 11
한 줄 요약

이 논문은 최대우도추정(MLE) 대신 판별기(discriminator)를 사용한 적대적 훈련을 통해 창의적 텍스트 생성(예: 시, 가사,隐喩)의 원형성과 다양성을 향상시키는 Creative-GAN이라는 생성적 적대망(GAN) 프레임워크를 제안한다. 이 모델은 세 가지의 창의적 텍스트 데이터셋에서 퍼즐러피티와 정성적 다양성 측면에서 MLE 기반 베이스라인 및 GumbelGAN을 능가한다.

ABSTRACT

Generative models for text have substantially contributed to tasks like machine translation and language modeling, using maximum likelihood optimization (MLE). However, for creative text generation, where multiple outputs are possible and originality and uniqueness are encouraged, MLE falls short. Methods optimized for MLE lead to outputs that can be generic, repetitive and incoherent. In this work, we use a Generative Adversarial Network framework to alleviate this problem. We evaluate our framework on poetry, lyrics and metaphor datasets, each with widely different characteristics, and report better performance of our objective function over other generative models.

연구 동기 및 목표

  • 최대우도추정(MLE)이 창의적 텍스트 생성에서 일반적이고 반복적이며 타당하지 않은 출력을 유도하는 한계를 해결하기 위함.
  • 시, 가사, 은유와 같은 과제에서 다수의 타당한 출력이 허용되는 분야에서 생성된 텍스트의 다양성과 원형성을 향상시키기 위함.
  • 엄격한 참조 일치가 없는 상황에서 판별기를 사용한 적대적 훈련이 생성 모델이 더 높은 품질의 창의적 출력으로 향하도록 효과적으로 이끌 수 있는지 평가하기 위함.
  • 자동 평가 지표와 정성적 성능 측면에서 제안된 Creative-GAN 프레임워크를 MLE 기반 언어 모델 및 GumbelGAN과 비교하기 위함.

제안 방법

  • 생성기는 구텐베르크 데이터셋에서 미리 훈련된 AWD-LSTM 또는 TransformerXL 언어 모델을 MLE를 사용해 타겟 창의적 텍스트 데이터셋에 맞게 보정한 것이다.
  • 판별기는 생성기와 동일한 인코더 아키텍처를 가지며, 최대 풀링 및 평균 풀링된 은닉 상태를 조합하여 [0,1] 범위의 점수를 산출하는 풀드 디코더 헤드를 추가한 이진 분류기이다.
  • 적대적 훈련은 판별기 업데이트 3단계와 생성기 업데이트 1단계를 번갈아 수행하며, 생성기의 이산 출력이 미분 가능하지 않기 때문에 정책 기반 강화학습을 사용해 역전파를 수행한다.
  • 생성기는 판별기의 피드백을 보상 신호로 사용하여 더 창의적이고 반복적이지 않은 시퀀스 생성을 유도한다.
  • 출력 품질과 다양성을 향상시키기 위해 argmax 대신 전체 다항분포를 기반으로 샘플링한다.
  • 초기화 및 모델 설정은 검증 세트에서 튜닝되었으며, 훈련 및 추론 코드는 공개되어 있다.

실험 결과

연구 질문

  • RQ1MLE 기반 모델과 비교해 판별기를 사용한 적대적 훈련이 창의적 텍스트 생성의 원형성과 다양성 향상에 기여하는가?
  • RQ2시, 은유, 가사와 같은 언어적 특성이 뚜렷한 다양한 창의적 텍스트 영역에서 Creative-GAN의 성능은 어떠한가?
  • RQ3판별기 기반 보상 신호 사용이 자동 평가 지표와 정성적 출력 측면에서 GumbelGAN 또는 표준 MLE 기반 베이스라인보다 우수한 성능을 내는가?
  • RQ4지침 없는 참조 없이도 판별기가 생성기의 비반복적이고 논리적이며 스타일에 부합하는 창의적 텍스트 생성을 얼마나 효과적으로 이끌 수 있는가?

주요 결과

  • 모든 세 데이터셋(시, 은유, 가사)에서 Creative-GAN은 MLE 기반 베이스라인 및 GumbelGAN보다 테스트 세트에서 더 낮은 퍼즐러피티를 기록했다.
  • 판별기의 피드백은 생성기가 더 다양한 출력을 생성하도록 유도하여 MLE로 훈련된 모델에서 흔히 발생하는 단조로움을 줄였다.
  • 인간 평가 결과는 정성적 출력 향상을 시사하지만, 주요 텍스트에는 구체적인 인간 평가 점수는 기재되어 있지 않다.
  • 언어적 복잡성과 구조가 다른 데이터셋 간에서 일관된 향상이 나타나, 도메인 차이에 대해 강건함을 보였다.
  • 정책 기반 강화학습과 Gumbel-Softmax 재구성 기법을 사용함으로써 이산 텍스트 토큰을 통해 효과적인 역전파가 가능해져 생성기의 엔드 투 엔드 훈련이 가능해졌다.
  • 외부 피드백인 판별기의 피드백이 원형성 없는 디코딩 과제인 창의적 텍스트 생성의 최적화에 효과적임을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.