Skip to main content
QUICK REVIEW

[논문 리뷰] Long Text Generation by Modeling Sentence-Level and Discourse-Level Coherence

Jian Guan, Xiaoxi Mao|arXiv (Cornell University)|2021. 05. 19.
Topic Modeling참고 문헌 32인용 수 4
한 줄 요약

이 논문은 디코딩 중 문장 수준 및 논의 수준의 표현을 학습함으로써 일관성을 향상시키는 장문 텍스트 생성 모델 Hint를 제안한다. 상호 문장 유사도 예측 및 문장 순서 식별과 같은 특수 토큰과 사전학습 목표를 도입함으로써, BART와 같은 강력한 베이스라인에 비해 논리적인 사건 순서 유지 및 무의미한 반복 감소 측면에서 뛰어난 일관성을 달성한다.

ABSTRACT

Generating long and coherent text is an important but challenging task, particularly for open-ended language generation tasks such as story generation. Despite the success in modeling intra-sentence coherence, existing generation models (e.g., BART) still struggle to maintain a coherent event sequence throughout the generated text. We conjecture that this is because of the difficulty for the decoder to capture the high-level semantics and discourse structures in the context beyond token-level co-occurrence. In this paper, we propose a long text generation model, which can represent the prefix sentences at sentence level and discourse level in the decoding process. To this end, we propose two pretraining objectives to learn the representations by predicting inter-sentence semantic similarity and distinguishing between normal and shuffled sentence orders. Extensive experiments show that our model can generate more coherent texts than state-of-the-art baselines.

연구 동기 및 목표

  • 장기적 일관성을 유지하는 데 어려움을 겪는 개방형 텍스트 생성, 특히 이야기 및 소설 생성 분야의 과제를 해결하기 위해.
  • 기존 모델들이 토큰 수준의 공존을 중시하지만 고차원적 의미와 논의 구조를 포착하지 못하는 점을 개선하기 위해.
  • 디코딩 중 문장 수준 및 논의 수준의 맥락을 이해하고 표현할 수 있는 생성 모델을 개발하기 위해.
  • 문장 간 유사도를 예측하고 올바른 문장 순서와 뒤섞인 순서를 구별할 수 있도록 명시적으로 학습시킬 수 있는 사전학습 목표를 설계하기 위해.
  • 고차원적 표현이 더 일관되고 논리적으로 구성된 장문 텍스트를 생성하는 데 기여하는지 평가하기 위해.

제안 방법

  • 각 문장 뒤에 [S] 및 [D] 특수 토큰을 도입하여 디코더에서 문장 수준 및 논의 수준의 표현 학습을 가능하게 한다.
  • 세 가지 목표로 모델을 사전학습한다: 다음 토큰 예측, SentenceBERT를 교사로 사용한 문장 간 의미 유사도 예측, 정상 및 뒤섞인 문장 순서 간의 문장 순서 식별.
  • 유사도 예측을 위해 SentenceBERT를 사용해 골드 표준 문장 임베딩을 제공함으로써 모델이 의미 있는 문장 수준 표현을 학습할 수 있도록 한다.
  • 논의 수준 표현을 훈련시켜 올바른 순서와 뒤섞인 순서를 구별하도록 하여, 모델이 시간적 및 논리적 의존성을 학습하도록 유도한다.
  • 디코딩 중에 학습된 고차원 표현을 사용하여 스토리 및 소설 생성 작업에서 모델을 미세조정한다.
  • 자동 평가 및 인간 평가를 통해 일관성, 유창성, 일관성 있는 vs. 일관성 없는 입력에 대한 언어 모델링 성능을 평가한다.

실험 결과

연구 질문

  • RQ1문장 수준 및 논의 수준 표현을 모델링하면 개방형 생성에서 장문 텍스트의 일관성이 향상되는가?
  • RQ2문장 간 유사도 및 문장 순서 식별에 대해 사전학습하면 모델이 논리적인 사건 순서를 유지하는 데 능력이 향상되는가?
  • RQ3고차원 표현의 포함 여부가 일관성 있는 vs. 일관성 없는 입력에 대한 언어 모델링에 어떤 영향을 미치는가?
  • RQ4문장 수준 및 논의 수준 표현이 인과적, 시간적, 否정적 등 다양한 일관성 유형에 얼마나 기여하는가?
  • RQ5제안된 방법이 다양한 생성 작업 및 모델 아키텍처에 일반화 가능한가?

주요 결과

  • Hint는 인간 평가에서 스토리 및 소설 생성 분야에서 BART 및 기타 강력한 베이스라인을 크게 능가하며, 일관성 측면에서 통계적으로 유의미한 향상( p < 0.01)을 보였다.
  • 일관성 있는 예시에서는 낮은 퍼플렉서티를, 일관성 없는 예시에서는 높은 퍼플렉서티를 기록하여 고차원 일관성 모델링 능력이 향상됨을 시사했다.
  • 제거 실험 결과, 문장 수준 표현은 관련성, 부정, 의미 반복에 대해 성능 향상을 보였고, 논의 수준 표현은 인과적 및 시간적 관계에 가장 효과적이었다.
  • 유창성은 베이스라인과 유사하게 유지하면서도 더 뛰어난 일관성을 달성함으로써, 성능 향상은 표면적 유창성 향상 때문이 아님을 시사했다.
  • 유사도 예측을 위한 교사로 SentenceBERT를 사용함으로써 모델이 더 의미 있는 문장 수준 표현을 학습하는 데 기여했다.
  • 오류 분석 결과, Hint는 BART가 생성하는 스토리에서 흔히 발생하는 반복적인 플롯과 논리적 모순, 특히 사건 순서 및 인과 논리 측면에서 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.