Skip to main content
QUICK REVIEW

[논문 리뷰] Consistency of a Recurrent Language Model With Respect to Incomplete Decoding

Sean Welleck, Ilia Kulikov|arXiv (Cornell University)|2020. 02. 06.
Topic Modeling참고 문헌 26인용 수 7
한 줄 요약

이 논문은 완전하지 않은 디코딩 중에 순환 언어 모델에서 발생하는 일관성 없는 현상을 규명하고 해결한다. 비용 함수가 빛나는 알고리즘인 비트 서치나 뉴클레오스 샘플링은 모델의 확률 분포에서 확률이 0인 무한 길이의 시퀀스를 생성할 수 있다. 저자들은 일관된 샘플링 변형과 종료 보장 모델 아키텍처를 제안하여 유한한 출력을 보장하며, GPT-2에서 비종료율이 감소함을 실험적으로 입증하면서도 강력한 언어 모델링 성능을 유지한다.

ABSTRACT

Despite strong performance on a variety of tasks, neural sequence models trained with maximum likelihood have been shown to exhibit issues such as length bias and degenerate repetition. We study the related issue of receiving infinite-length sequences from a recurrent language model when using common decoding algorithms. To analyze this issue, we first define inconsistency of a decoding algorithm, meaning that the algorithm can yield an infinite-length sequence that has zero probability under the model. We prove that commonly used incomplete decoding algorithms - greedy search, beam search, top-k sampling, and nucleus sampling - are inconsistent, despite the fact that recurrent language models are trained to produce sequences of finite length. Based on these insights, we propose two remedies which address inconsistency: consistent variants of top-k and nucleus sampling, and a self-terminating recurrent language model. Empirical results show that inconsistency occurs in practice, and that the proposed methods prevent inconsistency.

연구 동기 및 목표

  • 순환 언어 모델의 확률 분포와 완전하지 않은 디코딩 알고리즘에 의해 유도되는 분포 사이의 일관성 없는 점을 수학적으로 정의하기.
  • 일반적으로 사용되는 디코딩 방법—그리디 서치, 비트 서치, 톱-k 샘플링, 뉴클레오스 샘플링—이 모델의 확률이 0인 무한 길이의 시퀀스를 생성할 수 있는 이유를 규명하기.
  • 디코딩이 항상 유한하고 유효한 시퀀스를 생성하도록 보장하는 실용적인 해결책을 개발하기.
  • 일관성이 실제로 표준 모델인 GPT-2에서 발생하는지 실험적으로 검증하기.
  • 훈련 시점에 시퀀스 수준의 학습이 일관성 문제를 완화시킬 수 있는지 탐색하기.

제안 방법

  • 유한 어휘 집합과 특수 <eos> 토큰을 포함한 순환 언어 모델을 자동회귀 신경망으로 정의하며, 이는 시퀀스 종료를 위한 표시 역할을 한다.
  • 디코딩 알고리즘을 모델과 컨텍스트를 바탕으로 시퀀스에 대한 분포를 유도하는 함수로 수식화하고, '일관성 없음'을 모델에서 확률이 0인 무한 길이의 시퀀스 생성으로 정의한다.
  • 모델 자체는 일관성이 있지만, 각 단계에서 일부 토큰을 배제하는 알고리즘은 일관성 없는 분포를 유도함을 증명한다.
  • 디코딩 중에 <eos> 토큰이 후보 집합에서 항상 제외되지 않도록 보장함으로써 톱-k 및 뉴클레오스 샘플링의 일관된 변형을 제안한다.
  • 출력 레이어를 재구성하여 <eos> 토큰이 항상 높은 순위에 오도록 하는 자가 종료 순환 언어 모델 아키텍처를 도입하며, 이는 어떤 완전하지 않은 디코딩 전략이라도 종료 보장을 한다.
  • 비드 서치를 사용하여 Wikitext-103 데이터셋에서 비종료 비율과 퍼플렉서티를 측정함으로써 방법의 일관성과 생성 품질을 평가한다.

실험 결과

연구 질문

  • RQ1비트 서치나 뉴클레오스 샘플링과 같은 디코딩 알고리즘이 순환 언어 모델의 확률이 0인 무한 길이의 시퀀스를 생성할 수 있는가?
  • RQ2일반적으로 사용되는 디코딩 방법이 모델이 유한한 시퀀스를 생성하도록 훈련되었음에도 불구하고 왜 일관성 없는 결과를 낳는가?
  • RQ3디코딩 중에 <eos> 토큰이 항상 포함되도록 보장하는 일관된 샘플링 변형을 설계할 수 있는가?
  • RQ4어떤 완전하지 않은 디코딩 알고리즘에도 유한한 출력을 보장하는 자가 종료 모델 아키텍처를 구축할 수 있는가?
  • RQ5실제 모델인 미세조정된 GPT-2에서도 일관성이 실제로 발생하는가?

주요 결과

  • Wikitext-103에서 표준 GPT-2-117M의 비드 서치 기반 비종료 비율은 500토큰 제한 조건에서 37.91%였으며, 실질적으로 상당한 일관성 없는 현상이 있음을 시사한다.
  • 자기 종료 GPT-2 변형은 비종료 비율이 0.00%로 완전히 무한 생성을 제거했으며, 합리적인 생성 품질을 유지했다.
  • 자기 종료 모델의 퍼플렉서티는 20.92에서 27.25로 증가하여 언어 모델링 품질에 약간의 희생이 있었지만 일관성 향상에 기여했다.
  • 일관된 샘플링 변형은 디코딩 중에 <eos> 토큰이 항상 후보 집합에 포함되도록 보장함으로써 무한 길이의 시퀀스 생성을 방지한다.
  • 자기 종료 모델의 연속 시퀀스 길이 분포는 더 짧고 현실적인 길이로 이동하여 지표 데이터 분포와 더 잘 일치한다.
  • 실험 결과는 일관성 문제가 이론적 문제에 그치지 않고 실제 구현된 디코딩 파이프라인에서도 실제로 발생함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.