Skip to main content
QUICK REVIEW

[논문 리뷰] Perplexity from PLM Is Unreliable for Evaluating Text Quality

Yequan Wang, Jiawen Deng|arXiv (Cornell University)|2022. 10. 12.
Natural Language Processing Techniques인용 수 13
한 줄 요약

이 논문은 사전에 미리 훈련된 언어 모델(PLM)이 계산한 어색함도(PPL)가 텍스트 품질 평가에 신뢰할 수 없는 지표임을 입증한다. 이는 텍스트 길이, 스트링 반복, 문장 부호에 민감하기 때문이다. 문장 유창성 평가에 널리 사용되지만, PPL은 더 긴 텍스트를 선호하고, 최소한의 문장 부호 변경에는 벌점을 부과하며, 반복적인 반복을 환영함으로써 진정한 텍스트 품질을 반영하지 못한다. 이에 따라 더 견고하고 다각적인 평가 지표가 필요하다.

ABSTRACT

Recently, amounts of works utilize perplexity~(PPL) to evaluate the quality of the generated text. They suppose that if the value of PPL is smaller, the quality(i.e. fluency) of the text to be evaluated is better. However, we find that the PPL referee is unqualified and it cannot evaluate the generated text fairly for the following reasons: (i) The PPL of short text is larger than long text, which goes against common sense, (ii) The repeated text span could damage the performance of PPL, and (iii) The punctuation marks could affect the performance of PPL heavily. Experiments show that the PPL is unreliable for evaluating the quality of given text. Last, we discuss the key problems with evaluating text quality using language models.

연구 동기 및 목표

  • 자연어 생성에서 텍스트 품질의 대체 지표로 어색함도(PPL)의 신뢰성을 조사하기 위해.
  • PPL이 진정한 유창성과 품질을 반영하지 못하게 만드는 체계적 편향을 규명하기 위해.
  • 낮은 PPL이 항상 더 나은 텍스트 품질을 의미한다는 널리 퍼진 가정을 도전하기 위해.
  • 길이, 반복, 소량의 문장 부호 변경에 대해 강건한 미래 평가 지표의 설계 원칙을 제안하기 위해.

제안 방법

  • GPT-2-large를 사용하여 WikiText-2 데이터셋의 고품질 문장에서 PPL을 계산하였다.
  • 입력 텍스트를 체계적으로 수정한 후 PPL 변화를 측정하였다: 길이 변화, 반복 스트링 삽입, 문장 부호 제거.
  • 교차 엔트로피 손실을 적용하여 PPL을 계산하였다: PPL(s) = exp(1/m * Σ cross-entropy(ti, Pi)) for token sequence s.
  • 길이 효과를 분리하기 위해 문장을 길이별로 필터링하여 다양한 길이에서의 PPL 안정성을 집중적으로 분석하였다.
  • 문장 부호 제거(특히 마침표 제거) 전후의 PPL 값을 비교하여 민감도를 평가하였다.
  • 문장 내 스트링을 복제하여 반복의 영향을 격리하는 제어 실험을 실시하였다.

실험 결과

연구 질문

  • RQ1고품질 문장 평가 시 텍스트 길이가 PPL 값에 어떤 영향을 미치는가?
  • RQ2생성된 텍스트에서 반복적 또는 중복된 텍스트 스트링이 PPL에 얼마나 강하게 벌점을 주는가?
  • RQ3특히 문장 종결 부호 제거 시 PPL은 얼마나 민감한가?
  • RQ4PPL은 의미 있는 강조와 의미 없는 반복을 신뢰성 있게 구별할 수 있는가?
  • RQ5PLM 기반 PPL을 유창성 및 품질 평가의 유일한 지표로 사용할 때의 주요 한계는 무엇인가?

주요 결과

  • 짧은 텍스트의 PPL 값은 긴 텍스트보다 유의미하게 높은 편이며, 둘 다 고품질임에도 불구하고 길이 편향이 존재함을 시사한다.
  • 반복된 텍스트 스트링은 일관되게 PPL 값을 낮추며, 이는 PPL이 의미적 다양성이나 통일성보다는 반복을 선호함을 의미한다.
  • 마침표를 제거해도 인간의 문장 품질 인식에는 거의 영향을 주지 않음에도 불구하고, PPL 값은 종종 크게 증가한다.
  • PPL은 특히 짧은 문장에서 문장 부호 변화에 매우 민감하며, PPL의 변화 폭이 크고 일관되지 않을 수 있다.
  • 비의미적 요소들(예: 길이, 문장 부호 등)로 인해 고유의 위키백과 문장에서 유도된 고품질 문장의 PPL 값이 크게 변동함으로써, 이는 품질의 대체 지표로서의 신뢰성을 약화시킨다.
  • PPL은 의미 있는 강조와 의미 없는 반복을 구별하지 못하므로, 단독으로 유창성 지표로 사용하기에는 부적절하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.