Skip to main content
QUICK REVIEW

[論文レビュー] Perplexity from PLM Is Unreliable for Evaluating Text Quality

Yequan Wang, Jiawen Deng|arXiv (Cornell University)|Oct 12, 2022
Natural Language Processing Techniques被引用数 13
ひとこと要約

この論文は、事前学習言語モデル(PLM)によって計算されるパープレキシティ(PPL)が、テキスト長、スパンの繰り返し、標点符号に敏感であるため、テキスト品質の評価に信頼できない指標であることを示している。文の流れの評価に広く使われているが、PPLは長めのテキストを好む傾向があり、最小限の標点符号の変更を懲罰し、冗長な繰り返しを奨励する。これらは真のテキスト品質を反映するものではなく、長さ、繰り返し、微細な標点符号の変更に対して頑健で、多面的な評価指標の導入が求められる。

ABSTRACT

Recently, amounts of works utilize perplexity~(PPL) to evaluate the quality of the generated text. They suppose that if the value of PPL is smaller, the quality(i.e. fluency) of the text to be evaluated is better. However, we find that the PPL referee is unqualified and it cannot evaluate the generated text fairly for the following reasons: (i) The PPL of short text is larger than long text, which goes against common sense, (ii) The repeated text span could damage the performance of PPL, and (iii) The punctuation marks could affect the performance of PPL heavily. Experiments show that the PPL is unreliable for evaluating the quality of given text. Last, we discuss the key problems with evaluating text quality using language models.

研究の動機と目的

  • 自然言語生成におけるテキスト品質の代理指標としてのパープレキシティ(PPL)の信頼性を調査すること。
  • PPLが真のスムーズさや品質を反映できないように歪ませる系統的なバイアスを同定すること。
  • 低PPLが常に優れたテキスト品質を示すという広く受け入れられている仮定に疑問を呈すること。
  • 長さ、繰り返し、微細な標点符号の変更に対して頑健であるような、将来の評価指標の設計原則を提言すること。

提案手法

  • GPT-2-largeを用いて、WikiText-2データセットの高品質な文に対してPPLを計算した。
  • 入力テキストを系統的に変更した上でPPLの変化を測定した:長さの変更、繰り返しスパンの導入、標点符号の削除。
  • 交差エントロピー損失を用いてPPLを計算した:PPL(s) = exp(1/m * Σ cross-entropy(ti, Pi)) はトークン列sに対して成り立つ。
  • 長さの影響を分離するために文の長さでフィルタリングを行い、さまざまな長さにおけるPPLの安定性に注目した。
  • 標点符号(特に終句ピリオド)を削除した前後でのPPL値を比較し、感度を評価した。
  • 文内のスパンを複製することで、繰り返しの影響を分離するための制御実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1高品質な文を評価する際、テキスト長はPPL値にどのように影響するか?
  • RQ2PPLは、生成されたテキストにおける冗長または繰り返しのスパンに対して、どの程度懲罰的または奨励的か?
  • RQ3PPLは微細な標点符号の変更、特に終句標点の削除に対してどの程度感受性を示すか?
  • RQ4PPLは意味的に有意義な強調と意味のない繰り返しを信頼性を持って区別できるか?
  • RQ5PLMベースのPPLを単独の指標として使用する際の主な制限は何か?

主な発見

  • 同じ高品質な文でも、短いテキストではPPL値が著しく高くなる傾向があり、長さバイアスが顕著である。
  • 繰り返しスパンが一貫してPPL値を低下させるため、PPLは意味的多様性や一貫性よりも冗長性を好む傾向がある。
  • 最終的な句点を削除しても人間の文の品質認識にほとんど影響がないにもかかわらず、PPL値が顕著に上昇することが多く、これは大きな問題である。
  • PPLは標点符号の変更に非常に感受性が高く、特に短い文ではPPLの変動が大きくかつ一貫性がない。
  • 意味的要因とは無関係な要因によって、高品質なウィキペディア由来の文のPPLは広範囲にわたって変動し、品質の代理指標としての信頼性を損なう。
  • PPLは意味的強調と意味のない繰り返しを区別できないため、単独のスムーズさ指標として不適切である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。