Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Distributional Distortion in Neural Language Modeling

Benjamin LeBrun, Alessandro Sordoni|arXiv (Cornell University)|Mar 24, 2022
Natural Language Processing Techniques被引用数 4
ひとこと要約

本稿では、自然言語におけるレアで新規の系列の確率推定に関して、ニューラル言語モデル(LSTMおよびTransformer)の性能を評価するための制御された評価フレームワークを提案する。事前学習済みTransformerを真値生成モデルとして用い、正確な系列確率を有する人工言語を生成することで、研究では、ニューラルLMが一貫してよく整ったレアな系列の尤度を過小評価している一方で、不適切な系列の尤度を過大評価していることが明らかになった。過小評価は、より多くの訓練データを用いても解消せず、エントロピーが低い分布ではさらに悪化する。

ABSTRACT

A fundamental characteristic of natural language is the high rate at which speakers produce novel expressions. Because of this novelty, a heavy-tail of rare events accounts for a significant amount of the total probability mass of distributions in language (Baayen, 2001). Standard language modeling metrics such as perplexity quantify the performance of language models (LM) in aggregate. As a result, we have relatively little understanding of whether neural LMs accurately estimate the probability of sequences in this heavy-tail of rare events. To address this gap, we develop a controlled evaluation scheme which uses generative models trained on natural data as artificial languages from which we can exactly compute sequence probabilities. Training LMs on generations from these artificial languages, we compare the sequence-level probability estimates given by LMs to the true probabilities in the target language. Our experiments reveal that LSTM and Transformer language models (i) systematically underestimate the probability of sequences drawn from the target language, and (ii) do so more severely for less-probable sequences. Investigating where this probability mass went, (iii) we find that LMs tend to overestimate the probability of ill formed (perturbed) sequences. In addition, we find that this underestimation behaviour (iv) is weakened, but not eliminated by greater amounts of training data, and (v) is exacerbated for target distributions with lower entropy.

研究の動機と目的

  • 自然言語におけるレアで新規の系列の確率推定方法について、ニューラル言語モデル(LSTMおよびTransformer)がどのように行うかを調査すること。これは、個々の確率が低いものの、集団としての重要性が大きい。
  • 標準的な指標(例:パープレキシティ)がこのような挙動を捉えられないことから、言語分布の裾のインスタンスレベルでの性能に関する理解のギャップを埋めること。
  • 事前学習済みTransformerから生成された人工言語を用いた制御された評価スキームを構築し、真の系列確率を正確に計算可能にする。
  • 訓練データ量やターゲット分布の性質(例:エントロピー)が、LMの確率推定における歪みにどのように影響するかを分析すること。
  • レアでよく整った系列の確率質量が過小評価された場合、その確率質量はどこに再配分されているかを特定すること。特に、不適切な(変更を加えた)系列との比較を対象とする。

提案手法

  • 自然言語データ上で微調整された事前学習済みTransformer言語モデル(例:GPT-2)を生成モデルとして用い、正確で既知の系列確率を持つ人工言語を定義する。
  • この生成モデルから系列をサンプリングし、下流のLM(LSTMおよびTransformer)の訓練コーパスとしての制御されたターゲット分布を構築する。
  • これらの人工コーパス上で個別にLMを学習し、生成モデルからの真の確率と比較して、LMが予測する系列確率を評価する。
  • 生成モデルの条件付き分布のエントロピーを制御することで、さまざまな分布的性質(例:高エントロピー対低エントロピー)を持つ人工言語を生成する。
  • よく整った系列に小さな構文的に不適切な変更を加え、PERTURBATION実験を実施し、元の真の確率と比較してLMの確率推定を評価する。
  • 系列レベルの確率推定誤差を指標として用い、特にレアな系列と真の分布からの逸脱に注目して、モデルの性能を定量的に評価する。

実験結果

リサーチクエスチョン

  • RQ1ニューラル言語モデルは、自然言語分布におけるレアでよく整った系列の確率を一貫して過小評価するか?
  • RQ2過小評価の大きさは、系列のレアさ(逆頻度)にどのように依存するか?
  • RQ3過小評価されたレアな系列の確率質量は、どこへ再配分されているのか—不適切な系列や変更を加えた系列を過大評価しているか?
  • RQ4訓練データ量の増加が、ニューラルLMにおける確率歪みの程度にどのように影響するか?
  • RQ5ターゲット分布の性質(例:エントロピー)は、LMの確率推定における過小評価の程度にどのように影響するか?

主な発見

  • LSTMおよびTransformer言語モデルは、ターゲット言語から抽出されたよく整った系列の確率を一貫して過小評価しており、特にレアな系列において顕著である。
  • 過小評価は、確率が低い系列においてより顕著であり、分布の裾を適切に表現できていないことを示している。
  • 過小評価された確率質量は、高頻度(ヘッド)の系列には再配分されず、むしろ不適切な系列や変更を加えた系列に過剰に配分されている。
  • 訓練データ量の増加により過小評価の程度は軽減されるが、完全に解消されないため、モデルアーキテクチャや学習プロセスそのものに起因する問題である可能性がある。
  • エントロピーが低いターゲット分布では過小評価がさらに悪化するため、構造的でランダム性の低い分布ではモデルが特に苦戦することが示された。
  • 結果から、ニューラルLMは系列空間全体に確率質量を均等に分散させすぎており、分布の裾にある高確率でよく整った系列に集中させられていないことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。