[論文レビュー] Detecting and Exorcising Statistical Demons from Language Models with Anti-Models of Negative Data
本稿では、肯定的な学習データから導出された負のデータ分布を用いて、神経言語モデルに内在する有害な統計的バイアス(「統計的悪魔」)を検出し、緩和する手法を提案する。unsmoothed n-gramモデルを用いて負の学習例を生成することで、誤ったn-gramパターンへの依存を低減し、構文的一般化を向上させ、LSTMおよびGPT-2における困難な格主一致タスクで最大46%の誤差低減を達成した。
It's been said that "Language Models are Unsupervised Multitask Learners." Indeed, self-supervised language models trained on "positive" examples of English text generalize in desirable ways to many natural language tasks. But if such models can stray so far from an initial self-supervision objective, a wayward model might generalize in undesirable ways too, say to nonsensical "negative" examples of unnatural language. A key question in this work is: do language models trained on (positive) training data also generalize to (negative) test data? We use this question as a contrivance to assess the extent to which language models learn undesirable properties of text, such as n-grams, that might interfere with the learning of more desirable properties of text, such as syntax. We find that within a model family, as the number of parameters, training epochs, and data set size increase, so does a model's ability to generalize to negative n-gram data, indicating standard self-supervision generalizes too far. We propose a form of inductive bias that attenuates such undesirable signals with negative data distributions automatically learned from positive data. We apply the method to remove n-gram signals from LSTMs and find that doing so causes them to favor syntactic signals, as demonstrated by large error reductions (up to 46% on the hardest cases) on a syntactic subject-verb agreement task.
研究の動機と目的
- 肯定的データで訓練された言語モデルが、不文法的または統計的にバイアスがかかるような不適切な「負の」データ(例:不文法的または統計的にバイアスがかかる系列)にも一般化するかどうかを調査すること。
- 自己教師付き言語モデルが、構文的構造ではなく、誤ったn-gramパターンを学習する程度を特定および定量化すること。
- 自動的に学習された負のデータ分布を用いて、これらの不適切な統計的信号を検出し、緩和する手法を開発すること。
- このような信号を除去することで、モデルが言語的に意味のある表現、特に構文を学習する能力が向上するかどうかを評価すること。
提案手法
- 同じ肯定的学習データ上でunsmoothed trigram言語モデルを訓練し、一般的なn-gramパターンの検出器として用いる。
- このtrigramモデルを用いて、主モデルが過学習しやすい不適切なパターンを反映する「負の」データ(不文法的または統計的にバイアスがかかる系列)を生成する。
- 主モデル(例:LSTMまたはGPT-2)の微調整中に、これらの負の系列に対して高い尤度を割り当てるのを罰する正則化項を導入する。
- 強度を制御するハイパーパrameter αを導入し、n-gramバイアスの低減と文法的データにおける性能維持のトレードオフを可能にする。
- 標準ベンチマーク(例:Marvin & Linzenのデータ)を用いて、構文プローブタスク、特に格主一致タスクで手法を評価する。
- 正例と負例の開発セットにおける負の対数尤度(NLL)を測定し、一般化性能およびバイアス低減効果を評価する。
実験結果
リサーチクエスチョン
- RQ1自己教師付き言語モデルは、不文法的または統計的にバイアスがかかる負のデータ(例:不文法的系列)に対してどの程度一般化するか?
- RQ2モデルサイズ、学習データ量、学習エポック数を増加させると、モデルが誤ったn-gramパターンに依存する傾向がどのように変化するか?
- RQ3肯定的データから自動的に負のデータ分布を学習し、不適切な統計的バイアスの検出・緩和の信号として用いることは可能か?
- RQ4負のデータを用いたn-gram信号の緩和により、モデルの構文的一般化能力が向上するか?
- RQ5長距離構文的一般化の向上と、短距離依存関係における性能低下のトレードオフはどのようなものか?
主な発見
- trigram緩和による微調整により、長距離構文的依存関係の性能が顕著に向上し、最も困難な格主一致ケースで最大46%の相対的誤差低減を達成した。
- n-gramパターンへの依存が低減した:αが高くなるほど負の開発セットの perplexity が上昇し、モデルが不文法的系列に高い尤度を割り当てにくくなった。
- 「主語の相対節をはさんで」構文において、α=1のとき95%の精度(NLL 0.95)を達成し、ベースラインのGPT-2スコア(0.72)を上回った。
- 自己代名詞の照応および否定極性項のタスクにおいて、複雑で長距離のケースで性能が向上し、α=8のとき「相対節をはさんで(RA)」ではNLLが0.76から0.79に、および「相対節をはさんで(NPI)」では0.83から0.94に上昇した。
- 「目的語の相対節」のような短距離依存関係のタスクでは、αが高くなるにつれて性能が低下した。これは、長距離と短距離の一般化の間のトレードオフを示している。
- この手法により、訓練データにおいても非常に予測可能であっても、統計的ノイズを能動的に抑制することで、モデルが構文的一般化に向かって導けることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。