[論文レビュー] Can BERT Reason? Logically Equivalent Probes for Evaluating the Inference Capabilities of Language Models.
本稿では、60のセットにわたり、論理的に同値だが構文的に異なる14,400のプローブを用いた体系的プロービングフレームワークを導入し、事前学習済み言語モデル(PTLMs)の推論能力と頑健性を評価する。一般的な常識ベンチマークでは優れた性能を示すが、これらのプローブではPTLMsはランダム推測と変わらない性能にとどまり、真の推論ではなく表面的なバイアスに強く依存していることが明らかになった。
Pre-trained language models (PTLM) have greatly improved performance on commonsense inference benchmarks, however, it remains unclear whether they share a human's ability to consistently make correct inferences under perturbations. Prior studies of PTLMs have found inference deficits, but have failed to provide a systematic means of understanding whether these deficits are due to low inference abilities or poor inference robustness. In this work, we address this gap by developing a procedure that allows for the systematized probing of both PTLMs' inference abilities and robustness. Our procedure centers around the methodical creation of logically-equivalent, but syntactically-different sets of probes, of which we create a corpus of 14,400 probes coming from 60 logically-equivalent sets that can be used to probe PTLMs in three task settings. We find that despite the recent success of large PTLMs on commonsense benchmarks, their performances on our probes are no better than random guessing (even with fine-tuning) and are heavily dependent on biases--the poor overall performance, unfortunately, inhibits us from studying robustness. We hope our approach and initial probe set will assist future work in improving PTLMs' inference abilities, while also providing a probing set to test robustness under several linguistic variations--code and data will be released.
研究の動機と目的
- 事前学習済み言語モデル(PTLMs)が一貫した推論を実行しているのか、それとも言語的バイアスを単に利用しているのかを体系的に評価すること。
- 推論の失敗が低い推論能力に起因するのか、構文的変化に対する頑健性の低さに起因するのかを理解するギャップを埋めること。
- 論理的に同値だが構文的に多様なプローブを用いることで、推論能力と頑健性を分離可能な再現可能なプロービングフレームワークを構築すること。
- 今後のPTLMの真の推論能力の向上に関する研究を可能にするため、ベンチマークデータセットとコードを提供すること。
提案手法
- 著者らは、構造的変動下での推論をテストするために、複数の構文的に異なるバリエーションを含む60の論理的に同値なプローブセットを構築した。
- 論理的同値性を保ちつつ、語順、構文構造、語彙選択を体系的に変化させることで、合計14,400のプローブを生成した。
- 構文的摂動を制御した状態で、PTLMの推論タスクにおける性能を評価するために、3つのタスク設定でプローブを評価した。
- ゼロショットとファインチューニング済みのPTLM(BERTを含む)を用いて、さまざまな設定での性能をテストした。
- すべてのプローブセットのバリエーションが同一の論理的真偽値を持つようにすることで、プロービングフレームワークが推論能力を分離した。
- この手法により、推論による性能とデータセットバイアスや表面的ヒントによる性能を分離可能となった。
実験結果
リサーチクエスチョン
- RQ1事前学習済み言語モデルは、構文的に異なるが論理的に同値な表現において一貫して推論を実行するのか?
- RQ2PTLMsは推論タスクにおいて、論理的推論よりも表面的な言語的ヒント(例:語順や語彙選択)にどれほど依存しているのか?
- RQ3ファインチューニング後でさえ、論理的に同値なプローブにおけるモデルの性能はランダム推測と比べてどの程度高いのか?
- RQ4全体的な推論性能がランダムに近い場合、構文的変化に対する頑健性を意味的に評価できるのか?
- RQ5データセットバイアスは、PTLMの真の推論能力を隠蔽する役割を果たしているのか?
主な発見
- 標準的な常識ベンチマークでは優れた性能を示すが、BERTや他の大規模PTLMsは、提示された論理的に同値なプローブセットではランダム推測と変わらない性能にとどまる。
- ファインチューニング後でさえ、モデルの性能は依然としてランダムに近いままであり、一貫した推論能力に欠ける根本的な問題が示された。
- モデルは論理的構造よりも、語順や語彙選択といった言語的バイアスに強く依存していることが明らかになった。
- 全体的な性能が著しく低いため、モデルが一貫して失敗する中で、頑健性の評価が意味的に成立しない。
- プローブセットは、現在のPTLMsが構文的変化に対して論理的に一般化できていないことを明らかにした。これは、真の推論を主張する根拠を揺るがすものである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。