QUICK REVIEW
[論文レビュー] CRASS: A Novel Data Set and Benchmark to Test Counterfactual Reasoning of Large Language Models
Jörg Frohberg, Frank Binder|arXiv (Cornell University)|Dec 22, 2021
Topic Modeling被引用数 9
ひとこと要約
この論文は、大規模言語モデル(LLMs)の常識的推論能力を評価するための新規ベンチマークであるCRASSを紹介している。質問形式の反事後的条件文を用い、人間ベースラインをクラウドで検証した結果、最新のSOTA LLMでさえも人間の性能より25%以上も低い結果を示し、反事後的推論能力に顕著な格差が存在することを明らかにした。
ABSTRACT
We introduce the CRASS (counterfactual reasoning assessment) data set and benchmark utilizing questionized counterfactual conditionals as a novel and powerful tool to evaluate large language models. We present the data set design and benchmark that supports scoring against a crowd-validated human baseline. We test six state-of-the-art models against our benchmark. Our results show that it poses a valid challenge for these models and opens up considerable room for their improvement.
研究の動機と目的
- 大規模言語モデル(LLMs)における高度な常識的推論を評価するための堅牢なベンチマークの不足に対処すること。
- 因果推論と仮説的推論をテストするための、質問形式の反事後的条件文(QCC)に基づく新規評価フレームワークの開発。
- 反事後的推論タスクにおけるLLM性能を測定するための、人間がアノテートし、クラウドで検証されたベースラインの確立。
- 現実に起こらなかった代替的・非現実的出来事についての推論における制限を露呈させることで、現在のSOTA LLMを挑戦すること。
- 厳密に設計された、コミュニティで認められたベンチマークタスクを提供することで、BIG-benchイニシャチブに貢献すること。
提案手法
- CRASSベンチマークは、質問形式の反事後的条件文(QCC)を用い、例として「木が倒れていなかったらどうなっていたか?」のような形で反事後的状況を提示する。
- 各QCCは、現実の出来事の連鎖に基づいており、前件は現実に起こらなかった原因を、結果は潜在的な影響をそれぞれ記述する。
- モデルが実際に起こらなかった仮説的出来事の結果を推論できるかどうかをテストするため、因果的推論を評価するように設計されている。
- 因果モデルが暗黙的に想定されており、モデルは反事後的前件が与えられたもとで最も確率の高い結果を推論する必要がある。確率最大化原理に従い、o* = argmaxₒ P(o|a) と表される。
- 人間の常識に整合するように、人間によるアノテーション付きの正解を用いてデータセットを構築し、ゴールドスタンダードのベースラインを形成する。
- ベンチマークはBIG-benchスイートに統合されており、複数のLLMにおける標準化された評価を可能にしている。
実験結果
リサーチクエスチョン
- RQ1最先端の大規模言語モデルは、実際に起こらなかった反事後的状況について、どの程度適切に推論できるか?
- RQ2LLMは、観測済みのデータを超えて、特に仮説的・非現実的な状況において、因果的推論をどの程度一般化できないか?
- RQ3LLMの反事後的推論性能は、人間ベースラインと比較してどの程度異なるか?
- RQ4質問形式の反事後的条件文に基づくベンチマークは、標準的なNLPベンチマークを超えてLLMの推論の限界を効果的に露呈できるか?
- RQ5人間とモデルの反事後的推論性能の格差は、どの程度のものか?また、これは異なるモデルアーキテクチャ間で一貫性を示すか?
主な発見
- CRASSベンチマークは、テストされた最も先進的な大規模言語モデルですら、反事後的推論タスクにおいて人間の性能に著しく劣っていることを明らかにした。
- 平均して、LLMは人間が検証したベースラインと比較して25%以上の性能格差を示しており、改善の余地が著しく大きいことを示している。
- このベンチマークは、特に既知の事実と矛盾する仮説的出来事の処理において、因果的推論の体系的失敗を特定できた。
- 因果的依存関係が複雑な場合、モデルは実際に起こらなかった出来事について推論する際に論理的一致性を保てないことがしばしばある。
- 現在のLLMは、代替的因果経路についての推論に苦労しており、内部の因果的ワールドモデルに制限があることが確認された。
- このベンチマークはBIG-benchスイートに承認され、標準化された、コミュニティで認められた評価ツールとしての有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。