[論文レビュー] A Systematic Investigation of Commonsense Knowledge in Large Language Models
この論文は、表面的ヒントや評価アーティファクトを制御した上で、大規模言語モデル(最大280Bパラメータ)を一般的な常識ベンチマークに対してゼロショットおよびフェイントショット評価することで、きめ細やかな分析を実施している。強力なパフォーマンスを示すものの、モデルは依然として人間レベルの常識的理解に到達しておらず、モデルサイズの拡大やフェイントショットプロンプトの使用だけでは、タスク固有の監視なしにはギャップを埋められないことが判明した。
Language models (LMs) trained on large amounts of data have shown impressive performance on many NLP tasks under the zero-shot and few-shot setup. Here we aim to better understand the extent to which such models learn commonsense knowledge -- a critical component of many NLP applications. We conduct a systematic and rigorous zero-shot and few-shot commonsense evaluation of large pre-trained LMs, where we: (i) carefully control for the LMs' ability to exploit potential surface cues and annotation artefacts, and (ii) account for variations in performance that arise from factors that are not related to commonsense knowledge. Our findings highlight the limitations of pre-trained LMs in acquiring commonsense knowledge without task-specific supervision; furthermore, using larger models or few-shot evaluation are insufficient to achieve human-level commonsense performance.
研究の動機と目的
- タスク固有の微調整なしに、大規模言語モデルが常識的知識をどの程度習得しているかをきめ細やかに評価すること。
- モデルのパフォーマンスが、実際の常識的推論によるものか、表面的ヒントやアノテーションアーティファクトによるものかを分離して評価すること。
- プロンプト形式やスコア関数といった評価設計の選択が、パフォーマンスの変動に与える影響を評価すること。
- モデルサイズの拡大やフェイントショットの文脈学習を用いることで、常識的推論がどの程度向上するかを特定すること。
- 大規模言語モデルが、出荷時から常識的推論を安定的に行えるという仮定に疑問を呈すること。
提案手法
- 本研究では、Gopher言語モデルファミリー(最大280Bパラメータ)を、ゼロショットおよびフェイントショット設定下で4つの常識的ベンチマークで評価した。
- 統計的推測によるパフォーマンスの影響を分離するため、回答のみのベースラインを厳密に用いた。
- 複数のプロンプト形式とスコア関数を用いて評価することで、評価設計への感受性を評価した。
- スケーリングの挙動を分析するため、125Mから280Bパラメータまでの6つのモデルサイズのパフォーマンストレンドを検証した。
- 微調整を一切行わず、観察されたパフォーマンスが事前学習済み知識の習得に起因することを保証した。
- 統計的制御を適用し、データ内の誤った相関関係から常識的知識の影響を分離した。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、常識的知識を真に理解しているのか、それともデータ内の表面的ヒントに依存しているのか。
- RQ2プロンプト形式やスコア関数といった評価設計の選択が、常識的推論とは独立してモデルのパフォーマンスにどの程度影響を与えるか。
- RQ3モデルサイズの拡大やフェイントショットの文脈学習を用いることで、ゼロショット設定下での常識的推論が顕著に向上するか。
- RQ4現在の大規模言語モデルは、タスク固有の監視なしに、常識的ベンチマークで人間レベルのパフォーマンスを達成できるか。
- RQ5明示的な常識的監視がないと仮定した場合、人間レベルのパフォーマンスに到達するにはどの程度のモデル規模が必要か。
主な発見
- 回答のみのベースラインが、特定のベンチマークで多くのモデルを上回る結果となった。これは、表面的統計的パターンがパフォーマンスに顕著に寄与していることを示している。
- 280Bパラメータのモデルですら、ゼロショット設定下で4つのベンチマークのうち3つでは人間レベルのパフォーマンスに到達できていない。
- モデルサイズの拡大だけでは、人間とのパフォーマンスギャップを埋めるには不十分であり、100Tから10^18パラメータのモデルが必要となる。これは現在の技術的限界をはるかに超える規模である。
- フェイントショットプロンプトは、Social IQaでのみパフォーマンスが向上したが、他のベンチマークではほとんど向上が見られず、最先端モデルとのギャップは解消されなかった。
- プロンプト形式やスコア関数といった評価設計の選択が、パフォーマンスに最大19%の変動を引き起こすことが判明。これは、常識的要因とは無関係な要因への感受性を示している。
- 結果から、現在の大規模言語モデルは、明示的な監視、マルチモーダルの根拠、または他のインダクティブバイアスがなければ、人間レベルの常識的知識を信頼性を持って習得できないと示唆されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。