[論文レビュー] Can language models handle recursively nested grammatical structures? A case study on comparing models and humans
この論文は、大規模言語モデル(LLMs)が再帰的・ネストされた文法構造を処理できないという従来の主張に反論し、シンプルなプロンプトを用いた公平で人間と同等の条件下で評価した結果、LLMsが同様のタスクで人間を上回ることを示している。これは、深さの増すネスト化された構造に対しても一般化できることを示しており、従来の比較は、モデルをゼロショットで評価したのに対し、人間は訓練済みで指示を受けた状態であったため、バイアスが生じていたことが判明した。
How should we compare the capabilities of language models (LMs) and humans? I draw inspiration from comparative psychology to highlight some challenges. In particular, I consider a case study: processing of recursively nested grammatical structures. Prior work suggests that LMs cannot handle these structures as reliably as humans can. However, the humans were provided with instructions and training, while the LMs were evaluated zero-shot. I therefore match the evaluation more closely. Providing large LMs with a simple prompt -- substantially less content than the human training -- allows the LMs to consistently outperform the human results, and even to extrapolate to more deeply nested conditions than were tested with humans. Further, reanalyzing the prior human data suggests that the humans may not perform above chance at the difficult structures initially. Thus, large LMs may indeed process recursively nested grammatical structures as reliably as humans. This case study highlights how discrepancies in the evaluation can confound comparisons of language models and humans. I therefore reflect on the broader challenge of comparing human and model capabilities, and highlight an important difference between evaluating cognitive models and foundation models.
研究の動機と目的
- 言語モデルが再帰的ネスト構造を処理する際、人間より劣るとされる主張を再評価すること。
- 従来の研究において、人間とモデルの評価方法に生じるメソドロジカルな差を是正すること。
- プロンプトが複雑な句内依存関係のタスクにおけるLLMの性能を著しく向上させられるかを検証すること。
- 人間とモデルの能力を比較する際、公平で同等の評価プロトコルの重要性を強調すること。
- 人間の能力が内因的であると仮定するのではなく、実際のパフォーマンスに基づく、より厳密でデータドリブンな人間-モデル比較を提唱すること。
提案手法
- GPT-2 XLなどの大規模言語モデルを、主語-動詞一致依存関係を持つ中心埋め込み文に対してゼロショット評価した。
- より単純なネスト構造の例を少数提示することで、モデルに少々のfew-shotプロンプトを与えた。
- Lakretzら(2022年)の従来の人間データを再分析し、困難な条件下で人間のパフォーマンスが本当に偶然以上であったかを検証した。
- 従来の研究と同様のタスクフレームワークを用い、人間の実験パラダイムに近づけるように評価条件を調整した。
- ネストの深さを増やしながらモデルのパフォーマンスを評価し、人間がテストした範囲を超える深さの条件も含めた。
- 推論トレースプロンプトと指示微調整の原則を適用し、モデルの行動を人間らしくタスク理解に合わせた。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、本当に再帰的ネスト構造を処理できないのか、それとも評価方法のバイアスによるのか?
- RQ2シンプルなプロンプトが、複雑な句内依存関係のタスクにおけるLLMのパフォーマンスを著しく向上させられるか?
- RQ3再帰的文法タスクにおいて、人間のパフォーマンスは深さの増すネスト条件下でも信頼性を持って偶然以上であったと言えるか?
- RQ4訓練、指示、動機づけの違いといった評価パラダイムの差が、人間とモデルの比較を歪める程度はどの程度か?
- RQ5人間とモデルの能力を正当に比較できる、より公平な評価プロトコルはどのように設計できるか?
主な発見
- シンプルな例をプロンプトで与えることで、大規模言語モデルは再帰的ネスト構造の主語-動詞一致タスクで、人間参加者を一貫して上回った。
- モデルは人間がテストした範囲を超える深いネスト(例:3層以上)に対しても一般化でき、トレーニング分布を超えた外挿を示した。
- 従来の人間データの再分析から、最も困難な条件下での人間のパフォーマンスが確実に偶然以上ではなかったことが示され、この分野における人間の優位性という仮定に疑問が呈された。
- 従来の研究で観察されたモデルと人間のパフォーマンス格差は、主に評価の不平等に起因していた。人間は長時間の訓練と指示を受けたのに対し、モデルはゼロショット評価であった。
- 最小限の文脈(例:数個の例)を用いたプロンプトが、モデルの正確性を著しく向上させた。これは、ファインチューニングなしでタスク理解を顕著に向上させられることを示している。
- 本研究は、評価のメソドロジカルな公平性が極めて重要であることを強調している。条件が一致すれば、LLMsは文法処理タスクで人間と同等、あるいはそれを上回るパフォーマンスを示せる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。