[論文レビュー] Evaluating statistical language models as pragmatic reasoners
本稿は、架空の綱討ちゲームにおける段階的形容詞「strong」を含む発話の文脈に依存する確率的解釈を推論する能力をテストすることで、大規模言語モデル(LLMs)を実用的推論者として評価している。LLMsは『初心者にとって非常に強い』のような複雑な実用的表現について、人間と類似した分布を生成するが、否定や極性反転に関しては困難を示しており、実用的推論の一部が事前に amortized されている可能性を示唆している。
The relationship between communicated language and intended meaning is often probabilistic and sensitive to context. Numerous strategies attempt to estimate such a mapping, often leveraging recursive Bayesian models of communication. In parallel, large language models (LLMs) have been increasingly applied to semantic parsing applications, tasked with inferring logical representations from natural language. While existing LLM explorations have been largely restricted to literal language use, in this work, we evaluate the capacity of LLMs to infer the meanings of pragmatic utterances. Specifically, we explore the case of threshold estimation on the gradable adjective ``strong'', contextually conditioned on a strength prior, then extended to composition with qualification, negation, polarity inversion, and class comparison. We find that LLMs can derive context-grounded, human-like distributions over the interpretations of several complex pragmatic utterances, yet struggle composing with negation. These results inform the inferential capacity of statistical language models, and their use in pragmatic and semantic parsing applications. All corresponding code is made publicly available (https://github.com/benlipkin/probsem/tree/CogSci2023).
研究の動機と目的
- 統計的言語モデルが文脈に根ざした意味の分布を回復することで、暗黙的かつ実用的推論を実行できるかどうかを調査すること。
- LLMsが修飾、否定、極性反転を含む複雑な実用的意味をどの程度組み合わせて表現できるかを評価すること。
- 制御された意味解析タスクにおいて、LLMsが生成する解釈分布と人間が推定する分布を比較すること。
- LLMsが事前学習中に学習した統計的パターンを通じて、人間の推論と同様に、高価な確率的推論を暗黙的に amortized しているかどうかを調査すること。
提案手法
- 研究は、プレイヤーの強さに数値的な事前分布を設定する生成的モデルを定義するため、合理的な発話行動(RSA)モデルに基づく確率的プログラミング言語(PPL)フレームワークを用いる。
- 『strong』、『very strong for a beginner』、『not strong』といった発話は、PPLにおける条件付け文として扱われ、プレイヤーの強さに関する事後分布が更新される。
- LLMsは、明示的な確率的計算を伴わず、事後分布の推定を試みることで、実用的推論を模倣するようにプロンプトされる。
- 人間参加者に対しても同じ分布の推定が依頼され、LLMsの出力と直接比較可能となる。
- 否定、極性反転、クラス比較を含む構成を評価し、間接的参照や文脈的曖昧さに対する耐性をテストする。
- LLMと人間の分布間の統計的類似性は、KLダイバージェンスと相関係数を用いて測定される。

実験結果
リサーチクエスチョン
- RQ1LLMsは、段階的形容詞『strong』を含む実用的発話の解釈について、文脈に依存する人間と類似した分布を推論できるか?
- RQ2LLMsは、修飾(『very strong』)、否定(『not strong』)、極性反転(『weak』)を含む複雑な構文的構成において、実用的意味をどの程度適切に組み合わせられるか?
- RQ3LLMsは、実用的推論タスクにおける人間の聴取者の確率的推論プロセスをどの程度近似できるか?
- RQ4LLMsは、実用的推論の計算コストを暗黙的に amortized しているのか、それとも事前学習データからのヒューリスティックな検索に依存しているのか?
主な発見
- 『初心者にとって非常に強い』のような複雑な実用的発話について、LLMsが生成する解釈分布は人間が推定する分布と非常に類似しており、相関係数(r > 0.8)が高く、KLダイバージェンスは低い。
- モデルは文脈に依存する比較や間接的参照を適切に処理でき、クエリと文脈変数の間の同義的・正確でない一致に対しても頑健であることが示された。
- LLMsは否定処理において意味の組み合わせを正しく行わず、人間の推論とは著しく異なる分布を生成しており、否定における構文的推論の破綻を示唆している。
- 否定処理における乖離は、このような計算が、事前学習データからのヒューリスティックな検索ではなく、明示的な確率的推論を必要としている可能性を示唆している。
- LLMsは強固な語彙的意味的耐性を示し、文脈的曖昧さの処理において、結合カテゴリカル文法に基づく従来の意味解析器を上回っている。
- 結果は、LLMsが訓練データ内の統計的規則性を通じて一部の実用的推論を暗黙的に amortized している可能性を支持するが、特に論理的または確率的処理を要するものについてはそうではない、という仮説を裏付けている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。