[論文レビュー] Event knowledge in large language models: the gap between the impossible and the unlikely
この論文は、大規模言語モデル(LLMs)が、妥当な事象と不適切な事象の記述に対する尤度割り当てを比較することで、一般的な出来事に関する一般化された知識を獲得しているかを調査する。BERTからMPTまでの5つのLLMを用いた最小限の文のペアを用いた研究では、LLMsが不可能な出来事と妥当な出来事の区別を一貫して行えるが、ありそうな出来事とありえない出来事に対する好みに一貫性に欠けることが判明し、不可能性の表現と不確実性の表現の間にはギャップが存在することが明らかになった。
Word co-occurrence patterns in language corpora contain a surprising amount of conceptual knowledge. Large language models (LLMs), trained to predict words in context, leverage these patterns to achieve impressive performance on diverse semantic tasks requiring world knowledge. An important but understudied question about LLMs' semantic abilities is whether they acquire generalized knowledge of common events. Here, we test whether five pre-trained LLMs (from 2018's BERT to 2023's MPT) assign higher likelihood to plausible descriptions of agent-patient interactions than to minimally different implausible versions of the same event. Using three curated sets of minimal sentence pairs (total n=1,215), we found that pre-trained LLMs possess substantial event knowledge, outperforming other distributional language models. In particular, they almost always assign higher likelihood to possible vs. impossible events (The teacher bought the laptop vs. The laptop bought the teacher). However, LLMs show less consistent preferences for likely vs. unlikely events (The nanny tutored the boy vs. The boy tutored the nanny). In follow-up analyses, we show that (i) LLM scores are driven by both plausibility and surface-level sentence features, (ii) LLM scores generalize well across syntactic variants (active vs. passive constructions) but less well across semantic variants (synonymous sentences), (iii) some LLM errors mirror human judgment ambiguity, and (iv) sentence plausibility serves as an organizing dimension in internal LLM representations. Overall, our results show that important aspects of event knowledge naturally emerge from distributional linguistic patterns, but also highlight a gap between representations of possible/impossible and likely/unlikely events.
研究の動機と目的
- 事前学習済みの大規模言語モデル(LLMs)が表面的なパターンを超えて、一般的な出来事に関する一般化された知識を獲得しているかを調査すること。
- LLMsが妥当な対象-目的語の関係と不適切な対象-目的語の関係をどれほどうまく識別できるかを評価すること。
- 特に妥当性が曖昧な場合に、LLMsがありそうな出来事とありえない出来事の区別をどの程度行えるかを検討すること。
- 文の構文的および意味的変化がLLMの尤度判断に与える影響を分析すること。
- 文の妥当性がLLMsの内部表現に組織的次元として組み込まれているかどうかを評価すること。
提案手法
- 研究では、3つのキュレート済みデータセットを用いて、1,215組の最小限の文のペアを構築し、被動態と能動態の役割の違いのみで変化させ、妥当性をテストした。
- BERTからMPTまでの5つの事前学習済みLLMが、各文のペアに対する尤度スコアを評価した。
- 不可能な出来事(例:「ノートパソコンが先生を買った」)と妥当な出来事(例:「先生がノートパソコンを買った」)の間で尤度の比較を行った。
- 追加で、ありそうな出来事(例:「メイドが男の子を家庭教師にした」)とありえない出来事(例:「男の子がメイドを家庭教師にした」)の間でも比較を行った。
- 表面的な特徴(例:語順、文法構造)と意味的類似度を分析し、それらがモデルの判断に与える影響を分離した。
- 内部表現を調査することで、妥当性がモデルの潜在空間における組織的次元として機能しているかどうかを評価した。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、わずかに異なる不適切な出来事の記述よりも、妥当な出来事の記述に対して高い尤度を割り当てますか?
- RQ2妥当性が曖昧な場合に、LLMsはありそうな出来事の記述をありえない出来事の記述よりも一貫して好むでしょうか?
- RQ3LLMの尤度判断が、意味的妥当性ではなく、表面的な文法的または語彙的特徴にどれほど影響を受けるでしょうか?
- RQ4尤度の好みが、構文的変種(例:能動態対受動態)や意味的変種(例:同義の文)の間でどれほど一般化されるでしょうか?
- RQ5文の妥当性は、LLMsの内部表現において構造的な組織的次元としてエンコードされていますか?
主な発見
- LLMsは、不可能な出来事よりも妥当な出来事に対して一貫して高い尤度を割り当てており、テストされたすべてのモデルでほぼ普遍的な好みが見られた。
- LLMsは、ありそうな出来事とありえない出来事の間で、有意に一貫性のない好みを示しており、『ありえない』出来事と『ありえない』出来事の表現の間にはギャップがあることが示唆された。
- LLMの尤度スコアは、妥当性と語順や文法構造などの表面的な文の特徴の両方に影響を受けていた。
- 構文的変種(例:能動態対受動態)では好みの一般化が強く見られたが、意味的変種(例:同義の文)では弱く、語彙的形態への感受性が示唆された。
- 一部のモデルの誤りは人間の判断の曖昧さを反映しており、困難さがモデルの限界に起因するだけではなく、本質的な知覚的曖昧性を反映している可能性がある。
- クラスタリングと次元削減解析の結果、文の妥当性はLLMsの内部表現において意味的な組織的次元として機能していることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。