Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating the Deductive Competence of Large Language Models

S. M. Seals, Valerie L. Shalin|arXiv (Cornell University)|Sep 11, 2023
Topic Modeling被引用数 4
ひとこと要約

本研究では、大規模言語モデル(LLMs)の演繹的推論能力を、ウォーソン選択課題を用いて評価し、内容の種別(社会的ルール対非社会的ルール)および提示形式の影響を検証した。膨大なテキストコーパスで訓練されたにもかかわらず、LLMsは抽象的問題では低精度(10-20%)を示し、社会的ルール問題についてもわずかな向上にとどまり、内容と形式の間で予期しない、人間らしくない相互作用が性能に影響を与えることが判明した。これは、人間の認知とは異なる、出現的な推論バイアスを示している。

ABSTRACT

The development of highly fluent large language models (LLMs) has prompted increased interest in assessing their reasoning and problem-solving capabilities. We investigate whether several LLMs can solve a classic type of deductive reasoning problem from the cognitive science literature. The tested LLMs have limited abilities to solve these problems in their conventional form. We performed follow up experiments to investigate if changes to the presentation format and content improve model performance. We do find performance differences between conditions; however, they do not improve overall performance. Moreover, we find that performance interacts with presentation format and content in unexpected ways that differ from human performance. Overall, our results suggest that LLMs have unique reasoning biases that are only partially predicted from human reasoning performance and the human-generated language corpora that informs them.

研究の動機と目的

  • 認知科学における古典的な演繹的推論問題、特にウォーソン選択課題を解けるかどうかを評価すること。
  • 人間と同様に、社会的ルールの内容がLLMの性能を向上させるかどうかを調査すること。
  • 異なる提示形式がLLMの推論性能に与える影響を検討すること。
  • 性能の差が、多様なLLMアーキテクチャーや訓練データの間で一貫しているかどうかを特定すること。
  • 人間の認知パターンとは異なる、LLMに出現する推論バイアスを同定すること。

提案手法

  • 標準化された制御済みの問題セット(内容:社会的、現実的、任意のルール、形式:古典的、シャッフル、再表現)を用いて、複数のLLMにウォーソン選択課題を実施した。
  • 固定された問題内容と変化するフォーマットを用いた実験を設計し、提示形式の影響を分離して評価した。
  • 論理的に妥当なカード(モーダス・ポンエンスおよびモーダス・トレントランス)の選択の正答率を測定した。
  • 異なるアーキテクチャ、訓練データ、目的を持つLLM間での性能を比較し、結果の一貫性を評価した。
  • 前件カードと結果カードの選択パターンを分析し、推論バイアスを特定した。
  • ファインチューニングを回避するため、制御されたゼロショットプロンプティングを用い、一般化された推論能力の評価を実施した。
Figure 1: Breakdown of the different types of problems we examine.
Figure 1: Breakdown of the different types of problems we examine.

実験結果

リサーチクエスチョン

  • RQ1社会的ルールの内容が、人間と同様にLLMの演繹的推論性能を向上させるか?
  • RQ2提示形式(例:古典的対シャッフル)の違いが、LLMのウォーソン課題における性能に与える影響は何か?
  • RQ3内容タイプと提示形式の間で、一貫した、人間らしくない相互作用がLLMの推論に見られるか?
  • RQ4LLMは、条件的推論課題において、どの程度人間の推論パターンを再現できるか?
  • RQ5アーキテクチャや訓練差異に関係なく、LLMの推論バイアスは一貫しているか?

主な発見

  • LLMsは抽象的ウォーソン問題において低性能を示し、正確性は10-20%程度であり、人間のベースライン性能と一貫している。
  • 社会的ルール問題ではわずかに性能が向上するが、人間レベルの正確性(70%以上)には達しない。これは、内容のなじみによる恩恵が限定的であることを示している。
  • 提示形式が性能に顕著な影響を及ぼし、古典的フォーマットが最も高い正確性を示したが、改善幅は限定的であった。
  • 予期しない、人間らしくない内容と形式の相互作用が観察され、人間の認知モデルでは予測できない推論バイアスが存在することが示唆された。
  • LLMsは、特に非社会的および現実的ルール条件下で、前件カードの選択において著しく性能を発揮せず、一貫したカード選択行動の欠如を示した。
  • 訓練データやアーキテクチャの違いに関わらず、LLMs間で性能パターンと推論バイアスが顕著に一貫しており、出現的で共有された認知バイアスが存在することが示された。
Figure 2: Model performance by content type for arbitrary (AR), shuffled (SH), and realistic (RE) rules. RE contains both social and non-social rules. We do not find effects for LLM or familiarity, thus performance is collapsed. Relative to arbitrary content, most models result in a benefit for real
Figure 2: Model performance by content type for arbitrary (AR), shuffled (SH), and realistic (RE) rules. RE contains both social and non-social rules. We do not find effects for LLM or familiarity, thus performance is collapsed. Relative to arbitrary content, most models result in a benefit for real

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。