Skip to main content
QUICK REVIEW

[論文レビュー] Human-Like Intuitive Behavior and Reasoning Biases Emerged in Language Models -- and Disappeared in GPT-4

Thilo Hagendorff, Sarah Fabi|arXiv (Cornell University)|Jun 13, 2023
Topic Modeling被引用数 5
ひとこと要約

本研究では、認知的反骨テスト(CRT)や意味的錯覚といった心理的テストを用いて、大規模言語モデル(LLMs)における直感的推論バイアスを調査した。GPT-3は人間と同様の直感的誤りを示したが、GPT-4はこれらのバイアスを回避するハイパーラショナルな行動を示し、モデル能力の向上に伴い直感的から分析的推論へと移行していることを示唆している。

ABSTRACT

Large language models (LLMs) are currently at the forefront of intertwining AI systems with human communication and everyday life. Therefore, it is of great importance to evaluate their emerging abilities. In this study, we show that LLMs, most notably GPT-3, exhibit behavior that strikingly resembles human-like intuition -- and the cognitive errors that come with it. However, LLMs with higher cognitive capabilities, in particular ChatGPT and GPT-4, learned to avoid succumbing to these errors and perform in a hyperrational manner. For our experiments, we probe LLMs with the Cognitive Reflection Test (CRT) as well as semantic illusions that were originally designed to investigate intuitive decision-making in humans. Moreover, we probe how sturdy the inclination for intuitive-like decision-making is. Our study demonstrates that investigating LLMs with methods from psychology has the potential to reveal otherwise unknown emergent traits.

研究の動機と目的

  • 大規模言語モデル(LLMs)が人間と同様の直感的推論を示し、関連する認知バイアスを示すかどうかを調査すること。
  • 既存の心理的テストを用いて、モデルの能力が直感的誤りへの感受性に与える影響を評価すること。
  • GPT-3のような初期モデルで見られる直感的バイアスが、GPT-4のような高度なLLMsで克服されるかどうかを調査すること。
  • さまざまなテスト条件におけるLLMsの直感的意思決定傾向の頑健性を評価すること。
  • 心理的テスト手法が、LLMsに顕在する認知的特徴を解明する価値を持つことを示すこと。

提案手法

  • 本研究では、人間の直感的思考と分析的思考の違いを測定することを目的とした、広く知られた心理的道具である認知的反骨テスト(CRT)を採用した。
  • 意味的錯覚——認知的に欺く言語的刺激——を用いて、LLMsにおける直感的推論を調べ、人間の認知バイアス実験と同様のアプローチをとった。
  • GPT-3、ChatGPT、GPT-4を含むLLMsにCRTの問題と意味的錯覚を提示し、反応パターンを評価した。
  • 反応が直感的(誤り)な回答と分析的(正解)な回答のどちらに一致するかを分析し、特に誤り率に注目した。
  • フレーズの違いや文脈的ヒントを変化させることで、バイアスの一貫性を評価し、直感的傾向の頑健性を検証した。
  • モデルの出力と既知の人間の認知行動を比較することで、直感的行動の顕在を評価した。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルは、人間で観察されたものと同様の直感的推論バイアスを示すか?
  • RQ2特にGPT-4において、モデルの能力がCRTのような認知バイアスへの感受性にどのように影響するか?
  • RQ3意味的錯覚はLLMsにどの程度直感的誤りを引き起こすか、人間の反応と比べてどうか?
  • RQ4LLMsにおける直感的バイアスは、フレーズの違いや文脈的操作に対して一貫性を示すか?
  • RQ5心理的テスト手法は、通常の観察では検出できないLLMsにおける顕在的認知的特徴を明らかにできるか?

主な発見

  • GPT-3は認知的反骨テスト(CRT)において高い直感的誤り率を示し、人間の誤りパターンと密接に一致した。
  • GPT-4は直感的誤りの頻度を顕著に低減し、常に正しい分析的答えを選択する傾向を示した。
  • 本研究では、モデル能力の向上と、LLMsにおける直感的からハイパーラショナルな意思決定へのシフトが相関していることが判明した。
  • 意味的錯覚はGPT-3に予測可能な直感的反応を引き起こしたが、GPT-4はこれらのバイアスをほとんど回避しており、より強い分析的推論能力を示した。
  • GPT-4における直感的傾向の頑健性は低く、言語的フレーミング効果に対してより感受性が低いことが示唆された。
  • 結果から、心理的テスト手法が、モデルの進化に伴い生じる推論スタイルの変化を含め、LLMsに顕在する認知的特徴を効果的に解明できることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。