Skip to main content
QUICK REVIEW

[論文レビュー] Using cognitive psychology to understand GPT-3

Marcel Binz, Eric Schulz|arXiv (Cornell University)|Jun 21, 2022
Topic Modeling被引用数 6
ひとこと要約

この論文は、認知心理学の実験を応用して、GPT-3の推論および意思決定能力を評価しており、スケナリオベースのタスクや経験に基づく意思決定において優れた性能を示す一方で、因果的推論や指向的な探索に失敗している。一部の分野では優れた性能を示すが、GPT-3はプロンプトの摂動に対して非常に感受性が高く、能動的探索や因果的推論といった人間らしい認知メカニズムを欠いている。

ABSTRACT

We study GPT-3, a recent large language model, using tools from cognitive psychology. More specifically, we assess GPT-3's decision-making, information search, deliberation, and causal reasoning abilities on a battery of canonical experiments from the literature. We find that much of GPT-3's behavior is impressive: it solves vignette-based tasks similarly or better than human subjects, is able to make decent decisions from descriptions, outperforms humans in a multi-armed bandit task, and shows signatures of model-based reinforcement learning. Yet we also find that small perturbations to vignette-based tasks can lead GPT-3 vastly astray, that it shows no signatures of directed exploration, and that it fails miserably in a causal reasoning task. These results enrich our understanding of current large language models and pave the way for future investigations using tools from cognitive psychology to study increasingly capable and opaque artificial agents.

研究の動機と目的

  • 既存の心理学者的実験を用いて、GPT-3が人間らしい認知的行動を示すかどうかを評価すること。
  • GPT-3が意思決定、情報探索、熟考、因果的推論の分野における代表的タスクでどのように機能するかを調査すること。
  • 特に探索と因果的推論において、GPT-3の行動と人間の認知の間のギャップを特定すること。
  • GPT-3の性能がプロンプトの変化に対して堅牢であるか、あるいは悪意のある摂動に対して脆弱であるかを評価すること。
  • これらの発見が、より人間らしくなる人工エージェントの開発に与える示唆を検討すること。

提案手法

  • 認知心理学の文献に登場するスケナリオベースのタスクをGPT-3に実行させ、事前に定義された仮想的状況を用いる。
  • プログラムで生成された試行を用いたタスクベースの実験を実施し、経験に基づく意思決定および強化学習の性能を評価する。
  • 多腕バンディットタスクにおけるGPT-3の行動を評価し、探索と活用の戦略を検証する。
  • 因果的推論タスクを用いて、GPT-3が観察データから介入効果を推論できるかをテストする。
  • GPT-3の反応を、同じタスクにおける人間のパフォーマンスと比較し、人間らしさを評価する。
  • プロンプトの摂動に対する反応の一貫性を分析し、語呂の変化に対する感受性と堅牢性を評価する。

実験結果

リサーチクエスチョン

  • RQ1GPT-3は、人間の被験者と同等か、それ以上の水準で、古典的な認知心理学のスケナリオベースのタスクを解けるか?
  • RQ2GPT-3は、経験に基づくタスクにおいて、人間らしく意思決定や情報探索の行動を示すか?
  • RQ3GPT-3は、順次的意思決定タスクにおいて、指向的な探索やモデルベースの強化学習を示すか?
  • RQ4GPT-3は、介入に基づく推論を要するタスクで因果的推論ができるか?
  • RQ5GPT-3の性能は、プロンプトの語呂やタスク提示のわずかな変化に対してどれほど感受性を示すか?

主な発見

  • GPT-3は、大部分のスケナリオベースのタスクを、人間の被験者と同等か、それ以上のパフォーマンスで解けた。
  • GPT-3は多腕バンディットタスクで人間を上回り、経験に基づく意思決定において優れた性能を示した。
  • GPT-3は、モデルベースの強化学習の兆候を示し、結果の内部的状態表現があることを示唆した。
  • スケナリオプロンプトのわずかな摂動が、GPT-3の反応を劇的に変化させた。これは、入力の形式に極めて感受性があることを示している。
  • GPT-3は、不確実性を低減するために情報を能動的に求めることを示す兆候が一切なく、指向的な探索を示さなかった。
  • GPT-3は因果的推論タスクを完全に失敗し、観察データから介入効果を推論できないことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。