[論文レビュー] CogBench: a large language model walks into a psychology lab
CogBench は ten metrics を用いた LLM の行動ベンチマークを導入し、七つの認知心理学実験から評価し、標準的な精度を超えた性能と認知的様相をプロファイルするために 35 LLM を評価します。
Large language models (LLMs) have significantly advanced the field of artificial intelligence. Yet, evaluating them comprehensively remains challenging. We argue that this is partly due to the predominant focus on performance metrics in most benchmarks. This paper introduces CogBench, a benchmark that includes ten behavioral metrics derived from seven cognitive psychology experiments. This novel approach offers a toolkit for phenotyping LLMs' behavior. We apply CogBench to 35 LLMs, yielding a rich and diverse dataset. We analyze this data using statistical multilevel modeling techniques, accounting for the nested dependencies among fine-tuned versions of specific LLMs. Our study highlights the crucial role of model size and reinforcement learning from human feedback (RLHF) in improving performance and aligning with human behavior. Interestingly, we find that open-source models are less risk-prone than proprietary models and that fine-tuning on code does not necessarily enhance LLMs' behavior. Finally, we explore the effects of prompt-engineering techniques. We discover that chain-of-thought prompting improves probabilistic reasoning, while take-a-step-back prompting fosters model-based behaviors.
研究の動機と目的
- パフォーマンスのみにとらわれないベンチマークの必要性を動機づけ、認知心理学のパラダイムを用いて内部の LLM 行動を理解する。
- さまざまなタスクと行動を横断して LLM を表現型化する、標準化されたオープンなベンチマークを提供する。
- モデルサイズ、RLHF、その他のトレーニング選択がパフォーマンスと認知的類似行動の両方にどう関連するかを評価する。
- プロンプトエンジニアリング技術が確率推論とモデルベースの挙動に与える影響を探る。
提案手法
- 温度=0 の決定論的設定で、インコンテキスト・プロンプトを用いて 35 LLM(独自・オープンソース)の評価を行う。
- 七つの標準的認知心理学実験に由来する ten の行動指標を採用する。
- 計算的認知モデリングと多層回帰を適用して、ネストされたモデル階層(例:ファインチューニングされたバージョン)を分析する。
- プロンプト連鎖を用いて過去の挙動を収集し、モデルのファインチューニングなしで学習を誘導する。
- 次元削減(UMAP)と回帰分析を通じて RLHF 対 非 RLHF モデルを比較する。
- Chain-of-Thought (CoT) および Take-a-Step-Back (SB) prompting が確率推論とモデルベース性に与える影響を検討する。
実験結果
リサーチクエスチョン
- RQ1CogBench によって測定される確率推論、探査、メタ認知、モデルベース性、時間割引、リスク志向、学習戦略において、LLM はどのように異なるか?
- RQ2モデルサイズ、データ規模、コード訓練がパフォーマンスと行動表現型にどの程度影響するか?
- RQ3RLHF は LLM を人間の挙動により近づけ、メタ認知を高めるのか?
- RQ4 prompting 技術(CoT、SB)が特定の行動指標に与える影響は何か?
- RQ5オープンソースモデルは、独自モデルと比較して異なるリスクプロファイルを示すのか?
主な発見
- 大規模なモデルは一般にパフォーマンスが高く、よりモデルベースな挙動を示す。
- RLHF モデルはより人間らしく挙動し、不確実性をより正確に推定する。
- オープンソースモデルは他の要因を制御した場合、独自モデルよりリスクを抑える傾向がある。
- コード・ファインチューニングは CogBench のタスク全体で挙動を強化する証拠が少ない。
- CoT prompting は確率推論を改善し、SB prompting はモデルベースの挙動を高める。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。