Skip to main content
QUICK REVIEW

[論文レビュー] Exploring the psychology of LLMs' Moral and Legal Reasoning

Guilherme Almeida, José Luiz Nunes|arXiv (Cornell University)|Aug 2, 2023
Legal Education and Practice Innovations参考文献 61被引用数 7
ひとこと要約

本研究は、GPT-4、Gemini Pro、Claude 2.1、Llama 2 Chat 70bの4つの最先端言語モデルに対して、8つの古典的ヒューマンリーダーシップ研究を再現することで、実験心理学的手法を用いて道徳的および法的推論を評価した。その結果、LLMは人間の反応と高く相関しているものの、応答分散が低いために効果量を著しく誇張しており、人間の直感とは乖離した「マシン心理学」的特徴を示しており、心理的研究所における人間参加者の代替としてLLMを使用することは避けるべきであると示唆した。

ABSTRACT

Large language models (LLMs) exhibit expert-level performance in tasks across a wide range of different domains. Ethical issues raised by LLMs and the need to align future versions makes it important to know how state of the art models reason about moral and legal issues. In this paper, we employ the methods of experimental psychology to probe into this question. We replicate eight studies from the experimental literature with instances of Google's Gemini Pro, Anthropic's Claude 2.1, OpenAI's GPT-4, and Meta's Llama 2 Chat 70b. We find that alignment with human responses shifts from one experiment to another, and that models differ amongst themselves as to their overall alignment, with GPT-4 taking a clear lead over all other models we tested. Nonetheless, even when LLM-generated responses are highly correlated to human responses, there are still systematic differences, with a tendency for models to exaggerate effects that are present among humans, in part by reducing variance. This recommends caution with regards to proposals of replacing human participants with current state-of-the-art LLMs in psychological research and highlights the need for further research about the distinctive aspects of machine psychology.

研究の動機と目的

  • 最先端のLLMが実験心理学的手法を用いて道徳的および法的問題についてどのように推論するかを調査すること。
  • 多様な道徳的および法的推論タスクにおいて、LLMが出力する反応が人間の反応とどの程度一致するかを評価すること。
  • 特に効果量と分散の観点から、人間とLLMの推論パターンの系統的差異を特定すること。
  • AIセーフティおよび研究手法の文脈において、人間の直感に偏見を含む可能性があることとLLMの整合性がもつれることの規範的意味を評価すること。

提案手法

  • LLMを反応生成者として用いて、道徳的および法的推論に関する8つの確立済み心理実験を再現した。
  • GPT-4、Gemini Pro、Claude 2.1、Llama 2 Chat 70bのLLM出力を、元の研究または再現研究からの人間の反応と比較した。
  • 部分エータ二乗やコーエンのdといった統計的指標を用いて、人間とLLMの反応間の効果量と相関を定量化した。
  • 人間の反応と比較して、LLMが出力する反応の分散を分析し、系統的な過信または誇張の兆候を検出した。
  • 実験要因(例:規範違反、因果構造)とモデルの反応との相互作用を分析し、推論パターンの乖離を検出した。
  • 認知科学で一般的に用いられる用語を用いて、LLMの反応を「マシンの直感」の代理として扱ったが、心的状態を仮定しないままとした。

実験結果

リサーチクエスチョン

  • RQ1最先端のLLMは、確立された実験的パラダイムにおいて、人間の道徳的および法的推論をどの程度再現するか?
  • RQ2LLMが出力する反応における効果量は、人間の反応と比較して、特に大きさと分散の観点からどのように異なるか?
  • RQ3異なるLLM間には推論パターンの系統的差異が存在するか? また、それらは人間の直感からどの程度乖離しているか?
  • RQ4LLMは、後知恵バイアスや結果感受性といった人間の認知バイアスを、どのように拡大または歪曲するか?
  • RQ5これらの差異は、心理的研究所における人間参加者の代替としてLLMを使用する上で、どのような意味を持つのか?

主な発見

  • GPT-4は、全研究において人間の反応と最も高い整合性を示し、Gemini Pro、Claude 2.1、Llama 2 Chat 70bを上回った。
  • 人間の判断と高い相関を示したが、応答分散が人間の反応より著しく低く、結果として効果量が誇張された。
  • 特に、結果感受性に関するStudy 5では、応答分散が低いために、LLMは人間のバイアスを拡大し、確率判断において顕著に顕在した。
  • 同じ実験的操作がLLMにおいても顕著な効果をもたらしたが、被験者(例:因果構造)を含む相互作用は、モデル間で異なり、人間のパターンとは乖離していた。
  • Study 6では、Llama 2は人間ほど同意の有効性を認める傾向が著しく低く、独自の道徳的閾値を示した。
  • Study 2では、GPT-4とGemini Proは人間よりも予想される道徳的ステータスに強く一致しており、規範的推論において乖離が生じていることを示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。