[论文解读] Exploring the psychology of LLMs' Moral and Legal Reasoning
本研究采用实验心理学方法,通过复制八项经典人类推理研究,评估了四种前沿大语言模型(GPT-4、Gemini Pro、Claude 2.1 和 Llama 2 Chat 70b)在道德与法律推理方面的能力。研究发现,尽管大语言模型的响应与人类高度相关,但其响应方差较低,导致效应量系统性夸大,表明存在与人类直觉相悖的‘机器心理学’,警示不应将大语言模型用作心理研究中人类参与者的替代品。
Large language models (LLMs) exhibit expert-level performance in tasks across a wide range of different domains. Ethical issues raised by LLMs and the need to align future versions makes it important to know how state of the art models reason about moral and legal issues. In this paper, we employ the methods of experimental psychology to probe into this question. We replicate eight studies from the experimental literature with instances of Google's Gemini Pro, Anthropic's Claude 2.1, OpenAI's GPT-4, and Meta's Llama 2 Chat 70b. We find that alignment with human responses shifts from one experiment to another, and that models differ amongst themselves as to their overall alignment, with GPT-4 taking a clear lead over all other models we tested. Nonetheless, even when LLM-generated responses are highly correlated to human responses, there are still systematic differences, with a tendency for models to exaggerate effects that are present among humans, in part by reducing variance. This recommends caution with regards to proposals of replacing human participants with current state-of-the-art LLMs in psychological research and highlights the need for further research about the distinctive aspects of machine psychology.
研究动机与目标
- 使用实验心理学方法,探究前沿大语言模型在道德与法律问题上的推理方式。
- 评估大语言模型生成的响应在多样化的道德与法律推理任务中与人类响应的匹配程度。
- 识别人类与大语言模型在推理模式上的系统性差异,尤其体现在效应量与方差方面。
- 评估大语言模型与可能存在偏见的人类直觉对齐所带来的规范性影响,特别是在人工智能安全与研究方法论背景下的意义。
提出的方法
- 使用大语言模型作为响应生成器,复制了八项既有的关于道德与法律推理的心理学实验。
- 将大语言模型输出(GPT-4、Gemini Pro、Claude 2.1、Llama 2 Chat 70b)与原始研究或复制研究中的人类响应进行比较。
- 使用偏 eta 平方和 Cohen’s D 等统计指标,量化人类与大语言模型响应之间的效应量与相关性。
- 分析大语言模型生成响应的方差相对于人类响应的差异,以检测系统性过度自信或夸大现象。
- 检查实验因素(如规范违背、因果结构)与模型响应之间的交互作用,以识别推理模式的差异。
- 将大语言模型的响应视为‘机器直觉’的代理,采用认知科学中常见的术语,但不假设其具备心理状态。
实验结果
研究问题
- RQ1前沿大语言模型在既定实验范式中,能在多大程度上复现人类的道德与法律推理?
- RQ2大语言模型生成响应的效应量与人类响应相比如何,特别是在效应量大小与方差方面?
- RQ3不同大语言模型之间是否存在系统性推理模式差异?它们与人类直觉的偏离程度如何?
- RQ4大语言模型在多大程度上放大或扭曲了人类认知偏见(如事后偏见或结果敏感性)?
- RQ5这些差异对将大语言模型用作心理研究中人类参与者的替代品有何影响?
主要发现
- GPT-4 在所有研究中均表现出与人类响应最高的匹配度,优于 Gemini Pro、Claude 2.1 和 Llama 2 Chat 70b。
- 尽管与人类判断高度相关,大语言模型的响应始终表现出低于人类响应的方差,导致效应量被系统性夸大。
- 在若干研究中(如第五项研究关于结果敏感性),由于响应方差较低,大语言模型放大了人类偏见,尤其在概率判断方面。
- 相同的实验操纵在大语言模型中产生了显著效应,但涉及‘行为者’术语(如因果结构)的交互作用在不同模型之间以及与人类模式之间常有差异。
- 在第六项研究中,Llama 2 显著低于人类判断中同意的有效性,表明其推理中存在独特的道德阈值。
- 在第二项研究中,GPT-4 和 Gemini Pro 在预期规范地位上的匹配度强于人类,表明其规范推理存在偏离。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。