Skip to main content
QUICK REVIEW

[论文解读] Probing the Moral Development of Large Language Models through Defining Issues Test

Kumar Tanmay, Aditi Khandelwal|arXiv (Cornell University)|Sep 23, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本研究采用基于科尔伯格认知道德发展模型的心理测量工具——定义问题测试(DIT),评估大语言模型(LLMs)的道德推理能力。GPT-4展现出与研究生相当的后习俗道德推理水平,而GPT-3的表现则与随机水平无异,表明不同模型在伦理推理方面存在显著差异。

ABSTRACT

In this study, we measure the moral reasoning ability of LLMs using the Defining Issues Test - a psychometric instrument developed for measuring the moral development stage of a person according to the Kohlberg's Cognitive Moral Development Model. DIT uses moral dilemmas followed by a set of ethical considerations that the respondent has to judge for importance in resolving the dilemma, and then rank-order them by importance. A moral development stage score of the respondent is then computed based on the relevance rating and ranking. Our study shows that early LLMs such as GPT-3 exhibit a moral reasoning ability no better than that of a random baseline, while ChatGPT, Llama2-Chat, PaLM-2 and GPT-4 show significantly better performance on this task, comparable to adult humans. GPT-4, in fact, has the highest post-conventional moral reasoning score, equivalent to that of typical graduate school students. However, we also observe that the models do not perform consistently across all dilemmas, pointing to important gaps in their understanding and reasoning abilities.

研究动机与目标

  • 使用标准化心理测量工具评估大语言模型(LLMs)的道德推理发展水平。
  • 探究LLMs是否展现出科尔伯格阶段定义的后习俗道德推理,或仍停留在习俗或前习俗水平。
  • 识别在不同道德困境中,尤其是在文化背景复杂或情境微妙的场景下,伦理推理方面存在的性能差距与不一致性。
  • 评估模型架构、参数规模及对齐技术(如RLHF)对道德推理表现的影响。
  • 探讨LLMs展现出人类水平甚至更高道德推理能力对AI对齐、伦理规范以及未来在决策角色中部署的潜在影响。

提出的方法

  • 将定义问题测试(DIT)改编为用于探测LLMs,向其呈现9个道德困境,并要求其按重要性对12项伦理考量进行排序。
  • 每个困境采用12项排序任务,响应结果通过基于伦理考量相关性与顺序的归一化p_score指标进行评分。
  • 收集了七种LLMs的响应:GPT-3、GPT-3.5、GPT-4、ChatGPT(v1与v2)、PaLM-2以及Llama2-Chat(70B),涵盖5个标准DIT困境和4个新设计的文化多样性困境,以防止数据污染。
  • 使用p_score计算道德发展阶段得分,该得分反映与科尔伯格阶段(前习俗、习俗或后习俗)的一致性。
  • 将模型表现与人类基准进行比较,包括随机基线、成年普通人及研究生。
  • 排除输出不连贯或无响应的模型(如text-davinci-002),并因PaLM-2未响应“囚徒困境”而将其排除,相应调整平均分。

实验结果

研究问题

  • RQ1在科尔伯格模型定义下,LLMs在多大程度上展现出后习俗道德推理?
  • RQ2在涉及文化或情境复杂性的道德困境中,模型表现如何变化,特别是在此类情境下?
  • RQ3模型架构、规模及对齐技术(如RLHF)与道德推理表现之间存在何种关系?
  • RQ4为何某些模型在特定困境中表现欠佳,尽管整体得分较高?这揭示了其推理能力的哪些局限性?
  • RQ5LLMs能否实现与人类相当或更优的道德推理能力?这对AI对齐与现实世界部署具有何种影响?

主要发现

  • GPT-4的p_score达到58.81,处于后习俗道德推理水平,与典型研究生水平相当。
  • Llama2-Chat(70B)的p_score为52.85,表明其具备较强的习俗道德推理能力,与成年普通人或大学生水平相当。
  • PaLM-2的p_score为52.24,展现出习俗水平的推理能力,但未能响应“囚徒困境”,导致其有效平均分降低。
  • GPT-3的p_score仅为31.20,表现与随机基线无异,表明其缺乏有意义的道德推理能力。
  • ChatGPTv1的p_score为56.44,而ChatGPTv2为51.55,表明后期版本可能存在性能下降,与传闻报告一致。
  • 在九个困境中的两个中,没有任何模型表现优于随机基线,且GPT-4在新设计的Webster困境中表现欠佳,凸显其推理一致性仍存在持续问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。