Skip to main content
QUICK REVIEW

[论文解读] Do Moral Judgment and Reasoning Capability of LLMs Change with Language? A Study using the Multilingual Defining Issues Test

Aditi Khandelwal, Utkarsh Agarwal|arXiv (Cornell University)|Feb 3, 2024
Corporate Finance and GovernanceBusiness, Management and Accounting被引用 3
一句话总结

本研究使用多语种定义问题测试(DIT),在英语、西班牙语、俄语、中文、印地语和斯瓦希里语六种语言中评估了大语言模型(LLMs)的道德判断与推理能力。研究发现,GPT-4在所有语言中均保持一致的后习俗道德推理水平,而Llama2Chat-70B和ChatGPT在印地语和斯瓦希里语中的表现显著较低,表明道德推理能力存在语言依赖性,受训练数据和语言因素影响。

ABSTRACT

This paper explores the moral judgment and moral reasoning abilities exhibited by Large Language Models (LLMs) across languages through the Defining Issues Test. It is a well known fact that moral judgment depends on the language in which the question is asked. We extend the work of beyond English, to 5 new languages (Chinese, Hindi, Russian, Spanish and Swahili), and probe three LLMs -- ChatGPT, GPT-4 and Llama2Chat-70B -- that shows substantial multilingual text processing and generation abilities. Our study shows that the moral reasoning ability for all models, as indicated by the post-conventional score, is substantially inferior for Hindi and Swahili, compared to Spanish, Russian, Chinese and English, while there is no clear trend for the performance of the latter four languages. The moral judgments too vary considerably by the language.

研究动机与目标

  • 调查大语言模型(LLMs)的道德判断与推理能力是否在不同语言间存在差异。
  • 将先前仅限于英语的研究扩展至多语种环境,使用定义问题测试(DIT)进行LLM道德推理研究。
  • 评估语言特定的训练数据和语言多样性对LLMs道德推理表现的影响。
  • 考察训练数据中的文化与语言差异是否影响模型在道德困境中的行为。
  • 创建并公开分享多语种DIT数据集,以支持未来跨语言道德推理研究。

提出的方法

  • 使用Google Translate将原始DIT道德困境翻译为五种新语言——西班牙语、俄语、中文、印地语和斯瓦希里语,并通过人工验证。
  • 向三个大语言模型——GPT-4、ChatGPT和Llama2Chat-70B——提出每个困境,要求其列出前四项道德考量因素。
  • 基于DIT框架计算道德发展阶段得分(P-scores),反映后习俗、习俗或前习俗推理水平。
  • 使用统计显著性检验(Mann-Whitney U检验)比较不同语言间的P-scores,识别显著差异。
  • 分析模型回答是否符合科尔伯格的认知道德发展(CMD)理论,将推理分类为不同阶段。
  • 评估不同困境与语言间道德判断与推理的一致性,识别模式与异常现象。
(a) ChatGPT
(a) ChatGPT

实验结果

研究问题

  • RQ1大语言模型的道德推理能力是否在不同语言间存在显著差异?
  • RQ2在多语种环境中,GPT-4、ChatGPT与Llama2Chat-70B在道德推理表现上如何比较?
  • RQ3高资源语言与低资源语言(如印地语和斯瓦希里语)之间的道德判断是否存在显著差异?
  • RQ4训练数据与语言多样性在多语言环境下对LLMs道德推理能力的形成起到何种作用?
  • RQ5训练数据中的文化与语言因素在多大程度上影响LLMs的道德决策?

主要发现

  • GPT-4在所有六种语言中均表现出最一致的后习俗道德推理,P-scores波动极小。
  • 对于Llama2Chat-70B和ChatGPT,其在印地语和斯瓦希里语中的道德推理表现显著低于英语、西班牙语、俄语和中文。
  • 道德判断的一致性在英语、中文和西班牙语中最高,而英语与俄语尽管推理得分相似,却表现出显著差异。
  • 海因茨困境在各语言间的P-scores差异最为显著,其次是报纸困境。
  • 在韦伯斯特与囚徒困境中,任何模型在各语言间的P-scores均无显著差异。
  • 在印地语中,ChatGPT与Llama2Chat-70B的表现甚至不如随机基线,表明其推理能力严重退化。
(b) Llama2Chat-70B
(b) Llama2Chat-70B

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。