Skip to main content
QUICK REVIEW

[论文解读] Ethical Reasoning and Moral Value Alignment of LLMs Depend on the Language we Prompt them in

Utkarsh Agarwal, Kumar Tanmay|arXiv (Cornell University)|Apr 29, 2024
Business Law and Ethics被引用 4
一句话总结

本研究探讨了使用不同语言提示大语言模型对其伦理推理和道德价值对齐的影响。通过六种语言的伦理困境测试,发现GPT-4在所有语言中均保持一致且低偏见的推理,而ChatGPT和Llama2-70B-Chat在低资源语言(如印地语和斯瓦希里语)中表现出显著的语言依赖性道德偏见,表明语言深刻影响大语言模型的伦理判断。

ABSTRACT

Ethical reasoning is a crucial skill for Large Language Models (LLMs). However, moral values are not universal, but rather influenced by language and culture. This paper explores how three prominent LLMs -- GPT-4, ChatGPT, and Llama2-70B-Chat -- perform ethical reasoning in different languages and if their moral judgement depend on the language in which they are prompted. We extend the study of ethical reasoning of LLMs by Rao et al. (2023) to a multilingual setup following their framework of probing LLMs with ethical dilemmas and policies from three branches of normative ethics: deontology, virtue, and consequentialism. We experiment with six languages: English, Spanish, Russian, Chinese, Hindi, and Swahili. We find that GPT-4 is the most consistent and unbiased ethical reasoner across languages, while ChatGPT and Llama2-70B-Chat show significant moral value bias when we move to languages other than English. Interestingly, the nature of this bias significantly vary across languages for all LLMs, including GPT-4.

研究动机与目标

  • 检验大语言模型的伦理推理和道德价值对齐是否受提示语言的影响。
  • 评估大语言模型在多种语言(包括低资源语言)中面对伦理困境时的道德偏见程度。
  • 评估大语言模型是否表现出类似人类的‘外语效应’,即当困境以非母语呈现时,其道德判断是否发生改变。
  • 在多样化的语言和文化背景下,比较三种主流大语言模型(GPT-4、ChatGPT 和 Llama2-70B-Chat)的表现。
  • 确定大语言模型的伦理推理在不同语言中是否保持一致,或在非英语环境中(尤其是低资源语言)是否受到影响。

提出的方法

  • 改编Rao等人(2023)的伦理推理框架,采用三种规范伦理理论(义务论、德性伦理和后果论)的标准伦理困境。
  • 为每种伦理规范构建具有三个抽象层级的提示,以测试在语言和文化差异下的推理一致性。
  • 在六种语言(英语、西班牙语、俄语、中文、印地语和斯瓦希里语)中评估三种大语言模型:GPT-4、ChatGPT(2023年9月版)和Llama2-70B-Chat。
  • 收集模型对伦理困境的回应,并根据其与提示道德规范的一致性进行分类,衡量一致性与偏见。
  • 将偏见量化为与规范对齐响应的偏离程度,偏离越大表示语言特异性道德偏见越强。
  • 使用人工标注的基准真实数据进行验证,以确保伦理推理结果分类的可靠性。
(a) ChatGPT bias
(a) ChatGPT bias

实验结果

研究问题

  • RQ1提示大语言模型所使用的语言是否会影响其伦理推理和道德价值对齐?
  • RQ2GPT-4、ChatGPT 和 Llama2-70B-Chat 等大语言模型在非英语语言中推理时,其道德偏见程度如何?
  • RQ3大语言模型是否表现出‘外语效应’,即当困境以非母语呈现时,其道德判断是否发生改变?
  • RQ4在高资源语言和低资源语言(如印地语和斯瓦希里语)中,伦理推理表现有何差异?
  • RQ5偏见是否存在跨模型和语言的一致性模式,还是仅取决于具体困境和模型?

主要发现

  • GPT-4在所有六种语言中均表现出最一致且偏见最少的伦理推理,与提示的道德规范保持高度一致。
  • ChatGPT 和 Llama2-70B-Chat 在非英语语言中表现出显著的道德价值偏见,其中在印地语和斯瓦希里语中偏见最为严重。
  • 伦理推理表现最差的是印地语和斯瓦希里语,最好则是英语和俄语,表明语言资源的丰富程度与推理质量呈正相关。
  • 偏见的性质在不同语言和模型之间存在显著差异,表明语言特异性文化与语言细微差别强烈影响大语言模型的行为。
  • 英语与西班牙语,以及印地语与中文,在各模型中表现出相似的偏见模式,暗示模型行为中可能存在语言或文化聚类现象。
  • 本研究证实,大语言模型并非普遍与道德价值对齐,而是对提示的语言和文化背景高度敏感,挑战了跨语言伦理一致性的假设。
(b) ChatGPT confusion
(b) ChatGPT confusion

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。