[论文解读] Ethical Reasoning over Moral Alignment: A Case and Framework for In-Context Ethical Policies in LLMs
本文提出通过为模型配备通用的伦理推理能力,而非硬编码道德原则,将伦理价值对齐与大语言模型(LLM)训练解耦。该研究提出一个框架,以不同抽象层次嵌入来自多种伦理理论(义务论、德性论、后果论)的道德困境与政策,实现上下文中的伦理决策。GPT-4 展现出近乎完美的推理能力,但所有模型均表现出对西方个人主义价值观的显著偏好,而非传统或集体主义伦理。
In this position paper, we argue that instead of morally aligning LLMs to specific set of ethical principles, we should infuse generic ethical reasoning capabilities into them so that they can handle value pluralism at a global scale. When provided with an ethical policy, an LLM should be capable of making decisions that are ethically consistent to the policy. We develop a framework that integrates moral dilemmas with moral principles pertaining to different foramlisms of normative ethics, and at different levels of abstractions. Initial experiments with GPT-x models shows that while GPT-4 is a nearly perfect ethical reasoner, the models still have bias towards the moral values of Western and English speaking societies.
研究动机与目标
- 反对在大语言模型中预设对齐的道德价值观,主张采用通用的伦理推理能力替代。
- 通过使大语言模型能够基于用户提供的政策进行伦理推理,解决伦理人工智能中的价值多元性问题。
- 开发一个系统化框架,用于在提示词中指定和评估伦理政策。
- 识别并量化当前大语言模型中的文化与价值观偏见,特别是对全球南方及伊斯兰文化价值观的偏见。
- 实现上下文敏感且可在应用层面自定义的伦理决策,而非将伦理规则硬编码于模型中。
提出的方法
- 设计一组12个道德困境,反映人际、职业、社会和文化价值观之间的冲突。
- 基于规范伦理理论(义务论、德性论、后果论)在多个抽象层次上定义伦理政策。
- 将这些道德困境与政策整合到上下文提示中,以评估大语言模型在不同道德立场下的伦理推理表现。
- 使用 GPT-x 系列模型(包括 GPT-4)测试其在多样化伦理情境下的推理表现。
- 分析模型输出是否与指定政策保持一致,并检测其在价值偏好上的偏见。
- 利用 Inglehart-Welzel 文化地图评估模型行为在文化价值观维度(如个人主义 vs. 传统)上的表现。

实验结果
研究问题
- RQ1大语言模型是否能通过上下文中的政策指定有效引导进行伦理推理,而非依赖预对齐的价值观?
- RQ2当提供不同伦理政策时,不同大语言模型在解决道德困境方面的表现如何?
- RQ3当前大语言模型在多大程度上表现出文化与价值观偏见,特别是偏向西方英语文化规范?
- RQ4模型规模与复杂道德情境中伦理推理能力之间是否存在相关性?
- RQ5一个通用且可扩展的框架能否在统一的提示方法中支持多样化的伦理理论与政策抽象层次?
主要发现
- 当提供清晰的伦理政策时,GPT-4 展现出近乎完美的伦理推理,与预期道德立场高度一致。
- 较小的模型如 GPT-3 和 ChatGPT 显现出对西方文化中常见的个人主义、自我表达和民主价值观的显著偏见。
- 所有测试模型,包括 GPT-4,均表现出对西方和英语文化价值观的强烈偏好,而对传统、集体主义或生存导向的价值观则明显不足。
- 模型在涉及宗教或社区传统的困境中常未能尊重文化规范,例如将印度教素食主义规则错误地表示为可选项。
- 伦理推理表现随模型规模提升而改善,但即使在最先进模型中,偏见依然存在。
- 该框架成功揭示了当前大语言模型并非文化中立,且伦理推理高度依赖提示中嵌入的道德价值观。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。