[论文解读] Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories?
本文提出一种理论引导的自上而下框架,通过使用广受认可的道德理论(如TDM、功利主义和义务论)来引导大型语言模型(LLMs)进行可解释的道德推理。实验表明,LLMs能够有效遵循并应用这些理论,在常识道德基准测试中达到最高87.5%的准确率和96.8%的召回率,同时通过深入的错位分析揭示了数据集的局限性及模型推理中的缺陷。
Making moral judgments is an essential step toward developing ethical AI systems. Prevalent approaches are mostly implemented in a bottom-up manner, which uses a large set of annotated data to train models based on crowd-sourced opinions about morality. These approaches have been criticized for overgeneralizing the moral stances of a limited group of annotators and lacking explainability. This work proposes a flexible top-down framework to steer (Large) Language Models (LMs) to perform moral reasoning with well-established moral theories from interdisciplinary research. The theory-guided top-down framework can incorporate various moral theories. Our experiments demonstrate the effectiveness of the proposed framework on datasets derived from moral theories. Furthermore, we show the alignment between different moral theories and existing morality datasets. Our analysis exhibits the potential and flaws in existing resources (models and datasets) in developing explainable moral judgment-making systems.
研究动机与目标
- 解决依赖有偏见且不可解释的众包标注的自下而上道德判断系统所存在的局限性。
- 探究LLMs是否能够理解并遵循既定的道德理论,以实现基于原则的道德推理。
- 评估理论引导的LLMs在常识道德数据集上的表现,并与现有自下而上的方法进行比较。
- 识别并分析理论引导的LLM输出与人类标注标签之间错位的根源。
- 揭示当前数据集和模型推理中的缺陷,以指导未来透明、理论基础坚实的伦理AI系统的发展。
提出的方法
- 设计了一种灵活的提示框架,通过明确的道德理论(如TDM、功利主义、义务论和正义论)来引导GPT-4。
- 该框架基于每种道德理论的原则,引导LLMs进行分步推理,从而增强透明度和可解释性。
- 该方法应用特定于理论的指令,生成对情景的道德判断,确保与规范性伦理框架保持一致。
- 在源自道德理论的数据集(如Hendrycks et al. 2021)和常识道德基准测试(如Forbes et al. 2020)上开展实验。
- 进行系统性的错位分析,将差异分为四类:数据标注缺陷(Data-(a))、上下文不足(Data-(b))、LLM推理错误(LLM-(c))以及对风险的高估(LLM-(d))。
- 通过人工检查和分类错位案例,评估模型行为与数据集质量。
实验结果
研究问题
- RQ1当通过特定于理论的指令引导时,LLMs是否能够理解并遵循既定的道德理论?
- RQ2在常识情景的道德判断任务中,哪种道德理论能带来最佳表现?
- RQ3理论引导的LLM输出与现有自下而上的道德数据集之间错位的原因是什么?
- RQ4数据集标注和上下文的缺陷如何影响LLM的道德推理?
- RQ5在道德理论引导下,LLMs在道德推理中的主要失效模式是什么?
主要发现
- 由TDM(二元道德理论)引导的LLM在E-CM(H)基准测试中达到最高性能,准确率为87.5%,召回率为96.8%。
- 在功利主义任务中,最大的错位来源(78%)源于数据集标注缺陷,特别是当情景被标记为更令人愉悦但缺乏明确理由时。
- 在39%的功利主义错位案例中,LLM正确拒绝将某一情景标记为更愉悦,表明其识别出标注缺陷。
- LLM识别出24%的错位案例源于上下文不足,即情景缺乏进行合理道德评估所必需的叙事或关系细节。
- 在复杂情景中,错误的道德推理(LLM-(c))导致19%的额外错位,尤其当模型关注错误的主体或次要细节时。
- LLM对低概率风险存在过度反应(LLM-(d)),因推测性伤害(如在后院打棒球可能导致身体受伤)而将无害情景标记为不道德。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。