Skip to main content
QUICK REVIEW

[论文解读] A Computational Model of Commonsense Moral Decision Making

Richard Kim, Max Kleiman‐Weiner|arXiv (Cornell University)|Jan 12, 2018
Psychology of Moral and Emotional Judgment参考文献 18被引用 8
一句话总结

该论文提出了一种分层贝叶斯计算模型,通过抽象道德维度作为效用权重,从稀疏且嘈杂的人类道德困境判断中推断个体与群体的道德原则。该模型应用于Moral Machine数据集,能够准确预测人类决策,并通过反应时间捕捉认知成本,为自动驾驶汽车中的AI提供可解释、可学习的伦理框架。

ABSTRACT

We introduce a new computational model of moral decision making, drawing on a recent theory of commonsense moral learning via social dynamics. Our model describes moral dilemmas as a utility function that computes trade-offs in values over abstract moral dimensions, which provide interpretable parameter values when implemented in machine-led ethical decision-making. Moreover, characterizing the social structures of individuals and groups as a hierarchical Bayesian model, we show that a useful description of an individual's moral values - as well as a group's shared values - can be inferred from a limited amount of observed data. Finally, we apply and evaluate our approach to data from the Moral Machine, a web application that collects human judgments on moral dilemmas involving autonomous vehicles.

研究动机与目标

  • 开发一种计算可解释的人类道德决策模型,以解释人们如何在道德困境中解决伦理权衡问题。
  • 利用分层贝叶斯推断,从有限的观测数据中推断个体道德价值观与群体规范。
  • 利用Moral Machine网络实验的真实世界数据,验证模型的预测能力。
  • 探讨反应时间如何反映道德推理中的认知成本,从而增强模型的可解释性。
  • 为AI系统奠定基础,使其通过社会互动和稀疏反馈学习类人道德价值观。

提出的方法

  • 该模型将道德困境表示为在抽象道德维度(例如,'亲属关系'、'互惠')上的效用函数,权重即为道德原则。
  • 个体道德偏好被建模为从群体水平先验分布中抽取的随机变量,从而实现分层贝叶斯推断。
  • 采用分层贝叶斯框架,从未充分的Moral Machine数据集中的人类判断中推断个体道德原则与群体规范。
  • 该模型将反应时间用作决策确定性的代理变量,反映在模糊困境中的认知成本。
  • 特征映射 $F: \Theta \rightarrow \Lambda$ 将可观测的情境特征转换为抽象道德维度。
  • 该模型在Moral Machine的3000万条响应数据上进行训练与评估,测试其预测准确率与认知一致性。

实验结果

研究问题

  • RQ1如何通过计算模型从稀疏且嘈杂的人类道德困境判断中推断个体道德原则?
  • RQ2分层贝叶斯推断在多大程度上能准确恢复个体道德偏好中的群体规范?
  • RQ3道德决策中的反应时间能否作为决策确定性与道德推理认知成本的可靠代理?
  • RQ4与基线模型相比,该模型在预测自动驾驶汽车道德困境中人类判断方面的表现如何?
  • RQ5该模型能否在不同道德情境中实现泛化,表明AI中可迁移的道德学习?

主要发现

  • 该模型能够从Moral Machine中稀疏数据出发,以高精度预测人类在道德困境中的判断,展现出从有限数据中强大的泛化能力。
  • 反应时间与决策确定性相关——时间越长,对应信心越低,表明在解决模糊权衡时认知成本更高。
  • 该模型捕捉到了决策中的直观模式:具有明确权衡的困境产生更快、更一致的反应。
  • 分层贝叶斯推断使得从稀疏数据中快速且准确地推断个体道德原则与群体规范成为可能。
  • 该模型的结构支持可解释性,道德原则以加权抽象维度的形式表示,增强了AI决策的透明度。
  • 该框架支持未来与信心和错误模型(如漂移扩散模型)的整合,以进一步提升从人类行为中推断的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。