Skip to main content
QUICK REVIEW

[论文解读] Towards Contrastive Explanations for Comparing the Ethics of Plans

Benjamin Krarup, Senka Krivić|arXiv (Cornell University)|Jun 22, 2020
Ethics and Social Impacts of AI参考文献 5被引用 5
一句话总结

本文提出了一种对比解释框架,使用户能够通过建议替代行动并评估其道德后果,来比较AI生成计划的伦理可接受性。该框架通过引入假设性规划模型(HModels)扩展了现有的伦理规划模型,利用用户指定的伦理原则生成对比解释,展示了此类解释如何阐明为何某一计划比另一计划更具道德正当性。

ABSTRACT

The development of robotics and AI agents has enabled their wider usage in human surroundings. AI agents are more trusted to make increasingly important decisions with potentially critical outcomes. It is essential to consider the ethical consequences of the decisions made by these systems. In this paper, we present how contrastive explanations can be used for comparing the ethics of plans. We build upon an existing ethical framework to allow users to make suggestions to plans and receive contrastive explanations.

研究动机与目标

  • 通过在上下文中评估整个行动计划的伦理可接受性,来解决孤立评估单一行动的局限性。
  • 使人类审核员能够建议对AI生成计划的伦理改进,并获得关于这些更改如何影响道德可接受性的解释。
  • 开发一个支持对比解释的框架,通过基于用户建议生成假设性计划。
  • 将伦理推理与AI规划相结合,使用形式化的伦理原则,如义务论和后果论理论。
  • 通过提供透明、可解释的伦理计划比较理由,增强用户对AI系统伦理决策的信任。

提出的方法

  • 该方法使用一个规划模型 Π 和由规划器生成的计划 φ,其中用户建议 σ 和伦理原则 ε 共同构成一个解释问题 E = ⟨Π, φ, σ, ε⟩。
  • 通过强制执行用户的建议 σ,将原始规划模型 Π 编译为一个假设性模型 Π′(HModel),以确保新计划包含对比情形。
  • 使用原始规划器求解 HModel,生成一个假设性计划 φ′(HPlan),随后通过与原始模型对比验证其适用性。
  • 伦理解释生成器将原始计划 φ 和 HPlan φ′ 均针对所选伦理原则 ε 进行评估,生成因果解释,如 Bad(lying) 或 ¬Bad(begging)。
  • 从这些评估中综合生成对比解释,突出道德可接受性的差异,例如:'原计划不可接受,因为说谎是错误的,而HPlan可接受,因为乞讨并非错误'。
  • 该系统设计为模块化服务,封装现有规划器,使用户能够利用其信任的规划模型和伦理框架。

实验结果

研究问题

  • RQ1如何利用对比解释来比较AI生成计划的伦理可接受性?
  • RQ2假设性规划模型(HModels)在使用户探索建议的计划修改的伦理影响方面发挥什么作用?
  • RQ3如何将形式化的伦理原则——如义务论规则——整合到规划系统中以评估道德可接受性?
  • RQ4对比解释在哪些方面能够提升用户对AI计划中伦理权衡的理解?
  • RQ5对比解释能否增强用户对AI系统伦理决策能力的信任?

主要发现

  • 该系统成功生成了突出计划与其假设性替代方案之间道德差异的对比解释,例如在《机器人与弗兰克》情境中区分说谎(本质上错误)与乞讨(中性)。
  • 伦理解释生成器生成了形式化的因果解释,如 Bad(lying to Frank) 和 ¬Bad(begging Frank),并将其组合为自然语言的对比陈述。
  • HModel 编译过程确保用户建议被正式编码为约束条件,从而生成反映对比情形的有效假设性计划。
  • 该方法通过支持迭代用户反馈,允许连续编译,使用户能够细化建议并探索多种伦理替代方案。
  • 该框架具有模块化和可扩展性,作为现有规划器的封装器运行,从而保留了用户对其首选规划和伦理模型的信任。
  • 该方法表明,对比解释能够使AI规划中的伦理推理更加透明和易于人类审核员理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。