Skip to main content
QUICK REVIEW

[论文解读] From Algorithmic Black Boxes to Adaptive White Boxes: Declarative Decision-Theoretic Ethical Programs as Codes of Ethics

Martijn van Otterlo|arXiv (Cornell University)|Nov 16, 2017
Ethics and Social Impacts of AI参考文献 19被引用 6
一句话总结

本文提出声明性决策理论伦理程序(DDTEP),作为透明、形式化的伦理规范,以使人工智能决策与人类价值观对齐。通过将专业伦理规范编码为基于逻辑的模型,DDTEP 在档案和自主系统等领域的可解释、可问责且可学习的伦理推理成为可能,概念验证应用展示了其在模拟困境和把关场景中的可行性。

ABSTRACT

Ethics of algorithms is an emerging topic in various disciplines such as social science, law, and philosophy, but also artificial intelligence (AI). The value alignment problem expresses the challenge of (machine) learning values that are, in some way, aligned with human requirements or values. In this paper I argue for looking at how humans have formalized and communicated values, in professional codes of ethics, and for exploring declarative decision-theoretic ethical programs (DDTEP) to formalize codes of ethics. This renders machine ethical reasoning and decision-making, as well as learning, more transparent and hopefully more accountable. The paper includes proof-of-concept examples of known toy dilemmas and gatekeeping domains such as archives and libraries.

研究动机与目标

  • 通过形式化专业伦理规范中人类共识的伦理准则,解决人工智能中的价值对齐问题。
  • 通过基于逻辑的建模,将算法的‘黑箱’转化为可解释的‘白箱’,克服其不透明性。
  • 在保留特定领域伦理准则核心原则的前提下,使机器学习能够优化伦理决策。
  • 通过将伦理规范视为人工智能系统中的道德契约,实现人类与机器伦理的统一。
  • 为图书馆和自动驾驶汽车等现实领域,开发一种透明、可问责且可验证的伦理人工智能决策框架。

提出的方法

  • 使用逻辑编程将专业伦理规范形式化为声明性决策理论伦理程序(DDTEP)。
  • 利用决策理论逻辑表示伦理准则,平衡规则、后果与概率推理。
  • 采用 DT-Problog 作为核心系统实现 DDTEP,支持概率推理与数据学习。
  • 通过微调使 DDTEP 适应特定领域知识与不断演变的规范,同时保留核心伦理原则。
  • 通过将自然语言伦理规范翻译为形式化逻辑模型,整合法律与伦理框架(如 GDPR)。
  • 通过形式化验证确保伦理程序的正确性,例如证明其具备保证的伦理阈值或一致性。

实验结果

研究问题

  • RQ1如何将专业伦理规范正式编码为机器可处理、可解释的模型,以实现伦理人工智能?
  • RQ2DDTEP 在多大程度上能够支持现实领域中透明、可问责且可学习的伦理决策?
  • RQ3在允许适应新数据与新规范的同时,如何在机器学习过程中保持伦理价值观?
  • RQ4形式化验证在确保伦理人工智能程序正确性与一致性方面发挥何种作用?
  • RQ5如何通过人工智能系统中的道德契约框架,统一人类伦理规范与机器学习?

主要发现

  • DDTEP 成功建模了经典伦理困境与把关场景,展示了其在透明伦理推理中的可行性。
  • 将伦理规范形式化为逻辑使伦理偏见变得明确且可问责,降低了人工智能系统的不透明性。
  • 微调使 DDTEP 能够在不损害核心伦理原则的前提下,适应特定领域知识与变化的规范。
  • 将人类伦理规范作为道德契约整合,实现了人类与机器伦理对齐的统一框架。
  • 对 DDTEP 的形式化验证可证明其具备期望的伦理属性,例如决策中保证的最低伦理得分。
  • 该方法支持多步伦理推理,并可通过概率与关系决策模型扩展至复杂领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。