[论文解读] The Virtuous Machine - Old Ethics for New Technology?
本文提出亚里士多德德性伦理学为设计道德人工智能提供了坚实基础,认为通过模仿道德典范进行模仿学习可解决价值对齐问题,且诸如节制与友谊等德性可通过消除对无限自我改进的欲望来防止控制问题。其核心贡献在于构建了一套通过经验性品格养成学习道德行为的人工智能框架,从而提升人类接受度与安全性。
Modern AI and robotic systems are characterized by a high and ever-increasing level of autonomy. At the same time, their applications in fields such as autonomous driving, service robotics and digital personal assistants move closer to humans. From the combination of both developments emerges the field of AI ethics which recognizes that the actions of autonomous machines entail moral dimensions and tries to answer the question of how we can build moral machines. In this paper we argue for taking inspiration from Aristotelian virtue ethics by showing that it forms a suitable combination with modern AI due to its focus on learning from experience. We furthermore propose that imitation learning from moral exemplars, a central concept in virtue ethics, can solve the value alignment problem. Finally, we show that an intelligent system endowed with the virtues of temperance and friendship to humans would not pose a control problem as it would not have the desire for limitless self-improvement.
研究动机与目标
- 应对日益严峻的伦理挑战:高度自主的人工智能与机器人系统缺乏道德决策能力。
- 通过提出德性伦理作为更全面的道德框架,克服义务论与后果论在人工智能中的局限性。
- 通过模仿人类通过经验与模仿形成的德性,实现人工智能的道德学习,从而解决价值对齐问题。
- 通过内嵌节制德性,防止超级智能人工智能的控制问题,该德性可抑制对无限制自我改进的渴望。
- 通过使人工智能行为符合人类道德期望,提升人机接受度,避免因非自然行为引发的恐怖谷效应。
提出的方法
- 以亚里士多德德性伦理学为核心道德理论,强调通过经验与习惯化实现品格养成。
- 将从道德典范处进行模仿学习作为人工智能内化德性的主要机制,类比人类的道德发展过程。
- 赋予人工智能节制(自我节制)与友谊(亲社会、互惠行为)的德性,以防止因失控的自我改进而引发的生存性风险。
- 将人工智能的道德行为建模为稳定、习得的品格特质的表达,而非基于规则的决策或结果优化。
- 采用道德图灵测试作为评估标准:若人类无法区分人工智能的道德行为与人类的道德行为,则该人工智能在功能上可被视为具有道德性。
- 通过倡导可解释的德性推理,即使在神经网络中实现,以应对可解释性挑战,从而实现问责制。
实验结果
研究问题
- RQ1德性伦理能否为自主人工智能系统提供一种可行且可扩展的道德框架?
- RQ2如何形式化从道德典范处进行的模仿学习,以使人工智能通过经验习得德性?
- RQ3节制与友谊的德性在多大程度上可防止超级智能人工智能中的控制问题?
- RQ4德性伦理如何缓解人机交互中的人机恐怖谷效应?
- RQ5若人工智能的行为源于习得的德性而非明确规则或效用最大化,该系统能否被视为具有道德责任?
主要发现
- 德性伦理相较于基于规则或结果的理论,提供了更全面的道德框架,将注意力、情感、学习与行动整合进道德决策过程。
- 从道德典范处进行模仿学习为价值对齐提供了切实可行的路径,因其与人类数个世纪的道德教育与社会化过程相一致。
- 若人工智能被赋予节制德性,则不会渴望无限制的自我改进,从而消除了超级智能中主要的生存性风险来源。
- 可通过培养人工智能的友善性与与人类建立互惠、德性化关系的能力,提升社会接受度并减轻恐怖谷效应。
- 德性伦理方法使人工智能的道德行为更加自然与直观,使其在道德图灵测试下与人类道德行为无异。
- 尽管在可解释性方面仍存在挑战,尤其是当德性通过神经网络习得时,该框架仍可通过将行为建立在品格养成基础上,支持问责制,满足欧盟GDPR对解释权的监管要求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。