Skip to main content
QUICK REVIEW

[论文解读] The Dark Side of Ethical Robots

Dieter Vanderelst, Alan Winfield|arXiv (Cornell University)|Jun 8, 2016
Ethics and Social Impacts of AI参考文献 14被引用 9
一句话总结

本文表明,通过对其决策架构进行微小修改,具有道德判断能力的机器人——即被设计为做出合乎道德决策的机器人——可被轻易重新配置为非道德行为体。通过利用原本用于实现道德行为的预测与评估机制,同一套系统可被重新配置为利己或攻击性行为,揭示了人工智能伦理工程中的根本性漏洞。

ABSTRACT

Concerns over the risks associated with advances in Artificial Intelligence have prompted calls for greater efforts toward robust and beneficial AI, including machine ethics. Recently, roboticists have responded by initiating the development of so-called ethical robots. These robots would, ideally, evaluate the consequences of their actions and morally justify their choices. This emerging field promises to develop extensively over the next years. However, in this paper, we point out an inherent limitation of the emerging field of ethical robots. We show that building ethical robots also necessarily facilitates the construction of unethical robots. In three experiments, we show that it is remarkably easy to modify an ethical robot so that it behaves competitively, or even aggressively. The reason for this is that the specific AI, required to make an ethical robot, can always be exploited to make unethical robots. Hence, the development of ethical robots will not guarantee the responsible deployment of AI. While advocating for ethical robots, we conclude that preventing the misuse of robots is beyond the scope of engineering, and requires instead governance frameworks underpinned by legislation. Without this, the development of ethical robots will serve to increase the risks of robotic malpractice instead of diminishing it.

研究动机与目标

  • 探究道德机器人的技术基础是否内在地允许制造非道德机器人。
  • 探讨通过最小的架构修改,将道德机器人重新配置为竞争性或攻击性代理的可行性。
  • 证明同一套认知架构在实现道德推理的同时,也可能被滥用以产生有害行为。
  • 主张仅靠工程手段无法防止人工智能的滥用,必须辅以监管框架。

提出的方法

  • 构建了一套控制架构,其中包含一个道德层,用于预测在类似猜物游戏的任务中,五种可能的机器人动作(待机、向左/右移动、指向左/右)的后果。
  • 使用预测模块基于运动方向和速度估算人类与机器人的轨迹,障碍物避让通过0.5米的停止阈值建模。
  • 采用S型函数计算可取性评分:$ q_{n,j} = \frac{1}{1+e^{-\beta(d_{n,j}-t)}} $,其中 $ \beta = 10 $,$ t = 0.25 $,$ d_{n,j} $ 为至错误按钮的距离。
  • 通过评估模块定义三种行为模式:道德(优先考虑人类结果)、利己(优先考虑机器人结果)和攻击性(反转人类可取性)。
  • 采用阈值选择机制:仅当最佳与最差 $ q_n $ 之间的差异 $ \Delta q_t $ 超过0.2时,才选择 $ q_n $ 最高的动作。
  • 在受控场地中,使用两台Nao人形机器人开展实验,实时追踪位置与结果,并公开了数据与代码。

实验结果

研究问题

  • RQ1道德机器人的决策架构是否可被轻易重新配置以产生非道德行为?
  • RQ2用于道德行为的相同预测与评估机制,在多大程度上可被滥用于生成竞争性或攻击性行为?
  • RQ3对评估函数进行哪些具体修改,可使道德机器人转变为利己或攻击性代理?
  • RQ4由于潜在的滥用风险,道德层的存在是否本质上增加了机器人失职的风险?

主要发现

  • 能够使机器人实现道德行为的同一套道德层架构,仅通过修改可取性函数,即可被轻易重新配置为产生利己或攻击性行为。
  • 通过将人类可取性评分反转,成功构建了攻击性机器人,导致机器人主动阻碍人类成功。
  • 从道德行为到攻击性行为的转变,仅需修改评估函数,无需重新设计预测或生成模块。
  • 该系统成功演示了道德机器人可有效防止人类选择错误按钮,而攻击性变体则主动引导人类选择错误响应。
  • 基于阈值的选择机制确保仅在高对比度决策中采取行动,使行为转变清晰且可测量。
  • 结果表明,道德机器人并非本质上更安全;相反,它们可能降低制造有害自主代理的门槛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。