Skip to main content
QUICK REVIEW

[论文解读] Arguing Machines: Human Supervision of Black Box AI Systems That Make Life-Critical Decisions

Lex Fridman, Li Ding|arXiv (Cornell University)|Oct 12, 2017
Explainable Artificial Intelligence (XAI)被引用 6
一句话总结

本文提出了“arguing machines”框架,将一个主黑箱AI系统与一个独立训练的第二AI系统配对,通过检测两者之间的不一致来识别高风险决策。当不一致程度超过阈值时,触发人工监督,从而降低错误率——在ImageNet上实现了top-5错误率65%的相对降低,并成功预测了特斯拉Autopilot数据中90.4%的具有挑战性的脱离控制事件。

ABSTRACT

We consider the paradigm of a black box AI system that makes life-critical decisions. We propose an "arguing machines" framework that pairs the primary AI system with a secondary one that is independently trained to perform the same task. We show that disagreement between the two systems, without any knowledge of underlying system design or operation, is sufficient to arbitrarily improve the accuracy of the overall decision pipeline given human supervision over disagreements. We demonstrate this system in two applications: (1) an illustrative example of image classification and (2) on large-scale real-world semi-autonomous driving data. For the first application, we apply this framework to image classification achieving a reduction from 8.0% to 2.8% top-5 error on ImageNet. For the second application, we apply this framework to Tesla Autopilot and demonstrate the ability to predict 90.4% of system disengagements that were labeled by human annotators as challenging and needing human supervision.

研究动机与目标

  • 解决在容错空间极小的生命关键应用中部署黑箱AI系统所面临的挑战。
  • 在不访问主AI系统内部架构或训练数据的前提下,降低系统错误率。
  • 开发一种人机协同框架,利用两个独立训练的AI系统之间的不一致作为人工干预的信号。
  • 在具有高风险决策结果的真实半自动驾驶场景中验证该框架。
  • 证明两个不透明系统之间的不一致可作为可靠信号,指示需要人工监督的边缘情况。

提出的方法

  • 在与主黑箱系统相同的任务上独立训练第二个AI系统,不共享数据或架构细节。
  • 通过1秒时间窗口内连续预测的归一化差异函数,度量两个系统输出之间的不一致。
  • 设定预定义阈值δ,当不一致程度超过该水平时触发人工监督。
  • 使用二分类指标——误接受率(FAR)和误拒绝率(FRR),评估不一致检测系统在脱离控制事件上的表现。
  • 在特斯拉Model S上实时部署系统,使用Jetson TX2,支持实时视频输入、神经网络推理及不一致警报的实时显示。
  • 将两个系统的转向预测值归一化至[−1,1]区间,并在30帧(1秒)内累计计算不一致程度,以检测边缘情况。

实验结果

研究问题

  • RQ1两个独立训练的AI系统之间的不一致,能否作为识别高风险、关键生命决策的可靠信号?
  • RQ2这种基于不一致的监督机制,能否在不访问主AI系统内部结构的前提下,有效降低整体系统错误率?
  • RQ3不一致检测在多大程度上能够预测真实世界半自动驾驶中的具有挑战性的脱离控制事件?
  • RQ4不一致阈值δ如何影响人工监督频率与系统错误率之间的权衡?
  • RQ5该框架能否在实时道路环境中实现低延迟、高可靠性的有效部署?

主要发现

  • 在ResNet-50模型上应用“arguing machines”框架后,ImageNet的top-5错误率从8.0%降至2.8%,实现了65%的相对改进。
  • 该系统在特斯拉Autopilot数据中,对人工标注为“棘手”或需要人工监督的脱离控制事件,预测准确率达到90.4%。
  • 最优不一致阈值δ = 10实现了0.096的平均错误率,有效平衡了误接受率与误拒绝率。
  • 实时道路部署从摄像头输入到GUI更新的延迟低于200毫秒,证明了其在动态驾驶环境中的可行性。
  • 在晚间高峰时段测试中,该框架成功检测到多个具有挑战性的驾驶情境,视觉警报显著提升了驾驶员的警觉性。
  • 仅依靠不一致信号,而无需了解模型内部结构,已足以显著提升系统安全性和性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。