Skip to main content
QUICK REVIEW

[论文解读] Estimating the Brittleness of AI: Safety Integrity Levels and the Need for Testing Out-Of-Distribution Performance

Andrew J. Lohn|arXiv (Cornell University)|Sep 1, 2020
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文认为,人工智能系统,尤其是深度神经网络,其脆弱性远高于航空、核能或汽车等安全关键领域的系统,在其预期分布范围内,其故障率也高出数个数量级。本文提出为分布外(OOD)性能引入安全完整性等级(SILs),并主张在分布内测试之外,系统性地评估人工智能的鲁棒性,以实现高风险应用中的认证。

ABSTRACT

Test, Evaluation, Verification, and Validation (TEVV) for Artificial Intelligence (AI) is a challenge that threatens to limit the economic and societal rewards that AI researchers have devoted themselves to producing. A central task of TEVV for AI is estimating brittleness, where brittleness implies that the system functions well within some bounds and poorly outside of those bounds. This paper argues that neither of those criteria are certain of Deep Neural Networks. First, highly touted AI successes (eg. image classification and speech recognition) are orders of magnitude more failure-prone than are typically certified in critical systems even within design bounds (perfectly in-distribution sampling). Second, performance falls off only gradually as inputs become further Out-Of-Distribution (OOD). Enhanced emphasis is needed on designing systems that are resilient despite failure-prone AI components as well as on evaluating and improving OOD performance in order to get AI to where it can clear the challenging hurdles of TEVV and certification.

研究动机与目标

  • 识别当前人工智能可靠性与航空、核能及汽车控制等关键系统所要求的严格安全标准之间的不匹配。
  • 证明即使在最先进人工智能模型(如图像分类、语音识别)的分布内性能,其可靠性也远低于安全关键领域中经认证的软件。
  • 指出人工智能系统在分布外条件下并非发生灾难性崩溃,而是逐渐退化,从而挑战了故障边界为“尖锐”的假设。
  • 提出一种基于其分布外性能的框架,为人工智能组件分配安全完整性等级(SILs),包括对分布偏离的定性和定量度量。
  • 强调需要系统性地开展分布外测试与性能评估,以支持高风险应用中的认证与部署。

提出的方法

  • 将最先进人工智能模型(如Deep Speech 2、图像分类器)的故障率与航空器和核电厂等安全关键系统中既定的可靠性阈值进行比较。
  • 使用词错误率(WER)和分类准确率等定量指标,评估模型在分布内与逐步偏离分布的数据分布下的性能。
  • 引入定性分布外严重程度等级——分布内、近分布、部分分布外、远分布外、极远分布外——以对安全评估中的分布偏移进行分类。
  • 建议使用统计距离(如Kullback-Leibler散度、马氏距离)来量化分布偏离,尽管承认定性评估可能更具实用性。
  • 将传统SIL框架(如汽车ASIL中所用)扩展至包含分布外性能要求,将故障率与分布外遭遇的频率和严重性关联。
  • 倡导使用真实和人工生成的分布外样本,以实证估计模型在分布偏移下的鲁棒性。

实验结果

研究问题

  • RQ1即使在分布内条件下,最先进人工智能模型的故障率与安全关键系统所要求的可靠性阈值相比如何?
  • RQ2当暴露于逐步偏离分布的输入时,人工智能性能退化是平滑而非突然的,其程度如何?
  • RQ3定性或概念性的分布外严重程度等级(如近分布、远分布外)能否有意义地用于定义人工智能组件的安全完整性等级?
  • RQ4在现实部署场景中,估计分布外输入的频率和严重性的最有效指标与方法是什么?
  • RQ5现有认证框架如何能被调整以纳入关键应用中人工智能系统的分布外性能评估?

主要发现

  • 最先进的人工智能模型(如Deep Speech 2和图像分类器)即使在完全分布内的测试数据上,其故障率也远高于经认证的安全关键系统所接受的水平,高出数个数量级。
  • 在最分布内的测试集上,Deep Speech 2的词错误率(WER)低于10%——表现令人印象深刻,但仍显著高于安全关键软件中典型的亚0.1%故障阈值。
  • 在分布外输入(如带有口音的语音、嘈杂音频、失真图像)上的性能退化是渐进的,且与人类表现的退化幅度相当,而非灾难性崩溃。
  • 在最具挑战性的分布外分布(如重口音、高噪声)中,人类的表现优于人工智能,表明人工智能在分布偏移下的鲁棒性低于人类。
  • 研究发现,分布外性能退化呈现出平滑且可预测的下降趋势,表明人工智能系统在训练分布之外仍能保持部分功能。
  • 作者得出结论:必须系统性地评估分布外性能,且需要引入包含分布外鲁棒性的新型SIL框架,以实现关键系统中人工智能的认证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。