Skip to main content
QUICK REVIEW

[论文解读] A Critical Evaluation of Open-World Machine Learning

Liwei Song, Vikash Sehwag|arXiv (Cornell University)|Jul 8, 2020
Adversarial Robustness in Machine Learning参考文献 15被引用 8
一句话总结

本文通过在多种条件下测试六种最先进的分布外(OOD)检测器的鲁棒性,对开放世界机器学习系统进行了批判性评估,包括损坏的和对抗性的OOD输入。结果表明,检测器性能严重下降——在对抗性扰动下,误报率超过70%,甚至达到100%;而对抗性训练虽能提升鲁棒性,却会损害OOD检测能力,揭示了鲁棒性与异常检测能力之间的一种新权衡。

ABSTRACT

Open-world machine learning (ML) combines closed-world models trained on in-distribution data with out-of-distribution (OOD) detectors, which aim to detect and reject OOD inputs. Previous works on open-world ML systems usually fail to test their reliability under diverse, and possibly adversarial conditions. Therefore, in this paper, we seek to understand how resilient are state-of-the-art open-world ML systems to changes in system components? With our evaluation across 6 OOD detectors, we find that the choice of in-distribution data, model architecture and OOD data have a strong impact on OOD detection performance, inducing false positive rates in excess of $70\%$. We further show that OOD inputs with 22 unintentional corruptions or adversarial perturbations render open-world ML systems unusable with false positive rates of up to $100\%$. To increase the resilience of open-world ML, we combine robust classifiers with OOD detection techniques and uncover a new trade-off between OOD detection and robustness.

研究动机与目标

  • 评估在非理想条件(如损坏或对抗性扰动的OOD数据)下开放世界机器学习系统的可靠性与鲁棒性。
  • 研究分布内数据、模型架构和OOD数据的变化对OOD检测性能的影响。
  • 评估对抗性训练在提升鲁棒性的同时是否能保持OOD检测能力的有效性。
  • 揭示并分析在结合对抗性训练与OOD检测时,鲁棒性与OOD检测能力之间存在的新权衡。

提出的方法

  • 在统一的实验设置下评估六种SOTA OOD检测器——ODIN、Network Agnostophobia、Mahalanobis Detector、Autoencoder Detector、Deep-SVDD和Outlier Exposure。
  • 通过改变分布内数据(如CIFAR-10、SVHN)、OOD数据集(如ImageNet、MNIST、CIFAR-100)和模型架构(如WRN-28-10、ResNet-28-10)来评估其敏感性。
  • 通过将PGD攻击适配为生成可逃避OOD检测但保持OOD特性的OOD对抗样本,引入并应用OOD对抗性样本。
  • 应用对抗性训练(PGD,L∞=8)以增强分类器的鲁棒性,并评估其对OOD检测性能的影响。
  • 使用t-SNE可视化比较自然训练与对抗性训练模型的特征表示,发现类别分离性降低。
  • 采用FPR(误报率)和OW-TSR(OOD-World真阳性率)作为关键指标,量化检测失败与攻击成功率。

实验结果

研究问题

  • RQ1分布内数据、OOD数据和模型架构的变化如何影响OOD检测性能?
  • RQ2数据损坏和对抗性扰动对OOD检测器可靠性有何影响?
  • RQ3对抗性训练能否在不降低OOD检测性能的前提下提升开放世界机器学习系统的鲁棒性?
  • RQ4OOD对抗性样本在多大程度上破坏了开放世界机器学习系统的完整性?
  • RQ5在结合对抗性训练与OOD检测时,是否存在鲁棒性与OOD检测能力之间的根本性权衡?

主要发现

  • 分布内数据、OOD数据和模型架构的选择显著影响OOD检测性能,部分配置下误报率超过70%。
  • 22种类型的损坏OOD输入导致误报率最高达100%,使系统无法使用。
  • OOD对抗性样本在逃避检测方面接近100%成功,大多数检测器的FPR和OW-TSR均接近100%。
  • 对抗性训练降低了特征的判别能力,导致在良性OOD数据上的OOD检测性能显著下降。
  • 一种新的权衡关系浮现:通过对抗性训练提升鲁棒性,代价是OOD检测能力的退化。
  • t-SNE可视化证实,对抗性训练后的模型在分布内与OOD特征之间失去了清晰的分离,解释了检测性能下降的原因。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。