[论文解读] A Critical Evaluation of Open-World Machine Learning
本文通过在多种条件下测试六种最先进的分布外(OOD)检测器的鲁棒性,对开放世界机器学习系统进行了批判性评估,包括损坏的和对抗性的OOD输入。结果表明,检测器性能严重下降——在对抗性扰动下,误报率超过70%,甚至达到100%;而对抗性训练虽能提升鲁棒性,却会损害OOD检测能力,揭示了鲁棒性与异常检测能力之间的一种新权衡。
Open-world machine learning (ML) combines closed-world models trained on in-distribution data with out-of-distribution (OOD) detectors, which aim to detect and reject OOD inputs. Previous works on open-world ML systems usually fail to test their reliability under diverse, and possibly adversarial conditions. Therefore, in this paper, we seek to understand how resilient are state-of-the-art open-world ML systems to changes in system components? With our evaluation across 6 OOD detectors, we find that the choice of in-distribution data, model architecture and OOD data have a strong impact on OOD detection performance, inducing false positive rates in excess of $70\%$. We further show that OOD inputs with 22 unintentional corruptions or adversarial perturbations render open-world ML systems unusable with false positive rates of up to $100\%$. To increase the resilience of open-world ML, we combine robust classifiers with OOD detection techniques and uncover a new trade-off between OOD detection and robustness.
研究动机与目标
- 评估在非理想条件(如损坏或对抗性扰动的OOD数据)下开放世界机器学习系统的可靠性与鲁棒性。
- 研究分布内数据、模型架构和OOD数据的变化对OOD检测性能的影响。
- 评估对抗性训练在提升鲁棒性的同时是否能保持OOD检测能力的有效性。
- 揭示并分析在结合对抗性训练与OOD检测时,鲁棒性与OOD检测能力之间存在的新权衡。
提出的方法
- 在统一的实验设置下评估六种SOTA OOD检测器——ODIN、Network Agnostophobia、Mahalanobis Detector、Autoencoder Detector、Deep-SVDD和Outlier Exposure。
- 通过改变分布内数据(如CIFAR-10、SVHN)、OOD数据集(如ImageNet、MNIST、CIFAR-100)和模型架构(如WRN-28-10、ResNet-28-10)来评估其敏感性。
- 通过将PGD攻击适配为生成可逃避OOD检测但保持OOD特性的OOD对抗样本,引入并应用OOD对抗性样本。
- 应用对抗性训练(PGD,L∞=8)以增强分类器的鲁棒性,并评估其对OOD检测性能的影响。
- 使用t-SNE可视化比较自然训练与对抗性训练模型的特征表示,发现类别分离性降低。
- 采用FPR(误报率)和OW-TSR(OOD-World真阳性率)作为关键指标,量化检测失败与攻击成功率。
实验结果
研究问题
- RQ1分布内数据、OOD数据和模型架构的变化如何影响OOD检测性能?
- RQ2数据损坏和对抗性扰动对OOD检测器可靠性有何影响?
- RQ3对抗性训练能否在不降低OOD检测性能的前提下提升开放世界机器学习系统的鲁棒性?
- RQ4OOD对抗性样本在多大程度上破坏了开放世界机器学习系统的完整性?
- RQ5在结合对抗性训练与OOD检测时,是否存在鲁棒性与OOD检测能力之间的根本性权衡?
主要发现
- 分布内数据、OOD数据和模型架构的选择显著影响OOD检测性能,部分配置下误报率超过70%。
- 22种类型的损坏OOD输入导致误报率最高达100%,使系统无法使用。
- OOD对抗性样本在逃避检测方面接近100%成功,大多数检测器的FPR和OW-TSR均接近100%。
- 对抗性训练降低了特征的判别能力,导致在良性OOD数据上的OOD检测性能显著下降。
- 一种新的权衡关系浮现:通过对抗性训练提升鲁棒性,代价是OOD检测能力的退化。
- t-SNE可视化证实,对抗性训练后的模型在分布内与OOD特征之间失去了清晰的分离,解释了检测性能下降的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。