Skip to main content
QUICK REVIEW

[论文解读] On Attacking Out-Domain Uncertainty Estimation in Deep Neural Networks

Huimin Zeng, Zhenrui Yue|arXiv (Cornell University)|Oct 3, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出一种白盒对抗攻击,通过生成难以察觉的扰动,破坏深度神经网络在分布外(OOD)输入上的不确定性估计。该攻击使最先进的不确定性估计模型对OOD输入产生高置信度预测。尽管在OOD检测方面表现强劲,但Deep Ensemble、DUQ、DUE和SNGP等方法均表现出高度脆弱性,在攻击下OOD数据的置信度分数超过90%。

ABSTRACT

In many applications with real-world consequences, it is crucial to develop reliable uncertainty estimation for the predictions made by the AI decision systems. Targeting at the goal of estimating uncertainty, various deep neural network (DNN) based uncertainty estimation algorithms have been proposed. However, the robustness of the uncertainty returned by these algorithms has not been systematically explored. In this work, to raise the awareness of the research community on robust uncertainty estimation, we show that state-of-the-art uncertainty estimation algorithms could fail catastrophically under our proposed adversarial attack despite their impressive performance on uncertainty estimation. In particular, we aim at attacking the out-domain uncertainty estimation: under our attack, the uncertainty model would be fooled to make high-confident predictions for the out-domain data, which they originally would have rejected. Extensive experimental results on various benchmark image datasets show that the uncertainty estimated by state-of-the-art methods could be easily corrupted by our attack.

研究动机与目标

  • 揭示深度神经网络中先进不确定性估计方法在针对分布外(OOD)输入的对抗攻击下的关键脆弱性。
  • 证明即使高精度的不确定性估计模型,也可能通过微小且难以察觉的扰动被操纵,对OOD数据做出过度自信的预测。
  • 提高研究社区对在自动驾驶、医学诊断等安全关键AI应用中,提升不确定性估计鲁棒性的紧迫需求的认识。
  • 提供一个原型白盒攻击框架,系统评估不确定性估计模型在对抗扰动下的鲁棒性。
  • 激发未来针对鲁棒不确定性估计算法及防御此类攻击机制的研究。

提出的方法

  • 提出一种针对深度神经网络不确定性估计头的白盒对抗攻击,专门设计用于误导模型,使其对分布外(OOD)输入分配高置信度。
  • 采用基于梯度的优化方法,生成将OOD输入推向模型预测空间高置信区域的对抗扰动。
  • 使用损失函数最大化OOD样本的预测置信度,同时最小化分布内(ID)样本的置信度,确保攻击的有效性和针对性。
  • 将该攻击应用于多种最先进的不确定性估计方法:Deep Ensemble、DUQ(基于RBF)、DUE(基于高斯过程)和SNGP(谱归一化高斯过程)。
  • 在多个基准数据集(如CIFAR-10、SVHN、NotMNIST)上评估攻击效果,采用不同扰动幅度(ε)以评估可扩展性和鲁棒性。
  • 可视化攻击前后置信度分布的变化,证明OOD样本的模型置信度显著上升。

实验结果

研究问题

  • RQ1最先进的深度神经网络不确定性估计方法在分布外输入上,能在多大程度上被对抗扰动欺骗?
  • RQ2扰动幅度(ε)如何影响不同不确定性估计模型的攻击成功率和置信度提升?
  • RQ3所提出的攻击是否能一致地降低多种架构和不确定性估计技术下的不确定性估计可靠性?
  • RQ4对抗扰动对OOD检测中的关键不确定性度量(如熵和拒绝率)有何影响?
  • RQ5与标准模型相比,经过对抗训练的模型(如对抗训练的Deep Ensemble)在面对所提攻击时是否表现出更强的鲁棒性?

主要发现

  • 所提出的对抗攻击成功提高了先进不确定性估计模型在分布外(OOD)输入上的预测置信度,多个案例中置信度分数超过90%。
  • 在NotMNIST数据集上,DUQ模型的熵从干净样本时的1.02降至ε=0.016时的0.80和ε=0.063时的0.72,表明不确定性显著降低。
  • 在SVHN上,对抗训练的Deep Ensemble在ε增大时表现出熵和拒绝率上升,显示行为不一致,但仍产生高置信度的错误预测。
  • 置信度分布的可视化显示,如DUE这类原本对OOD图像仅约50%置信的模型,在攻击后置信度超过90%。
  • 该攻击在多种不确定性估计方法(包括Deep Ensemble、DUQ、DUE和SNGP)上均有效,表明其广泛脆弱性。
  • 结果揭示了一个关键的安全漏洞:即使具有强大OOD检测性能的模型,也可能被操纵为对OOD输入做出过度自信、可能造成灾难性后果的预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。