Skip to main content
QUICK REVIEW

[논문 리뷰] Disrupting Deep Uncertainty Estimation Without Harming Accuracy

Ido Galil, Ran El‐Yaniv|arXiv (Cornell University)|2021. 10. 26.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 분류 정확도를 떨어뜨리지 않으면서 신뢰도 추정을 약화시키는 새로운 저강도 변형 공격인 ACE(Confidence Estimation에 대한 공격)를 소개한다. ACE는 정확한 예측을 결정 경계에 가까이, 잘못된 예측을 더 멀리 이동시켜 모델이 잘못된 예측을 과신하게 만들지만 원래 레이블은 유지한다. 이는 소프트맥스, MC-Dropout, 딥 앙상블, SelectiveNet의 신뢰도 추정을 심각하게 떨어뜨린다.

ABSTRACT

Deep neural networks (DNNs) have proven to be powerful predictors and are widely used for various tasks. Credible uncertainty estimation of their predictions, however, is crucial for their deployment in many risk-sensitive applications. In this paper we present a novel and simple attack, which unlike adversarial attacks, does not cause incorrect predictions but instead cripples the network's capacity for uncertainty estimation. The result is that after the attack, the DNN is more confident of its incorrect predictions than about its correct ones without having its accuracy reduced. We present two versions of the attack. The first scenario focuses on a black-box regime (where the attacker has no knowledge of the target network) and the second scenario attacks a white-box setting. The proposed attack is only required to be of minuscule magnitude for its perturbations to cause severe uncertainty estimation damage, with larger magnitudes resulting in completely unusable uncertainty estimations. We demonstrate successful attacks on three of the most popular uncertainty estimation methods: the vanilla softmax score, Deep Ensembles and MC-Dropout. Additionally, we show an attack on SelectiveNet, the selective classification architecture. We test the proposed attack on several contemporary architectures such as MobileNetV2 and EfficientNetB0, all trained to classify ImageNet.

연구 동기 및 목표

  • 모델 정확도에 영향을 주지 않지만 신뢰도 校정을 심각하게 약화시키는 신뢰도 추정 방법의 새로운 취약점을 드러내는 것.
  • 인식 불가능한 변형을 사용해 신뢰도 점수를 조작하는 블랙박스 및 WHITELIST 공격을 개발하는 것.
  • 소프트맥스, MC-Dropout, 딥 앙상블, SelectiveNet 등 널리 사용되는 신뢰도 추정 기법이 이러한 공격에 매우 취약함을 보여주는 것.
  • 매우 작은 변형(ε = 0.005)이라도 선택적 위험을 극적으로 증가시켜 실질적으로 신뢰도 추정을 무의미하게 만들 수 있음을 보여주는 것.
  • 향후 이러한 공격에 대응할 수 있는 강건한 신뢰도 추정 및 탐지 기법에 대한 연구를 촉진하는 것.

제안 방법

  • ACE는 정확히 예측된 샘플을 결정 경계에 더 가까이, 잘못 예측된 샘플을 더 멀리 이동시키는 적대적 변형을 구성하지만, 예측 결과는 바꾸지 않는다.
  • 공격는 블랙박스(질의 기반) 및 화이트박스(모델 아키텍처 인지) 환경에서 모두 작동하며, 피드백으로 오직 모델의 신뢰도 점수만을 사용한다.
  • 소프트맥스 기반 신뢰도의 경우, 공격는 모델의 출력 로짓에 대한 기울기 기반 최적화를 통해 직접적으로 신뢰도 점수를 조작한다.
  • MC-Dropout 또는 딥 앙상블을 사용하는 모델의 경우, 공격는 입력 특징을 변형시켜 앙상블 또는 드롭아웃 기반의 신뢰도 추정을 타깃으로 삼는다.
  • SelectiveNet의 경우, 공격 유형에 따라 선택기 헤드 또는 선택기의 입력으로 사용되는 소프트맥스 점수를 타깃으로 삼는다.
  • 변형은 원래 예측를 유지하면서 변형 크기를 최소화하고 선택적 위험을 최대화하는 손실 함수를 사용해 최적화된다.

실험 결과

연구 질문

  • RQ1모델 정확도나 예측 레이블을 변경하지 않으면서도 신뢰도 추정을 약화시키는 변형 공격를 설계할 수 있는가?
  • RQ2소프트맥스, MC-Dropout, 딥 앙상블, SelectiveNet 등 다양한 신뢰도 추정 방법에 대해 이 공격의 효과는 어떠한가?
  • RQ3최소한의 변형 크기로도 공격가 블랙박스 및 화이트박스 환경 모두에서 효과를 유지하는가?
  • RQ4선택적 분류 성능에 대해 이 공격의 영향은 무엇인가—특히 선택적 위험과 커버리지 측면에서?
  • RQ5일부 신뢰도 추정 방법은 다른 방법보다 이러한 공격에 더 견고한가?

주요 결과

  • ACE는 소프트맥스, MC-Dropout, 딥 앙상블, SelectiveNet를 포함한 모든 테스트된 방법에서 원래 예측를 유지하면서도 신뢰도 추정을 성공적으로 약화시켰다.
  • ε = 0.005일 때, VGG16 기반 SelectiveNet의 선택적 위험은 정상 상태(0.0067)에서 0.0829로 증가하여 비거부 예측에 대해 위험도가 12배 증가함을 보였다.
  • ResNet18 기반 SelectiveNet의 경우 직접 공격로 인해 선택적 위험은 0.0012에서 0.0747로 증가했으며, 최소한의 변형으로도 위험도가 62배 증가함을 보였다.
  • 소프트맥스 점수를 통한 간접 공격는 선택기 헤드를 직접 공격하는 것보다 더 해로웠으며, VGG16 기반에서 선택적 위험은 0.0829로 증가했고, 직접 공격는 0.0772로 그보다 낮았다.
  • ε = 0.0005일 때도 선택적 위험은 유의미하게 증가했다(예: ResNet18 기반에서 0.0012에서 0.0059로 증가), 이는 하위 픽셀 수준의 변형으로도 손상이 발생함을 보여준다.
  • 공격는 신뢰도의 급격한 감소를 유도한다: 모델은 정확한 예측보다 잘못된 예측에 더 과신하게 되어, 신뢰도 인식 시스템에 대한 신뢰를 무너뜨린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.