[논문 리뷰] On Attacking Out-Domain Uncertainty Estimation in Deep Neural Networks
이 논문은 깊이 신경망의 도메인 외부 불확실성 추정을 약화시키기 위해 눈에 띄지 않는 변형을 생성하는 화이트박스 적대적 공격을 제안한다. 이 변형은 최신 불확실성 추정 모델이 도메인 외부(OOD) 입력에 대해 높은 신뢰도를 부여하도록 속인다. 강력한 OOD 탐지 성능에도 불구하고 Deep Ensemble, DUQ, DUE, SNGP와 같은 방법들은 매우 취약한 것으로 드러났으며, 공격을 받은 OOD 데이터에서 신뢰도 점수가 90% 이상으로 상승한다.
In many applications with real-world consequences, it is crucial to develop reliable uncertainty estimation for the predictions made by the AI decision systems. Targeting at the goal of estimating uncertainty, various deep neural network (DNN) based uncertainty estimation algorithms have been proposed. However, the robustness of the uncertainty returned by these algorithms has not been systematically explored. In this work, to raise the awareness of the research community on robust uncertainty estimation, we show that state-of-the-art uncertainty estimation algorithms could fail catastrophically under our proposed adversarial attack despite their impressive performance on uncertainty estimation. In particular, we aim at attacking the out-domain uncertainty estimation: under our attack, the uncertainty model would be fooled to make high-confident predictions for the out-domain data, which they originally would have rejected. Extensive experimental results on various benchmark image datasets show that the uncertainty estimated by state-of-the-art methods could be easily corrupted by our attack.
연구 동기 및 목표
- 도메인 외부(OOD) 입력을 대상으로 하는 적대적 공격에 취약한 최신 불확실성 추정 방법의 심각한 취약성을 폭 드러내는 것.
- 작고 눈에 띄지 않는 변형을 통해 조차도 매우 정확한 불확실성 추정 모델이 OOD 데이터에 대해 과신한 예측을 내릴 수 있음을 보여주는 것.
- 자율주행 및 의료 진단과 같은 안전이 중요한 AI 애플리케이션에서 불확실성 추정의 강건성 향상이 긴급히 필요하다는 점을 연구 공동체에 경각심을 주는 것.
- 적대적 변형에 대한 강건성을 체계적으로 평가할 수 있는 프로토타입 화이트박스 공격 프레임워크를 제공하는 것.
- 향후 강건한 불확실성 추정 알고리즘과 이러한 공격에 대비한 방어 기법 연구를 이끌어내는 것.
제안 방법
- 깊이 신경망의 불확실성 추정 헤드를 공격 대상으로 삼는 화이트박스 적대적 공격를 제안하며, 도메인 외부(OOD) 입력에 대해 높은 신뢰도를 할당하도록 모델을 속이도록 특별히 설계되었다.
- OoD 입력을 모델의 예측 공간에서 높은 신뢰도 영역으로 이동시키기 위해 기울기 기반 최적화 방법을 사용하여 적대적 변형을 생성한다.
- OoD 샘플에 대해 예측된 신뢰도를 최대화하고, 도메인 내부(ID) 샘플에 대해선 최소화하는 손실 함수를 활용하여 공격가 효과적이고 정확한 방향성을 확보한다.
- Deep Ensemble, DUQ(RBF 기반), DUE(Gaussian Process 기반), SNGP(스펙트럼 정규화 GP)와 같은 최신 불확실성 추정 방법 여러 가지에 공격를 적용한다.
- 다양한 변형 크기(ε)를 가진 여러 벤치마크 데이터셋(CIFAR-10, SVHN, NotMNIST 등)을 대상으로 공격를 평가하여 확장성과 강건성 여부를 점검한다.
- 공격 전후의 신뢰도 분포 시각화를 통해 OoD 샘플에 대한 모델의 신뢰도가 크게 증가했음을 보여준다.
실험 결과
연구 질문
- RQ1최신 불확실성 추정 방법이 도메인 외부 입력에 대해 적대적 변형에 얼마나 취약한가?
- RQ2변형 크기(ε)가 다양한 불확실성 추정 모델의 공격 성공률과 신뢰도 상승에 어떤 영향을 미치는가?
- RQ3제안된 공격가 다양한 아키텍처와 불확실성 추정 기법 전반에서 신뢰성 저하를 일관되게 초래할 수 있는가?
- RQ4적대적 변형이 OOD 탐지의 핵심 불확실성 지표인 엔트로피와 기각률에 어떤 영향을 미치는가?
- RQ5예를 들어 적대적 훈련을 거친 Deep Ensemble와 같은 모델은 표준 모델 대비 제안된 공격에 대해 더 강건한가?
주요 결과
- 제안된 적대적 공격는 도메인 외부(OOD) 입력에 대해 최신 불확실성 추정 모델의 예측 신뢰도를 성공적으로 높였으며, 여러 사례에서 신뢰도 점수가 90% 이상 상승했다.
- NotMNIST에서 DUQ 모델의 경우, 정상 상태(클리어)에서 엔트로피가 1.02였으나, ε가 0.016에서 0.063으로 증가함에 따라 각각 0.80과 0.72로 감소하여 불확실성 감소가 뚜렷하게 나타났다.
- SVHN에서 적대적 훈련을 거친 Deep Ensemble는 ε가 커질수록 엔트로피와 기각률이 증가하는 것으로 나타나 일관되지 않은 행동을 보였지만, 여전히 높은 신뢰도의 잘못된 예측을 생성했다.
- 신뢰도 분포의 시각화 결과, 원래 OOD 이미지에 대해 약 50% 정도의 신뢰도를 가졌던 DUE와 같은 모델이 공격 후 90% 이상의 높은 신뢰도를 가지게 되었다.
- 이 공격는 Deep Ensemble, DUQ, DUE, SNGP 등 다양한 불확실성 추정 방법에 대해 효과적이었으며, 광범위한 취약성을 입증했다.
- 결과적으로, 강력한 OOD 탐지 성능을 보이는 모델들도 도메인 외부 입력에 대해 과신한 예측을 내릴 수 있음을 드러내며, 심각한 보안 격차가 존재함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.