Skip to main content
QUICK REVIEW

[논문 리뷰] Foiling Explanations in Deep Neural Networks

Snir Vitrack Tamam, Raz Lapid|arXiv (Cornell University)|2022. 11. 27.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 모델의 그래디언트나 내부 구조에 접근할 필요 없이, 오직 모델의 로짓과 설명 출력만을 사용하여 딥 네URAL 네트워크의 설명 맵을 조작하는 블랙박스 적대적 공격인 AttaXAI를 제안한다. 이 방법은 극히 미세하고 눈에 띄지 않는 입력 변형을 통해 설명 맵을 임의의 목표 맵으로 유도하는 데 성공하며, 실세계의 자료 제한 환경에서도 설명 기반 인공지능(XAI) 기법이 조작에 매우 취약함을 보여준다.

ABSTRACT

Deep neural networks (DNNs) have greatly impacted numerous fields over the past decade. Yet despite exhibiting superb performance over many problems, their black-box nature still poses a significant challenge with respect to explainability. Indeed, explainable artificial intelligence (XAI) is crucial in several fields, wherein the answer alone -- sans a reasoning of how said answer was derived -- is of little value. This paper uncovers a troubling property of explanation methods for image-based DNNs: by making small visual changes to the input image -- hardly influencing the network's output -- we demonstrate how explanations may be arbitrarily manipulated through the use of evolution strategies. Our novel algorithm, AttaXAI, a model-agnostic, adversarial attack on XAI algorithms, only requires access to the output logits of a classifier and to the explanation map; these weak assumptions render our approach highly useful where real-world models and data are concerned. We compare our method's performance on two benchmark datasets -- CIFAR100 and ImageNet -- using four different pretrained deep-learning models: VGG16-CIFAR100, VGG16-ImageNet, MobileNet-CIFAR100, and Inception-v3-ImageNet. We find that the XAI methods can be manipulated without the use of gradients or other model internals. Our novel algorithm is successfully able to manipulate an image in a manner imperceptible to the human eye, such that the XAI method outputs a specific explanation map. To our knowledge, this is the first such method in a black-box setting, and we believe it has significant value where explainability is desired, required, or legally mandatory.

연구 동기 및 목표

  • 모델 내부 정보에 접근할 수 없는 실세계의 블랙박스 상황에서 설명 기반 인공지능(XAI) 기법이 적대적 조작에 얼마나 취약한지 조사하는 것.
  • 원래 모델의 분류 출력을 유지하면서도 설명 맵을 임의의 목표 맵으로 유도할 수 있는 실용적인 공격 방법을 개발하는 것.
  • 특히 그래디언트 기반과 비그래디언트 기반 방법을 비교하여, 다양한 XAI 기법이 이러한 공격에 얼마나 강건한지 평가하는 것.
  • 작고 눈에 띄지 않는 변형조차도 설명 맵을 근본적으로 변화시킬 수 있으며, 이는 안전 중심 응용 분야에서 XAI에 대한 신뢰를 훼손할 수 있음을 입증하는 것.

제안 방법

  • AttaXAI는 모델의 출력 로짓과 설명 맵을 피드백으로 사용하여, 반복적으로 입력 변형을 최적화함으로써 설명 맵을 목표 맵으로 유도하는 진화 전략을 사용한다.
  • 이 공격은 블랙박스 위협 모델에 기반하며, 모델의 가중치, 그래디언트, 아키텍처에 대한 접근이 필요 없고, 최종 분류 확률과 설명 맵만 필요하다.
  • 변형은 인구 기반 최적화 과정을 통해 생성되고 개선되며, 적합도는 생성된 설명 맵과 목표 맵 간의 L2 거리 기반으로 평가된다.
  • 변형의 크기를 제약하여 원래 모델의 예측 결과에 최소한의 영향을 주도록 하여 모델의 원래 예측을 유지한다.
  • 이 공격은 XAI에 관계없이 적용 가능하므로, 다양한 설명 기법(예: Grad-CAM, LRP, 가속화된 백프로파게이션)에 대해 각각의 방법에 맞게 조정할 필요 없이 작동한다.
  • 실험은 VGG16, MobileNet, Inception-v3 모델을 사용하여 CIFAR100과 ImageNet에서 수행되었으며, 효율성과 계산 비용을 고려해 50,000회의 쿼리 예산을 설정하였다.

실험 결과

연구 질문

  • RQ1모델의 그래디언트나 내부 파rameter에 접근할 수 없는 상황에서 딥 네URAL 네트워크의 설명 맵을 임의의 목표 맵으로 조작할 수 있는가?
  • RQ2로짓과 설명 출력만을 사용하는 블랙박스 공격이 목표 패턴으로 설명 맵을 얼마나 효과적으로 유도할 수 있는가?
  • RQ3어느 XAI 기법이 이러한 적대적 조작에 가장 강건하고, 가장 취약한가? 그 이유는 무엇인가?
  • RQ4어느 정도까지 변형을 눈에 띄지 않게 만들 수 있을까? 동시에 설명 맵을 완전히 제어할 수 있는가?
  • RQ5모델나 데이터셋에 따라 특화된 튜닝 없이도 공격가능성이 일반화되는가?

주요 결과

  • AttaXAI는 모든 테스트된 모델과 데이터셋에서 극히 미세한 변형으로도 높은 정밀도로 목표 맵과 일치하는 설명 맵을 성공적으로 조작하였다.
  • 공격는 원래 모델의 예측 결과를 거의 동일한 출력 로짓으로 유지함으로써, 설명 조작에도 불구하고 모델의 결정이 그대로 유지됨을 확인하였다.
  • 그래디언트 기반 XAI 기법(예: Gradient, Grad-CAM)은 가장 취약한 것으로 밝혀졌고, 가속화된 백프로파게이션은 가장 강건한 것으로 나타났다.
  • CIFAR100과 ImageNet 양쪽 모두에서 높은 성공률를 기록하여, 다양한 아키텍처와 데이터 분포 간의 일반화 능력을 입증하였다.
  • 50,000회의 쿼리만으로도 높은 성공률를 달성하여, 중간 수준의 계산 비용으로도 효과적인 조작이 가능함을 시사하였다.
  • 결과적으로 XAI 시스템에 근본적인 취약점이 드러났다: 모델 예측을 바꾸지 않고도 설명을 위조할 수 있으며, 이는 XAI 기반 의사결정 감시 및 방어 메커니즘에 대한 신뢰를 훼손한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.