[논문 리뷰] Interpreting Adversarial Examples by Activation Promotion and Suppression
논문은 픽셀, 이미지, 및 네트워크 관점에서 적대적 교란(adversarial perturbations)을 분석하여 활성화에 대한 프로모션-억제 효과(Promotion-Suppression Effect, PSE)를 밝히고, 교란을 클래스 구분 영역 및 의미 개념과 연결합니다. 또한 해석 가능성 기반의 강건성 및 뉴런 마스킹을 방어로 탐구합니다.
It is widely known that convolutional neural networks (CNNs) are vulnerable to adversarial examples: images with imperceptible perturbations crafted to fool classifiers. However, interpretability of these perturbations is less explored in the literature. This work aims to better understand the roles of adversarial perturbations and provide visual explanations from pixel, image and network perspectives. We show that adversaries have a promotion-suppression effect (PSE) on neurons' activations and can be primarily categorized into three types: i) suppression-dominated perturbations that mainly reduce the classification score of the true label, ii) promotion-dominated perturbations that focus on boosting the confidence of the target label, and iii) balanced perturbations that play a dual role in suppression and promotion. We also provide image-level interpretability of adversarial examples. This links PSE of pixel-level perturbations to class-specific discriminative image regions localized by class activation mapping (Zhou et al. 2016). Further, we examine the adversarial effect through network dissection (Bau et al. 2017), which offers concept-level interpretability of hidden units. We show that there exists a tight connection between the units' sensitivity to adversarial attacks and their interpretability on semantic concepts. Lastly, we provide some new insights from our interpretation to improve the adversarial robustness of networks.
연구 동기 및 목표
- 픽셀 수준의 교란이 픽셀 및 이미지 관점에서 CNN 예측에 어떤 영향을 미치는지 연구합니다.
- 다양한 적대적 공격의 효과를 주의집중 및 영역 기반 분석으로 설명합니다.
- 적대적 교란이 내부 CNN 표현 및 개념 검출기에 어떤 영향을 미치는지 조사합니다.
- 교란 패턴을 클래스 구분 이미지 영역 및 의미 개념과 연결하여 강건성에 대한 통찰을 제공합니다.
제안 방법
- 교란 영역에 대한 진실 및 대상 클래스 로짓의 변화를 집계하는 픽셀 수준 민감도 측정치를 정의합니다.
- 교란을 억제 우세, 프로모션 우세, 균형 지배로 분류하는 프로모션-억제 비율(PSR)을 도입합니다.
- 교란이 구분 가능한 이미지 영역과 어떻게 정렬되는지 해석하기 위해 클래스 활성화 맵(CAM)을 사용합니다.
- 교란 정렬이 구분 가능한 영역과 얼마나 맞물리는지 정량하기 위해 CAM 기반 해석 가능도 점수(IS)를 사용합니다.
- 교란이 개념 검출기와 해석 가능성에 어떤 영향을 미치는지 파악하기 위해 네트워크 해부를 적용합니다.
- 교란을 제약하고 효능을 연구하기 위해 CAM을 활용한 정제 전략을 제안합니다.
실험 결과
연구 질문
- RQ1픽셀 수준의 교란이 실제 및 대상 라벨에 걸쳐 CNN 활성화를 촉진하거나 억제하는가?
- RQ2CAM과 IS가 적대적 교란의 이미지 수준 해석 가능성을 어떻게 정량하는가?
- RQ3네트워크 해부가 드러낸 내부 개념과 교란 간의 관계는 무엇인가?
- RQ4해석 주도적 정제 및 뉴런 마스킹이 순수한 정확도에 큰 영향을 주지 않으면서 강건성을 개선할 수 있는가?
- RQ5교란 패턴이 서로 다른 공격 및 대상에서 구분 가능한 이미지 영역과 어떤 관계를 가지는가?
주요 결과
- 적대적 교란은 뉴런 활성화에 대해 프로모션-억제 효과를 보이며, 억제 우세, 프로모션 우세, 또는 균형 지배로 분류될 수 있습니다.
- CAM 기반 분석은 교란이 참 라벨과 대상 라벨의 구분 영역과 정렬되어 있음을 보여주며, 공격의 이미지 수준 해석 가능성을 가능하게 합니다.
- 픽셀 교란과 의미 개념 간의 연결이 네트워크 해부를 통해 측정되며, 민감한 유닛은 종종 해석 가능한 개념에 해당하는 경향이 있습니다.
- 해석 가능성 기반의 정제는 높은 민감도 영역을 타깃으로 하여 더 효과적인 공격을 낳을 수 있지만, 일부 CAM 제약 정제는 더 큰 교란을 필요로 할 수 있습니다.
- 적대적 교란에 민감한 유닛은 특히 깊은 네트워크 계층에서 해석 가능성이 높은 개념 검출기와 상관되는 경향이 있습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.