Skip to main content
QUICK REVIEW

[논문 리뷰] A simple defense against adversarial attacks on heatmap explanations

Laura Rieger, Lars Kai Hansen|arXiv (Cornell University)|2020. 07. 13.
Adversarial Robustness in Machine Learning참고 문헌 34인용 수 8
한 줄 요약

이 논문은 열매도 열매도 없는 설명 방법(예: 가이드드 백프로파게이션, LRP, 샐리언시 맵)을 평균화하여 열매도 열매도 없는 설명에 대한 적대적 공격으로부터 방어하는 단순한 방어 기법인 AGG-Mean을 제안한다. 공격자가 모델 가중치와 설명 방법을 모두 알고 있더라도 AGG-Mean은 다양한 방법 간의 다양성과 평균화에 의한 매끄러움을 활용하여 강건성을 유지하며, 공격 하에서 원래의 설명을 보존하는 데 있어 개별 방법들보다 크게 뛰어나다.

ABSTRACT

With machine learning models being used for more sensitive applications, we rely on interpretability methods to prove that no discriminating attributes were used for classification. A potential concern is the so-called "fair-washing" - manipulating a model such that the features used in reality are hidden and more innocuous features are shown to be important instead. In our work we present an effective defence against such adversarial attacks on neural networks. By a simple aggregation of multiple explanation methods, the network becomes robust against manipulation. This holds even when the attacker has exact knowledge of the model weights and the explanation methods used.

연구 동기 및 목표

  • 기계학습 모델에서 차별적 특징를 숨기기 위해 설명을 조작하는 '공정성 위조'(fairwashing)의 증가하는 위험을 해결하기 위해.
  • 입력을 눈에 띄게 변화시키지 않더라도 열매도 열매도 없는 설명을 조작할 수 있는 설명 방법에 대한 적대적 공격을 방어하기 위해.
  • 모델 아키텍처나 가중치를 수정하지 않는 경량이자 비침습적인 방어 기법을 개발하기 위해.
  • 다양한 설명 방법을 통합하면 적대적 조작에 대한 강건성이 향상되는지 평가하기 위해.

제안 방법

  • 가이드드 백프로파게이션, LRP, 샐리언시 맵 등 여러 설명 방법의 열매도 열매도 없는 열매도를 단순 평균 연산을 통해 통합한다.
  • 이 방법은 모델 재학습 없이 추론 시점에 적용되며, 기반 신경망의 수정이 필요하지 않다.
  • 다양한 설명 방법 간의 다양성을 활용하여 스무딩 효과를 유도함으로써 적대적 편향에 대한 민감도를 감소시킨다.
  • 강력한 공격자 가정 하에서 평가되었으며, 모델 가중치, 설명 방법, 입력 편향 제어에 대한 완전한 지식을 가진 공격자를 가정한다.
  • ImageNet 포함 다양한 아키텍처와 데이터셋에서 일반화 능력을 확보하기 위해 평가되었다.
  • 개별 설명 방법과 다른 통합 전략을 비교하였으며, PCC, topK 유니온, MSE 등의 지표를 사용하였다.

실험 결과

연구 질문

  • RQ1여러 설명 방법을 통합하면 열매도 열매도 없는 설명에 대한 적대적 공격에 대한 강건성이 향상되는가?
  • RQ2공격자가 모델 가중치와 설명 방법을 모두 알고 있더라도, 통합된 설명의 강건성이 유지되는가?
  • RQ3다양한 설명 방법 간에 적대적 공격의 이행성은 어떻게 달라지며, 통합은 이 이행성을 감소시키는가?
  • RQ4통합된 설명의 강건성은 평균화에 의한 매끄러움 때문인가? 이는 SmoothGrad와 비교해 볼 때 어떻게 다른가?
  • RQ5단일 설명 방법을 앙상블로 대체하는 것이 다른 단일 방법을 사용하는 것보다 더 강력한 방어를 제공하는가?

주요 결과

  • AGG-Mean은 모든 개별 설명 방법보다 강건성에서 뛰어나며, 상위 10% 유니온 점수는 0.24를 기록했고, 다음으로 좋은 방법인 LRP는 0.49였다.
  • AGG-Mean의 PCC(Pearson 상관계수)는 0.54로, LRP(0.81)와 GB(0.77)보다 상당히 낮아, 공격 하에서 원래 설명의 구조를 더 잘 유지하고 있음을 시사한다.
  • AGG-Mean의 MSE(평균제곱오차)는 -0.89 (*10e-9)로, GB(-3.25)와 LRP(-1.45)보다 유의미하게 낮아, AGG-Mean의 적대적 설명이 원래 분포에 더 가까운 것으로 나타났다.
  • 공격 이행성은 낮았다: 한 방법(예: 가이드드 백프로파게이션)을 속이기 위해 제작된 적대적 예시는 다른 방법(예: LRP)으로 효과적으로 이행되지 않았으며, 그림 2에서 항등선에서 벗어난 점들이 이를 보여준다.
  • 공격자가 정확한 설명 방법과 입력 제어를 알고 있더라도 AGG-Mean은 원래 설명에 높은 충실도를 유지하며, 그림 4와 그림 5에서 시각화된 바와 같다.
  • 이 방어 기법은 계산적으로 효율적이며, 모델 재학습이나 아키텍처 변경이 필요 없어 실세계 적용에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.