[논문 리뷰] Fooling LIME and SHAP: Adversarial Attacks on Post hoc Explanation Methods
논문은 LIME과 SHAP 같은 perturbation-based post hoc 설명이 실제 데이터에서 편향된 동작을 하지만 perturb된 데이터에서는 편향이 없는 것처럼 보이도록 구성된 적대적 스캐폴딩 분류기에 의해 속을 수 있으며 결국 차별을 가렸음을 효과적으로 숨길 수 있음을 보여준다.
As machine learning black boxes are increasingly being deployed in domains such as healthcare and criminal justice, there is growing emphasis on building tools and techniques for explaining these black boxes in an interpretable manner. Such explanations are being leveraged by domain experts to diagnose systematic errors and underlying biases of black boxes. In this paper, we demonstrate that post hoc explanations techniques that rely on input perturbations, such as LIME and SHAP, are not reliable. Specifically, we propose a novel scaffolding technique that effectively hides the biases of any given classifier by allowing an adversarial entity to craft an arbitrary desired explanation. Our approach can be used to scaffold any biased classifier in such a way that its predictions on the input data distribution still remain biased, but the post hoc explanations of the scaffolded classifier look innocuous. Using extensive evaluation with multiple real-world datasets (including COMPAS), we demonstrate how extremely biased (racist) classifiers crafted by our framework can easily fool popular explanation techniques such as LIME and SHAP into generating innocuous explanations which do not reflect the underlying biases.
연구 동기 및 목표
- 블랙박스 모델에서 사용되는 고위험 분야의 편향 탐지를 위한 포스트 호 설명(LIME 및 SHAP)의 신뢰성 평가 및 동기 부여.
- 실제 데이터 편향을 보존하면서 perturbed 입력에서 무편향한 듯 보이도록 하는 적대적 분류기(스캐폴딩)를 구성하는 프레임워크를 도입.
- 실세계 데이터셋(COMPAS, Communities and Crime, German credit)에서 프레임워크를 평가하여 설명이 속일 수 있음을 보인다.
- 설명에 사용되는 perturbation 스킴과 배경 분포에 대한 공격의 강건성을 분석한다.
제안 방법
- LIME과 SHAP이 지역적이고 섀도우 기반 perturbation 설명으로 작동하는 방식을 설명한다.
- 실제 데이터 분포 X_dist에서 f와 일치하지만 perturb된/분포 밖의 지점에서 무편향한 ψ를 사용하는 적대적 분류기 e를 구성하는 프레임워크를 제안한다.
- 레이블이 붙은 데이터세트(X와 그것의 섞임으로부터 구축된 데이터)를 사용하여 스캐폴드를 안내하는 perturbation를 구분하기 위해 perturb된 지점을 구분하는 is_OOD 탐지기를 학습한다.
- X_dist에서 편향된 행동을 보존하면서 설명을 제어하기 위해 합성 비상관 특성(또는 기존 특성)을 사용해 ψ를 구성한다.
- LIME/SHAP가 사용하는 perturbations를 악용해 설명에서 인종/성별이 중요하지 않게 보이게 하면서도 예측은 편향된 채로 남아 있음을 증명한다.
- COMPAS, Communities & Crime, German Credit 데이터를 이용해 LIME과 SHAP 간의 공격을 평가하고 특징 중요도 순위의 변화를 보고한다.
실험 결과
연구 질문
- RQ1포스트 호 설명(LIME 및 SHAP)이 black-box 모델의 근본적 차별 편향을 숨기도록 조작될 수 있는가?
- RQ2perturbation 기반 설명을 악용해 perturbed 데이터에서 무해해 보이나 실제 데이터에서는 편향된 행동에 충실한 설명을 생성할 수 있는가?
- RQ3다양한 데이터셋과 설명 방법 간의 이러한 공격의 효능과 강건성은 어떠한가?
주요 결과
- 적대적 분류기가 LIME 설명의 중요한 특성을 민감 속성으로부터 무상관 특성으로 옮겨 높은 충실도로 COMPAS와 Communities & Crime에서 설명의 주요 특징을 바꿔 놓고 German Credit의 Loan%Income에까지 확산시켰다.
- SHAP 설명 역시 속성 중 민감 특성이 최상단 속성에서 삭제되는 경우가 많아 속일 수 있지만, 여러 특성이 경쟁할 때는 SHAP의 로컬 정확도가 속성들을 분산시킬 수 있다.
- LIME은 SHAP보다 취약한 경향이 있으며, SHAP가 편향을 완전히 숨기려면 더 정확한 OOD 탐지기가 필요하지만 합리적인 OOD 정확도로도 속일 수 있다.
- 공격은 perturbed 데이터에서 설명을 무해해 보이게 하는 한편 실제 데이터에서는 원래 분류기의 예측을 보존한다.
- 데이터 세트에 대해 LIME의 e와 f 간 일치도는 100%로 나타나며(다른 데이터세트에서도 마찬가지), SHAP는 데이터에 따라 75-91%의 충실도를 보이며 강력하지만 데이터세트에 따라 달라진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.