Skip to main content
QUICK REVIEW

[논문 리뷰] How can we fool LIME and SHAP? Adversarial Attacks on Post hoc Explanation Methods.

Dylan Slack, Sophie Hilgard|arXiv (Cornell University)|2019. 11. 06.
Explainable Artificial Intelligence (XAI)참고 문헌 11인용 수 29
한 줄 요약

이 논문은 LIME와 SHAP과 같은 사후 설명 방법이 적대적 거치대를 통해 체계적으로 속임당할 수 있음을 보여준다. 여기서 편향된 분류기가 수정되어 유해한 편향을 유지하면서도 잘못된 정도로 공정한 설명을 내보내게 된다. 저자들은 매우 극단적인 인종차별적 분류기조차도 설명 도구에서 숨길 수 있음을 보여주며, 이는 고위험 AI 시스템에서 편향을 탐지하는 데 효과적이지 않음을 의미한다.

ABSTRACT

As machine learning black boxes are increasingly being deployed in domains such as healthcare and criminal justice, there is growing emphasis on building tools and techniques for explaining these black boxes in an interpretable manner. Such explanations are being leveraged by domain experts to diagnose systematic errors and underlying biases of black boxes. In this paper, we demonstrate that post hoc explanations techniques that rely on input perturbations, such as LIME and SHAP, are not reliable. Specifically, we propose a novel scaffolding technique that effectively hides the biases of any given classifier by allowing an adversarial entity to craft an arbitrary desired explanation. Our approach can be used to scaffold any biased classifier in such a way that its predictions on the input data distribution still remain biased, but the post hoc explanations of the scaffolded classifier look innocuous. Using extensive evaluation with multiple real-world datasets (including COMPAS), we demonstrate how extremely biased (racist) classifiers crafted by our framework can easily fool popular explanation techniques such as LIME and SHAP into generating innocuous explanations which do not reflect the underlying biases.

연구 동기 및 목표

  • LIME와 SHAP과 같은 사후 설명 방법이 모델 편향을 탐지하는 데에 얼마나 신뢰할 수 있는지 조사하기 위해.
  • 입력 변형에 의존하는 설명 기법의 취약성을 폭 드러내기 위해.
  • 적대적 실체가 예측 성능을 유지하면서도 모델 편향을 숨길 수 있는 프레임워크를 개발하기 위해.
  • 심지어 매우 편향된 분류기라도 LIME과 SHAP 하에서 무해한 설명을 생성할 수 있음을 보여주기 위해.
  • 사후 설명이 모델 행동에 대한 편향 없는 진단으로 신뢰할 수 있다는 가정을 도전하기 위해.

제안 방법

  • 저자들은 LIME와 SHAP과 같은 설명 방법이 입력을 대표적으로 보이게 하는 방식으로 편향된 분류기를 수정하는 거치대 기법을 도입한다.
  • 거치대가 적용된 모델은 원래 데이터 분포에서 높은 정확도를 유지하면서도, 설명 방법에서 사용하는 변형이 균일하게 분포된, 차별적이지 않은 특성 중요도 점수를 산출하도록 훈련된다.
  • 이 방법은 적대적 훈련을 사용하여 모델의 국소적 설명이 실제 의사결정 과정과는 관계없이 원하는 유익한 설명 패턴과 일치하도록 한다.
  • 이 프레임워크는 COMPAS과 같은 실제 세계 데이터셋에 적용되어 범죄 사법 위험 평가와 같은 고위험 시나리오를 시뮬레이션한다.
  • 이 방법은 모델이 예측에서는 여전히 편향되지만 사후 설명에서는 공정하게 보이게 한다.
  • 이 방법은 LIME과 SHAP이 입력 변형에 민감한 점을 활용하며, 국소 선형 근사에 의존함으로써 잠재적 편향을 가림으로써 악용한다.

실험 결과

연구 질문

  • RQ1적대적 거치대 기법을 사용해 예측 성능를 유지하면서도 분류기의 체계적 편향을 숨길 수 있는가?
  • RQ2LIME과 SHAP는 얼마나 깊이 편향된 모델에 대해 무해한 설명을 생성하도록 속일 수 있는가?
  • RQ3표준 설명 도구 하에서 편향된 모델이 얼마나 효과적으로 공정하게 보일 수 있는가?
  • RQ4이 프레임워크는 범죄 사법이나 의료 분야처럼 고위험 영향을 미치는 실제 세계 데이터셋에 적용될 수 있는가?
  • RQ5사후 설명 방법에 의존하여 모델의 공정성에 대한 감사를 수행할 때의 한계는 무엇인가?

주요 결과

  • 제안된 거치대 기법은 원래 데이터에서 높은 예측 정확도를 유지하면서도, COMPAS 유사 분류기의 극단적인 인종 편향을 성공적으로 숨겼다.
  • LIME과 SHAP는 거치대가 적용된 모델에 대해 균일하게 분포된, 차별적이지 않은 특성 중요도 점수를 생성하여 잘못된 공정성 신호를 내보냈다.
  • 원래 분류기가 명백한 인종적 격차를 보였음에도 불구하고, 사후 설명은 여러 평가 지표에서 무해하고 편향 없는 것처럼 보였다.
  • 이 프레임워크는 설명 도구가 모델의 공정성에 대해 독립적인 검증 수 Mittel로 신뢰할 수 없음을 보여주며, 잠재적 편향을 숨길 수 있음을 입증했다.
  • 결과적으로 사후 설명 방법이 적대적 조작에 취약함을 보여주며, 이는 고위험 AI 시스템 감사에서의 유용성을 떨어뜨린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.