Skip to main content
QUICK REVIEW

[논문 리뷰] SAFARI: Versatile and Efficient Evaluations for Robustness of Interpretability

Wei Huang, Xingyu Zhao|arXiv (Cornell University)|2022. 08. 19.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 두 가지 신규 메트릭인 최악의 해석 불일치와 확률적 해석 내성에 기반해 딥러닝의 해석 가능성의 내성을 평가하기 위한 블랙박스 평가 프레임워크인 SAFARI를 제안한다. 유전적 알고리즘(GA)과 특수 설계된 적합도 함수, 서브셋 시뮬레이션을 활용하여 희귀한 잘못된 해석을 효율적으로 탐지하며, 다양한 XAI 기법과 데이터셋에서 최신 기법들보다 정확도, 민감도, 효율성 면에서 뛰어난 성능을 보인다.

ABSTRACT

Interpretability of Deep Learning (DL) is a barrier to trustworthy AI. Despite great efforts made by the Explainable AI (XAI) community, explanations lack robustness -- indistinguishable input perturbations may lead to different XAI results. Thus, it is vital to assess how robust DL interpretability is, given an XAI method. In this paper, we identify several challenges that the state-of-the-art is unable to cope with collectively: i) existing metrics are not comprehensive; ii) XAI techniques are highly heterogeneous; iii) misinterpretations are normally rare events. To tackle these challenges, we introduce two black-box evaluation methods, concerning the worst-case interpretation discrepancy and a probabilistic notion of how robust in general, respectively. Genetic Algorithm (GA) with bespoke fitness function is used to solve constrained optimisation for efficient worst-case evaluation. Subset Simulation (SS), dedicated to estimate rare event probabilities, is used for evaluating overall robustness. Experiments show that the accuracy, sensitivity, and efficiency of our methods outperform the state-of-the-arts. Finally, we demonstrate two applications of our methods: ranking robust XAI methods and selecting training schemes to improve both classification and interpretation robustness.

연구 동기 및 목표

  • 딥러닝의 해석 가능성 내성에 대한 종합적이고 유연하며 효율적인 평가 메트릭의 부족을 해결하기 위해.
  • 내부 모델 접근 권한이 없더라도 이질적인 XAI 기법, 특히 편미분 기반 기법을 평가하는 데 어려움을 극복하기 위해.
  • 블랙박스 최적화와 통계적 샘플링을 통해 국소 노름-구역 내에서 희귀한 잘못된 해석 사건을 효과적으로 탐지하기 위해.
  • 최악의 경우와 확률적 내성 시각을 모두 보완하는 통합 평가 프레임워크를 제공하기 위해.
  • 실용적 응용을 보여주기 위해: XAI 기법들을 순위 매기고, 분류 및 해석 내성 양쪽을 동시에 향상시키는 학습 체계를 식별하기 위해.

제안 방법

  • 최악의 해석 불일치(피어슨 상관계수(PCC)로 측정)와 확률적 내성(노름-구역 내 잘못된 해석 확률로 추정)이라는 상호보완적인 두 가지 내성 메트릭을 제안한다.
  • 제약 조건이 있는 최적화 문제를 해결하기 위해 맞춤형 적합도 함수를 갖춘 블랙박스 유전적 알고리즘(GA)을 사용하여 해석 불일치를 최대화하는 적대적 편미분을 식별한다.
  • 희귀 사건 확률 추정을 위한 통계적 방법인 서브셋 시뮬레이션(SS)을 활용하여 국소 이웃에서 잘못된 해석의 가능성을 효율적으로 계산한다.
  • 모델 예측을 유지하면서 해석 변화를 최대화하는 적대적 편미분을 유도하기 위해 GA에 특수 설계된 적합도 함수를 설계한다.
  • 기존 몬테카를로 방법보다 효율성을 높이기 위해 조건부 분포에서 반복적으로 샘플링하는 방식으로 SS를 조정하여 낮은 확률의 잘못된 해석 사건을 추정한다.
  • 다양한 데이터셋(MNIST, CIFAR-10, CelebA, ImageNet)과 XAI 기법(Gradient×Input, 통합 기울기, GradCAM, FullGrad, 극단적 편미분)에 걸쳐 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1이진 적대적 탐지 외적으로 딥러닝의 해석 가능성 내성에 대해 종합적으로 평가할 수 있는 방법은 무엇인가?
  • RQ2기울기 또는 모델 내부 정보 없이도 국소 노름-구역 내에서 희귀한 잘못된 해석 사건을 효율적으로 탐지할 수 있는 블랙박스 방법은 무엇인가?
  • RQ3예측을 유지하거나 변경하는 편미분에 대해 어느 XAI 기법이 가장 내성적인가?
  • RQ4다양한 신경망 아키텍처 간에 분류 내성과 해석 내성 간의 상관관계는 어느 정도인가?
  • RQ5분류 내성과 해석 내성 양쪽을 동시에 향상시키는 학습 체계를 식별할 수 있는가?

주요 결과

  • 통합 기울기 기법은 CIFAR-10에서 다양한 아키텍처에서 잘못된 해석에 대해 가장 높은 내성을 보였으며, 최악의 불일치가 낮고 확률적 내성이 높았다.
  • 통합 기울기의 확률적 내성 메트릭(ln P)은 ResNet20에서 -35.93, VGG16에서 -47.52로, 잘못된 해석에 강력한 저항성을 보였다.
  • 실증적으로 분류 내성과 해석 내성 간에 강한 상관관계가 관찰되어, 손실 함수 곡률과 같은 공통된 근본 원인이 존재할 가능성이 제기되었다.
  • FullGrad는 계층별 기울기를 조합하여 개별 기법들을 초월했으며, ImageNet에서 PCC 0.799와 ln P -75.716을 기록하여 높은 내성을 보였다.
  • GA 기반 최악의 경우 평가에서는 높은 민감도와 효율성을 달성하여 최소한의 계산 오버헤드로 적대적 편미분을 탐지했다.
  • 서브셋 시뮬레이션은 높은 정확도로 희귀한 잘못된 해석 확률을 추정했으며, 계산 비용 측면에서 표준 몬테카를로 샘플링보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.