Skip to main content
QUICK REVIEW

[논문 리뷰] A Note about: Local Explanation Methods for Deep Neural Networks lack Sensitivity to Parameter Values

Mukund Sundararajan, Ankur Taly|arXiv (Cornell University)|2018. 06. 11.
Explainable Artificial Intelligence (XAI)참고 문헌 8인용 수 11
한 줄 요약

이 논문은 통합 기울기(IG)가 깊은 신경망 파라미터에 민감하지 않다는 주장에 도전하며, Adebayo 등(2018)이 랜덤 및 훈련된 네트워크 간 설명 간 높은 상관관계를 관찰한 것은 두 가지 요소에 기인한 현상임을 보여준다: (1) 절대값으로 정규화하는 것. 이는 검은 MNIST 픽셀에서 공통된 0 기여도를 유발하여 슔피어만 상관관계를 과대평가한다. (2) 기여도가 0인 기준선 픽셀을 포함하는 것. 이러한 요소들을 수정한 결과, 랜덤 및 훈련된 네트워크의 IG 설명 간 상관관계가 사라지며, 이는 적절하게 평가될 경우 IG가 파라미터 값에 실제로 민감하다는 것을 입증한다.

ABSTRACT

Local explanation methods, also known as attribution methods, attribute a deep network's prediction to its input (cf. Baehrens et al. (2010)). We respond to the claim from Adebayo et al. (2018) that local explanation methods lack sensitivity, i.e., DNNs with randomly-initialized weights produce explanations that are both visually and quantitatively similar to those produced by DNNs with learned weights. Further investigation reveals that their findings are due to two choices in their analysis: (a) ignoring the signs of the attributions; and (b) for integrated gradients (IG), including pixels in their analysis that have zero attributions by choice of the baseline (an auxiliary input relative to which the attributions are computed). When both factors are accounted for, IG attributions for a random network and the actual network are uncorrelated. Our investigation also sheds light on how these issues affect visualizations, although we note that more work is needed to understand how viewers interpret the difference between the random and the actual attributions.

연구 동기 및 목표

  • 통합 기울기와 같은 局소 설명 방법이 신경망 파라미터에 민감하지 않다는 주장에 도전하기 위해.
  • Adebayo 등(2018)의 MNIST에서 통합 기울기 평가에 있어 메서드올로지적 결함을 규명하고 수정하기 위해.
  • 적절한 평가 지표를 사용할 경우 통합 기울기가 네트워크 파라미터에 민감하다는 것을 입증하기 위해.
  • 정규화 및 기준선 선택이 기여도 방법의 시각적 및 정량적 평가에 어떻게 왜곡을 초래하는지 부각하기 위해.
  • 해석 가능성 연구에서 더 신중한 시각화 및 평가 관행을 촉진하기 위해.

제안 방법

  • 검은 픽셀에서 공통된 0 기여도를 고려하여, 훈련된 네트워크와 무작위로 초기화된 네트워크 간 통합 기울기의 슈피어만 순위 상관관계 재평가.
  • 0 기여도 픽셀을 제거하여 임의의 상관관계를 제거하는 수정된 상관관계 지표인 spearman_nz 도입.
  • 절대값을 사용하지 않고, 기여도의 부호를 유지하여 시각화함으로써 파라미터 민감도를 드러내기.
  • 모든 픽셀에 걸친 통합 기울기 점수의 합을 분석하여 기준선에서의 모델 예측 차이 변화 추적.
  • 검은 이미지를 기준선으로 사용하여 모든 검은 픽셀에 0 기여도가 발생하게 함. 이는 원래 분석에서의 핵심적인 결함 요소였다.
  • 50개의 MNIST 이미지를 평균 내기 위해 층을 단계적으로 무작위화하면서 상관관계 추세를 경험적으로 측정.

실험 결과

연구 질문

  • RQ1왜 Adebayo 등(2018)은 훈련된 네트워크와 무작위로 초기화된 네트워크 간 통합 기울기 사이에 높은 슈피어만 상관관계를 관찰했는가?
  • RQ2절대값으로 정규화하는 것이 기여도 방법 민감도 해석에 어떤 영향을 미치는가?
  • RQ3MNIST 이미지의 검은 픽셀에서 공통된 0 기여도가 상관관계 지표에 얼마나 심각하게 왜곡을 초래하는가?
  • RQ4네트워크 파라미터가 무작위화될 때 통합 기울기 값의 부호는 어떻게 변화하는가?
  • RQ5기준선 선택과 정규화가 기여도 맵의 시각적 정밀도에 어떤 영향을 미치는가?

주요 결과

  • Adebayo 등(2018)이 보고한 높은 슈피어만 상관관계는 주로 절대값으로 정규화하는 것에 기인한 것으로, 검은 MNIST 픽셀에서 공통된 0 기여도로 인해 상관관계가 과대평가된다.
  • 0 기여도 픽셀을 spearman_nz 지표를 통해 제거한 결과, 훈련된 네트워크와 무작위로 초기화된 네트워크 간 상관관계는 약 0.424로 감소하여 유의미한 유사성이 없음을 시사한다.
  • 기여도 값의 부호는 네트워크 파라미터에 매우 민감하며, 무작위화 과정에서 픽셀 기여도가 양성에서 음성으로 뒤바뀌는 시각화를 통해 이를 입증하였다.
  • 기여도의 부호를 유지한 시각화에서는 원본 네트워크가 전체 획을 강조하는 반면, 무작위화된 네트워크는 분리되고 비일관된 패턴을 생성한다.
  • 모든 픽셀에 걸친 통합 기울기 점수의 합은 네트워크 파라미터가 무작위화됨에 따라 크게 감소하여 0에 가까워지며, 이는 기준선에서의 예측 차이 손실을 나타낸다.
  • 절대값 정규화 없이도 훈련된 네트워크와 무작위로 초기화된 네트워크 간 슈피어만 상관관계는 0.0으로 떨어지며, 이는 정규화가 오해의 근본 원인임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.