Skip to main content
QUICK REVIEW

[논문 리뷰] Order in the Court: Explainable AI Methods Prone to Disagreement

Michael Neely, Stefan F. Schouten|arXiv (Cornell University)|2021. 05. 07.
Explainable Artificial Intelligence (XAI)참고 문헌 46인용 수 7
한 줄 요약

이 논문은 설명 가능 AI 방법 평가에 대한 순위 상관관계의 신뢰성을 조사하며, LIME, 통합 기울기, DeepLIFT, Grad-SHAP, Deep-SHAP, 그리고 주의 기반 설명을 사용하여 단일 및 쌍시퀀스 작업에서 두 가지 신경망 아키텍처를 대상으로 비교한다. 연구에서는 다양한 방법 간에 광범위한 불일치를 발견하며, 순위 상관관계가 특성 추가 설명 품질 평가에 부적절하다고 결론 내리고, 더 엄격한 진단 방법의 도입을 촉구한다.

ABSTRACT

By computing the rank correlation between attention weights and feature-additive explanation methods, previous analyses either invalidate or support the role of attention-based explanations as a faithful and plausible measure of salience. To investigate whether this approach is appropriate, we compare LIME, Integrated Gradients, DeepLIFT, Grad-SHAP, Deep-SHAP, and attention-based explanations, applied to two neural architectures trained on single- and pair-sequence language tasks. In most cases, we find that none of our chosen methods agree. Based on our empirical observations and theoretical objections, we conclude that rank correlation does not measure the quality of feature-additive methods. Practitioners should instead use the numerous and rigorous diagnostic methods proposed by the community.

연구 동기 및 목표

  • 순위 상관관계가 LIME 및 통합 기울기와 같은 특성 추가 설명 방법의 충실도 평가에 타당한 지표인지 평가하는 것.
  • 주의 기반 설명 및 기울기 기반 접근 방식을 포함한 다양한 설명 가능 AI 방법 간의 일관성과 일치도를 조사하는 것.
  • 이전 연구에서 주의 메커니즘을 신뢰할 수 있는 시각화 지표로 입증하기 위해 순위 상관관계를 널리 사용한 것에 도전하는 것.
  • 설명 품질 평가를 위해 순위 상관관계보다 더 엄격하고 공동체에서 제안한 진단 방법을 사용할 것을 주장하는 것.
  • 순위 상관관계가 특성 추가 설명의 품질을 신뢰성 있게 측정하지 못함을 경험적이고 이론적으로 입증하는 것.

제안 방법

  • 저자는 단일 및 쌍시퀀스 언어 작업에 대해 훈련된 두 가지 신경망 아키텍처에 대해 여섯 가지 설명 방법—LIME, 통합 기울기, DeepLIFT, Grad-SHAP, Deep-SHAP, 주의 메커니즘—을 적용한다.
  • 여러 입력 샘플에 걸쳐 주의 가중치와 특성 추가 설명 방법의 출력 간 순위 상관관계를 계산한다.
  • 일반화 가능성 평가를 위해 단일 시퀀스 및 쌍시퀀스 작업 모두에서 분석을 수행한다.
  • 이론적 논거를 제시하여 순위 상관관계가 단조성 변환에 민감하고 크기 차이에 민감하지 않기 때문에 설명 품질의 신뢰할 수 있는 대체 지표로 부적절하다는 점을 설명한다.
  • 경험적 불일치 패tern과 이론적 기대치를 대조하여 순위 상관관계가 진단 도구로서의 한계를 입증한다.
  • 저자는 순위 상관관계를 더 견고하고 공동체에서 검증된 진단 절차로 대체할 것을 제안한다.

실험 결과

연구 질문

  • RQ1주의 및 기울기 기반 접근 방식을 포함한 다양한 설명 가능 AI 방법 간에 시각화 순위에서 어느 정도 일치하는가?
  • RQ2순위 상관관계는 특성 추가 설명 방법의 충실도 평가에 타당하고 신뢰할 수 있는 지표인가?
  • RQ3이전 연구에서 주의 메커니즘의 충실도를 입증하기 위해 순위 상관관계를 사용한 이유는 무엇인가?
  • RQ4딥러닝 모델에서 설명 품질 평가에 순위 상관관계를 사용할 때의 이론적 및 경험적 한계는 무엇인가?
  • RQ5순위 상관관계 대신 설명 가능성 방법 평가를 위해 실무자들이 어떤 대체 진단 방법을 채택해야 하는가?

주요 결과

  • 대부분의 실험 설정에서 테스트한 여섯 가지 설명 방법 간에 일관된 일치가 관찰되지 않아 다양한 접근 방식 간에 높은 불일치가 있음을 시사한다.
  • 순위 상관관계를 사용해 주의 가중치와 특성 추가 설명을 비교하는 것은 내재된 방법론적 결함으로 인해 설명 품질 측정에 신뢰성이 떨어진다.
  • 이론적 분석에 따르면 순위 상관관계는 크기 차이에 민감하지 않으며 단조성 변환에 불변적이므로 진단 도구로서의 타당성이 떨어진다.
  • 경험적 결과는 동일한 모델과 입력에 대해 적용된 방법들 간에 시각화 순위가 자주 분리됨을 보여주며, 일관성 가정에 도전한다.
  • 연구는 실무자들이 순위 상관관계를 폐기하고 설명 품질 평가를 위해 더 엄격하고 공동체에서 검증된 진단 방법을 사용해야 한다고 결론 내린다.
  • 결과는 이전 연구에서 순위 상관관계를 통해 주의 메커니즘을 신뢰할 수 있는 것으로 입증한 주장이 방법론적으로 잘못되었으며 재평가되어야 한다고 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.