Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Stability for Attribution-based Explanations

Chirag Agarwal, Nari Johnson|arXiv (Cornell University)|2022. 03. 14.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 모델의 입력, 표현, 또는 출력에 대한 변형에 비해 설명이 어떻게 변화하는지 측정함으로써, 기여도 기반 설명 방법의 안정성을 평가하기 위해 상대적 안정성 메트릭스를 도입한다. 세 가지 실세계 데이터셋에서 일곱 가지 방법을 대상으로 한 실험을 통해 SmoothGrad가 평균 12.7% 높은 안정성을 보이며 가장 안정적인 설명을 생성하는 것으로 밝혀졌다.

ABSTRACT

As attribution-based explanation methods are increasingly used to establish model trustworthiness in high-stakes situations, it is critical to ensure that these explanations are stable, e.g., robust to infinitesimal perturbations to an input. However, previous works have shown that state-of-the-art explanation methods generate unstable explanations. Here, we introduce metrics to quantify the stability of an explanation and show that several popular explanation methods are unstable. In particular, we propose new Relative Stability metrics that measure the change in output explanation with respect to change in input, model representation, or output of the underlying predictor. Finally, our experimental evaluation with three real-world datasets demonstrates interesting insights for seven explanation methods and different stability metrics.

연구 동기 및 목표

  • 고위험 기반 기계학습 응용에서 작은 입력 변화가 큰 설명 변화를 유도하는 기여도 기반 설명의 불안정성 문제를 해결하기 위해.
  • 이전 안정성 메트릭스가 입력 변형만 고려하고 모델 내부 구조를 忽시한다는 한계를 극복하기 위해.
  • 모델 행동을 통합한 새로운 안정성 메트릭스인 상대적 입력, 표현, 출력 안정성(Relative Input, Representation, and Output Stability)을 개발하고 검증하기 위해.
  • 여러 데이터셋과 예측 모델을 사용하여 일곱 가지 최첨단 설명 방법의 안정성을 경험적으로 비교하기 위해.
  • 설명 불안정성과 모델 리프시츠 상수 및 표현 안정성 간의 이론적 경계를 수립하기 위해.

제안 방법

  • 상대적 안정성 메트릭스인 상대적 입력 안정성(Relative Input Stability, RIS), 상대적 표현 안정성(Relative Representation Stability, RRS), 상대적 출력 안정성(Relative Output Stability, ROS)을 제안하며, 각각 입력, 표현, 출력 변형에 대한 설명 변화를 측정한다.
  • 모델의 입력에서 은닉층으로의 리프시츠 상수와 RRS의 곱을 사용하여 RIS에 대한 이론적 상한선을 유도함으로써, 모델 특성과 설명 안정성 간의 공식적 연결 고리를 확립한다.
  • 각 테스트 인스턴스당 50개의 무한소 변형을 생성하고 일곱 가지 설명 방법에 대해 설명 변화를 계산함으로써 경험적으로 안정성을 평가한다.
  • 예측 모델로 로지스틱 회귀와 인공 신경망을 사용하며, 설명은 VanillaGrad, 통합 기울기, SmoothGrad, 입력×기울기, LIME, SHAP, 무작위 기반 기준값을 통해 생성한다.
  • 원본 설명과 변형된 설명 간의 L2 노름 차이를 변형 크기로 정규화하여 불안정성 정도를 정량화한다.
  • 모델 아키텍처와 표현 안정성으로부터 유도된 이론적 상한선과 경험적 RIS 값을 비교함으로써 이론적 상한선의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1기존 안정성 메트릭스는 내부 표현과의 관계에서 모델 수준의 행동을 얼마나 잘 반영하지 못하는가?
  • RQ2기여도 기반 설명 방법은 무한소 입력, 표현, 출력 변형에 대해 어느 정도 안정성을 유지하는가?
  • RQ3설명 불안정성과 리프시츠 상수와 같은 모델 특성 간의 이론적 경계를 유도할 수 있는가?
  • RQ4어느 설명 방법이 여러 안정성 유형과 데이터셋에서 가장 강력한 성능을 보이는가?
  • RQ5안정성 메트릭스는 입력, 표현, 출력 변화에 대해 어떻게 민감도가 다른가? 이는 설명 신뢰성에 대해 어떤 통찰을 제공하는가?

주요 결과

  • RIS 점수는 RRS 및 ROS보다 일관되게 낮아, 입력 변형이 설명 차이에 대해 더 강력한 정규화 효과를 가진다는 것을 시사한다.
  • RIS에 대한 이론적 상한선는 경험적으로 검증되었으며, 평균적으로 경험적 값보다 233% 높은 상한선을 보이며 타당성이 높다는 것이 확인되었다.
  • SmoothGrad는 모든 데이터셋과 안정성 유형에서 가장 높은 안정성을 확보하였으며, 중앙값 불안정성에서 평균 12.7% 높은 성능을 보였다.
  • 표현 및 출력 안정성 메트릭스(RRS 및 ROS)는 모델 내부 구조가 설명 안정성에 상당한 영향을 미친다는 점을 드러내었으며, 입력 변형 외에도 모델 행동을 고려할 필요성을 강조한다.
  • 어느 설명 방법도 완전히 안정적이지는 않지만, SmoothGrad는 Adult, Compas, German Credit 데이터셋과 로지스틱 회귀 및 인공 신경망 모델 전반에서 가장 일관된 강건성을 보였다.
  • 이론적 분석을 통해 설명 불안정성이 모델의 입력에서 은닉층으로의 리프시츠 상수와 표현 안정성의 곱으로 제한됨을 확인하였으며, 이는 안정성 평가에 대한 공식적 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.