Skip to main content
QUICK REVIEW

[논문 리뷰] On quantitative aspects of model interpretability

An-phi Nguyen, María Rodríguez Martínez|arXiv (Cornell University)|2020. 07. 15.
Explainable Artificial Intelligence (XAI)참고 문헌 41인용 수 14
한 줄 요약

이 논문은 특성 추출기와 해석 가능성 모델로 분해함으로써 모델의 해석 가능성 방법을 정량적으로 평가하기 위한 체계적인 프레임워크를 제안한다. 간편함, 포괄성, 충실도를 측정하기 위한 지표를 도입하며, 실험을 통해 Integrated Gradients와 같은 방법이 뛰어난 포괄성과 충실도를 보임을 입증한다. 이는 실무자들이 주어진 작업에 가장 적합한 해석 가능성 방법을 객관적으로 선택할 수 있도록 한다.

ABSTRACT

Despite the growing body of work in interpretable machine learning, it remains unclear how to evaluate different explainability methods without resorting to qualitative assessment and user-studies. While interpretability is an inherently subjective matter, previous works in cognitive science and epistemology have shown that good explanations do possess aspects that can be objectively judged apart from fidelity), such assimplicity and broadness. In this paper we propose a set of metrics to programmatically evaluate interpretability methods along these dimensions. In particular, we argue that the performance of methods along these dimensions can be orthogonally imputed to two conceptual parts, namely the feature extractor and the actual explainability method. We experimentally validate our metrics on different benchmark tasks and show how they can be used to guide a practitioner in the selection of the most appropriate method for the task at hand.

연구 동기 및 목표

  • 사용자 연구를 초월해 프로그래밍 가능한 객관적 평가 방법이 부족한 문제를 해결하기 위해.
  • 해석 가능성의 세 핵심 요소인 단순함, 포괄성, 충실도를 식별하고 정량화하기 위해.
  • 해석 가능성 방법을 두 상호 수직인 구성 요소로 공식적으로 분리하기 위해: 특성 추출기와 해석 가능성 모델.
  • 실무자들이 주어진 작업에 가장 적합한 해석 가능성 방법을 선택할 수 있도록 기능 기반 지표를 제공하기 위해.
  • 정량적 기준을 사용해 높은 잠재력을 지닌 해석 방법을 사전에 선별함으로써 사용자 연구의 부담을 줄이기 위해.

제안 방법

  • 논문은 해석 가능성 방법을 입력 데이터를 해석 가능한 표현으로 변환하는 특성 추출기와 그 표현에서 설명을 생성하는 해석 가능성 모델으로 개념적으로 분해한다.
  • 비감도성(소규모 입력 변화에 대한 강건성), 사실 정확도(설명의 세부 수준), 통합 정도(일반 적용 가능성)라는 세 가지 핵심 해석 가능성 차원을 정의하며, 이는 단순함과 포괄성을 정의한다.
  • 충실도 평가를 위해 원본 특성과 추출된 특성 간 상호정보를 사용해 정보 유지 정도를 측정하고, 설명의 강건성을 평가하기 위해 펌정 기반 테스트를 도입한다.
  • 단조성과 펌정 안정성과 같은 지표를 적용해 입력 수정에 따른 설명의 일반화 정도를 평가하며, 특히 텍스트 분류 작업에서의 구체적 평가를 수행한다.
  • CNN과 같은 모델과 LIME, Grad-CAM, Integrated Gradients와 같은 방법을 사용해 벤치마크 데이터셋에서 프레임워크를 검증하며, 다양한 설명 방식에 걸쳐 지표를 계산한다.
  • 성능이 특성 추출기 또는 해석 가능성 모델을 별도로 수정함으로써 단순함, 포괄성, 충실도에서 독립적으로 평가될 수 있도록, 수직 평가가 가능하게 한다.

실험 결과

연구 질문

  • RQ1사용자 연구에 의존하지 않고 해석 가능성을 객관적으로 평가할 수 있는 방법은 무엇인가?
  • RQ2단순함, 포괄성, 충실도는 얼마나 정량적으로 모델의 해석 가능성 방법에서 측정될 수 있는가?
  • RQ3특성 추출기와 해석 가능성 모델은 해석 가능성 지표에 어떻게 독립적으로 기여하는가?
  • RQ4해당 지표들은 다양한 설명 방식(예: 기여도, 예시 등)에 적용 가능한 모odu lar 형식으로 설계될 수 있는가?
  • RQ5최신 기술적 방법들은 이러한 정량적 해석 가능성 차원에서 어떻게 비교되는가?

주요 결과

  • Integrated Gradients는 대규모 비핵심 단어가 대체된 경우에도 높은 예측 안정성을 유지함으로써 뛰어난 포괄성을 보였다.
  • 펌정 테스트 결과, IntGrad는 펌정된 샘플의 높은 비율에서 원래 클래스 예측을 유지했으며, 이는 강건하고 일반화된 설명을 제공함을 확인했다.
  • 서로 정보 지표는 특성 추출기가 충실도에 크게 영향을 미친다는 것을 드러내었으며, 높은 상호정보는 관련 입력 정보의 보존 정도를 의미한다.
  • 이 방법은 IntGrad의 설명이 높은 일반성과 정확성을 동시에 지닌다는 점을 특정하였으며, LIME과 Grad-CAM에 비해 포괄성과 충실도에서 뛰어났다.
  • 연구는 특성 추출기와 해석 가능성 모델을 해석 가능성에 대해 별개로 최적화할 수 있음을 확인하였으며, 해석 가능성 방법의 수직 분해가 검증되었다.
  • 제안된 지표들은 정량적 기준에 기반해 잠재력이 높은 해석 방법을 사전에 선별함으로써 사용자 연구의 전반적인 필요성을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.