Skip to main content
QUICK REVIEW

[논문 리뷰] On the overlooked issue of defining explanation objectives for local-surrogate explainers

Rafael Poyiadzi, Xavier Renard|arXiv (Cornell University)|2021. 06. 10.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 국소 대체 해석 방법에서의 핵심적인 간극을 규명한다: 비록 동일한 목표인 개별 모델 예측을 설명하는 데에 초점이 맞춰져 있지만, 설명 목적을 명확히 정의하지 못함으로써 일관성 없고 비교할 수 없는 출력 결과를 낳고 있다. 저자들은 LIME, KernelSHAP, GSLS와 같은 방법들에서의 근접성 영역 구성 전략을 분석하여, 블랙박스 모델로부터 추출하는 정보의 차이를 드러내며, 이는 해석 가능성 도구의 비교 가능성과 사용자 신뢰를 떨어뜨린다.

ABSTRACT

Local surrogate approaches for explaining machine learning model predictions have appealing properties, such as being model-agnostic and flexible in their modelling. Several methods exist that fit this description and share this goal. However, despite their shared overall procedure, they set out different objectives, extract different information from the black-box, and consequently produce diverse explanations, that are -- in general -- incomparable. In this work we review the similarities and differences amongst multiple methods, with a particular focus on what information they extract from the model, as this has large impact on the output: the explanation. We discuss the implications of the lack of agreement, and clarity, amongst the methods' objectives on the research and practice of explainability.

연구 동기 및 목표

  • 국소 대체 해석기들 간의 설명 목적에 대한 모호함을 규명하고 분석하는 것.
  • 국소 대체 해석 방법에서 다양한 근접성 영역 전략이 블랙박스 모델에서 어떻게 다른 정보를 추출하는지 조사하는 것.
  • 이러한 모호성이 해석 방법의 비교 가능성과 해석 가능성 도구의 실용적 구현에 끼치는 영향을 부각하는 것.
  • 해석 방법을 선택하거나 설계하기 전에 사용자 중심의 해석 목적을 명시할 것을 주장하는 것.
  • 해석 가능성 연구의 투명성과 신뢰성을 향상시키기 위해, 해석 가능성 목표를 공식화하고 잘 정의된 형태로 도입할 것을 촉구하는 것.

제안 방법

  • 논문은 국소 대체 해석기에서 근접성 영역 구성의 이론적 분석을 수행하며, 각 방법이 설명하고자 하는 예측 주변의 인스턴스를 어떻게 샘플링하고 가중치를 부여하는지에 중점을 둔다.
  • LIME, GSLS, LEAP, KernelSHAP 간의 근접성 영역 전략을 비교하여 샘플링 분포와 가중치 부여 방식의 차이를 강조한다.
  • 공통된 실험 설정(하프문스 데이터셋 및 신경망 블랙박스)을 사용하여 각 방법이 생성한 근접성 영역을 시각화하고 대조한다.
  • KernelSHAP의 정보 추출 과정을 수식적으로 정의하며, 샤플리 값 근사화와 특성 독립성 등의 가정에 의존함을 보여준다.
  • LIME와 KernelSHAP의 설명 결과를 어덜트 데이터셋에서 평가하여, 동일한 예측에 대해 서로 다른 특성 기여도 순위가 나타나는 사례를 제시한다.
  • 현재 방법들의 히우리스틱적이고 근사적인 성격을 비판하며, 출력 결과가 공식적인 목적어와 명확한 의미적 연결을 맺지 못하고 있음을 주장한다.

실험 결과

연구 질문

  • RQ1다양한 국소 대체 해석기들은 자신의 설명 목적을 어떻게 정의하며, 이 목적어는 얼마나 투명하거나 일관성 있는가?
  • RQ2다양한 국소 대체 방법들은 블랙박스 모델에서 어떤 특정 정보를 추출하며, 이는 결과적인 해석에 어떻게 영향을 미치는가?
  • RQ3LIME과 KernelSHAP와 같은 방법들이 동일한 입력과 모델을 사용함에도 불구하고 동일한 예측에 대해 충돌하는 해석을 내놓는 이유는 무엇인가?
  • RQ4현재 국소 대체 방법들이 얼마나 많은 근사화와 가정에 의존하며, 이로 인해 출력의 해석 가능성에 손상이 가는가?
  • RQ5해석 가능성 연구 분야는 설명 목적을 방법 개발 이전에 공식화함으로써 어떻게 발전시킬 수 있는가?

주요 결과

  • 동일한 블랙박스 모델과 예측 대상을 사용함에도 불구하고, 다양한 국소 대체 방법은 동일한 인스턴스 주변에서 상당히 다른 근접성 영역을 생성한다.
  • LIME는 국소성 기반 가중치를 부여하는 가우시안 근접성 영역을 사용하는 반면, GSLS는 가장 가까운 반대결과 포인트 주변에서 균일하게 샘플링하여 다른 국소 표현을 생성한다.
  • KernelSHAP는 샤플리 값 근사화를 통해 정보를 추출하며, 특성 독립성과 선형성 가정에 의존하는데, 이는 특성의 진정한 기여도를 왜곡할 수 있다.
  • 동일한 높은 수준의 목표를 공유하고 있음에도 불구하고, LIME와 KernelSHAP는 어덜트 데이터셋에서 동일한 인스턴스에 대해 충돌하는 특성 기여도 순위를 도출한다.
  • 공식적이고 사용자 중심의 설명 목적어가 없음으로써 출력 결과가 비교 불가능해지며, 이는 방법 평가와 실생활 응용에서의 신뢰도를 저해한다.
  • 현재 국소 대체 해석 방법의 최첨단 기술은 '해결책을 먼저 제시하고 문제를 나중에 정의하는' 방식을 취하고 있어, 해석 결과의 신뢰성과 비교 가능성에 악영향을 미친다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.