Skip to main content
QUICK REVIEW

[논문 리뷰] Latent SHAP: Toward Practical Human-Interpretable Explanations

Ron Bitton, Alon Malach|arXiv (Cornell University)|2022. 11. 27.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

잠재 SHAP는 입력 특징에서 이해할 수 있는 개념으로의 완전한 역변환 가능성이 없는 복잡한 모델에 대해 국소적으로 충실하고 인간이 이해할 수 있는 설명을 생성하는 모델에 종속되지 않는 프레임워크를 제안한다. 인간이 이해할 수 있는 특징의 잠재 공간을 활용하고 이 공간에서 샤플리 값에 대한 근사치를 계산함으로써, 직접적인 역변환이 불가능한 경우에도 직관적이고 고수준의 설명을 가능하게 하며, 유명인 미모 분류 작업에서 표준 SHAP보다 해석 가능성 면에서 뛰어나다.

ABSTRACT

Model agnostic feature attribution algorithms (such as SHAP and LIME) are ubiquitous techniques for explaining the decisions of complex classification models, such as deep neural networks. However, since complex classification models produce superior performance when trained on low-level (or encoded) features, in many cases, the explanations generated by these algorithms are neither interpretable nor usable by humans. Methods proposed in recent studies that support the generation of human-interpretable explanations are impractical, because they require a fully invertible transformation function that maps the model's input features to the human-interpretable features. In this work, we introduce Latent SHAP, a black-box feature attribution framework that provides human-interpretable explanations, without the requirement for a fully invertible transformation function. We demonstrate Latent SHAP's effectiveness using (1) a controlled experiment where invertible transformation functions are available, which enables robust quantitative evaluation of our method, and (2) celebrity attractiveness classification (using the CelebA dataset) where invertible transformation functions are not available, which enables thorough qualitative evaluation of our method.

연구 동기 및 목표

  • 기존의 SHAP나 LIME와 같은 모델에 종속되지 않는 설명 방법의 한계를 해결하기 위해, 인간이 이해하기 어려운 저수준 또는 인코딩된 입력 특징으로 표현되는 설명을 생성하는 문제를 해결한다.
  • 입력 특징에서 이러한 개념으로의 완전한 역변환 가능성이 없더라도, '웃고 있는가', '귀걸이를 쓰고 있는가'와 같은 고수준의 인간이 이해할 수 있는 특징으로 설명을 생성하는 프레임워크를 개발한다.
  • 실제 응용 사례에서 역변환 가능성이 불가능한 경우에도 원본 모델의 행동에 충실한 설명을 보장하면서 해석 가능성의 향상을 도모한다.
  • 유명인의 미모 분류 작업을 대상으로, 역변환 가능성이 있는 경우에 대한 정량적 평가와 비역변환 가능한 설정에서의 정성적 평가를 모두 수행한다.

제안 방법

  • 이 프레임워크는 블랙박스 방식으로 작동하며, 사전 학습된 모델과 별도의 인간이 이해할 수 있는 특징 추출기(예: 고수준 개념의 잠재 공간으로 입력을 매핑)를 사용한다.
  • 이해 가능한 잠재 공간에서의 특징 기여도를 계산하기 위해 SHAP 알고리즘의 변종을 적용하며, 배경 데이터셋을 사용하여 샤플리 값을 효율적으로 근사한다.
  • 원본 입력에서 이해 가능한 특징으로의 변환이 역변환이 가능하지 않아도 되므로, 이러한 맵핑이 모호하거나 불가능한 상황에서도 활용 가능하다.
  • 각 이해 가능한 특징의 기여도 기대치를 추정하기 위해 배경 데이터셋을 사용하며, 이는 편차 기반 근사치를 통한 국소 설명을 가능하게 한다.
  • 이 방법은 국소적 설명뿐 아니라 글로벌 설명 생성도 지원하며, 각 인스턴스별 특징 중요도 점수를 시각화하고 데이터셋 전반에 걸쳐 집계한다.
  • 입력 이미지에서 파생된 분리된, 인간이 읽을 수 있는 특징(예: '굽이진 눈썹', '높은 턱뼈')의 집합을 정의하여 개념 기반 설명을 통합한다.

실험 결과

연구 질문

  • RQ1입력 특징에서 이해 가능한 특징으로의 변환이 역변환이 불가능한 경우에도 잠재 SHAP가 국소적으로 충실하고 직관적인 인간 해석이 가능한 설명을 생성할 수 있는가?
  • RQ2실제 이미지 분류 작업에서 잠재 SHAP의 설명은 표준 SHAP에 비해 해석 가능성과 의미의 깊이 면에서 어떻게 비교되는가?
  • RQ3잠재 SHAP의 글로벌 특징 기여도는 인간이 이해할 수 있는 특징과 모델 예측 간의 진짜 상관관계와 어느 정도 일치하는가?
  • RQ4배경 데이터셋의 크기가 근사치에 사용될 때 설명의 민감도는 얼마나 되는가?

주요 결과

  • 역변환 가능한 변환을 사용한 제어 실험에서, 잠재 SHAP의 설명은 표준 SHAP보다 정성적으로 더 직관적이었으며, 사용자가 '웃고 있는가'나 '귀걸이를 쓰고 있는가'와 같은 고수준 특징을 더 쉽게 식별할 수 있었다.
  • CelebA 데이터셋에서 잠재 SHAP는 아름다운 얼굴과 그렇지 않은 얼굴을 명확히 구분하는 설명을 생성했으며, 아름다운 얼굴에서는 '웃고 있는가'와 같은 몇 가지 핵심 특징에 높은 양의 중요도를 할당했고, 그렇지 않은 얼굴에서는 많은 특징에 낮거나 음수의 중요도를 할당했다.
  • 잠재 SHAP의 글로벌 특징 기여도는 진짜 상관관계와 밀접하게 일치했다: 예를 들어 '강한 메이크업'은 높은 값일수록 높은 양의 기여도를 보였고, 낮은 값일수록 낮은 기여도를 보여, 이와 같은 특징이 미모와 관련이 있음을 반영했다.
  • 미모와 반비례하는 남성 특징은 잠재 SHAP에 의해 올바르게 음수 기여도를 할당받아, 모델 행동에 대한 충실도가 확인되었다.
  • 배경 데이터셋 크기가 증가함에 따라 특징 중요도에 큰 영향을 미쳤다: 예를 들어, '높은 턱뼈'의 중요도는 배경 크기가 50에서 150으로 증가함에 따라 중요도가 -0.04였던 7위에서 상위 9개 이내로 밀려났다.
  • 기존의 SHAP가 픽셀 수준의 설명이 의미가 없어지는 경우에 실패하는 비역변환 가능한 설정에서도 잠재 SHAP는 해석 가능성과 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.