Skip to main content
QUICK REVIEW

[논문 리뷰] An Empirical Evaluation of the Rashomon Effect in Explainable Machine Learning

Sebastian Müller, Vanessa Toborek|arXiv (Cornell University)|2023. 06. 27.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

이 논문은 네 가지 다양한 데이터셋을 대상으로 모델, 데이터, 할당 방법의 변동성을 평가하여 설명 가능 기계학습에서 라슈모니 효과(Rashomon Effect)를 실증적으로 조사한다. 초과 조정이 안정적인 설명을 위해 필수적임을 입증하고, 방법 간 이견이 광범위하고 일관성 없음을 보이며, 유사도 측정법이 인식되는 설명 다양성에 크게 영향을 준다는 점을 밝혀내어 설명이 인지적 도구로서의 신뢰성에 도전한다.

ABSTRACT

The Rashomon Effect describes the following phenomenon: for a given dataset there may exist many models with equally good performance but with different solution strategies. The Rashomon Effect has implications for Explainable Machine Learning, especially for the comparability of explanations. We provide a unified view on three different comparison scenarios and conduct a quantitative evaluation across different datasets, models, attribution methods, and metrics. We find that hyperparameter-tuning plays a role and that metric selection matters. Our results provide empirical support for previously anecdotal evidence and exhibit challenges for both scientists and practitioners.

연구 동기 및 목표

  • 다양한 전략을 취하는 고성능 모델들이 존재하는 라슈모니 효과가 설명 가능 기계학습(XAI)의 신뢰성에 어떻게 영향을 주는지 조사하기 위해.
  • 모델 고유의 초과 조정이 할당 방법의 안정성에 어떤 영향을 미치는지 평가하기 위해.
  • 다양한 측정법과 모델 아키텍처 간 설명 비교의 일관성과 신뢰성 평가하기 위해.
  • 실제 응용 사례에서 할당 방법 간 해법 다양성과 이견의 정도를 정량화하기 위해.
  • XAI 응용에서 설명의 일관성 부족에 대한 오랫동안 제기된 비공식적 우려에 실증적 근거 제공하기 위해.

제안 방법

  • 동일한 모델, 동일한 방법, 다양한 초과 조정 설정에서의 수치적 안정성(동일 모델, 동일 방법, 초과 조정 설정 변화), 동일 방법, 다른 모델 가중치에서의 해법 다양성, 동일 모델에 대해 다른 방법을 적용한 이견을 평가하는 세 가지 다른 비교 시나리오를 통합적으로 실증 평가하였다.
  • 표현형(표현형, 이미지, 텍스트) 데이터셋 네 개(표현형: 독일 신용, 어덜트; 이미지: CIFAR-10; 텍스트: AG News)에서 다섯 가지 인기 있는 할당 방법(예: 통합 기울기, Grad-CAM, LIME)을 사용하였다.
  • 사용자 중심의 유사도 측정법(예: 부호 이견, 특성 이견, KS, LI)과 단순한(예: 유클리드 거리) 측정법을 사용하여 할당 점수를 비교하였다.
  • 각 모델에 대해 초과 조정을 광범위하게 수행하여 설명 출력의 민감도와 안정성을 평가하였다.
  • 평균 거리, 분산, 데이터셋 간 순위 일관성 등의 통계적 측정법을 사용하여 결과를 평가하였다.
  • 라슈모니 효과라는 동일한 이론적 시각 아래에서 설명 비교의 세 가지 다른 관점을 통합하는 체계적인 프레임워크를 사용하였다.

실험 결과

연구 질문

  • RQ1초과 조정은 다양한 모델 간 할당 설명의 안정성에 어떻게 영향을 미치는가?
  • RQ2동일한 데이터로 훈련된 다양한 모델 인스턴스 간에 해법 다양성—즉, 설명 전략의 변동성—은 어느 정도 나타나는가?
  • RQ3다른 유사도 측정법을 사용할 경우 할당 방법의 순위 일관성은 어떻게 되는가?
  • RQ4유사도 측정법의 선택이 설명 방법 간 이견 수준을 인식하는 데에 크게 영향을 미치는가?
  • RQ5다양한 데이터셋과 모델 아키텍처 간에 일관되고 신뢰할 수 있는 설명 비교를 달성할 수 있는가?

주요 결과

  • 초과 조정은 모델에 따라 다르게 작용한다: 할당 방법에 최적의 설정은 모델과 데이터셋에 따라 상당히 다름을 보이며, 안정적인 설명을 얻기 위해 각 모델에 맞는 조정이 필요하다.
  • 이견 기반 측정법(예: 부호 이견, 특성 이견)은 유클리드 거리보다 더 높은 거리와 더 큰 분산을 보였으며, 특히 복잡한 모델에서 두드러졌다.
  • 편경 기반 측정법(KS, LI)은 가장 일관된 성능과 가장 낮은 분산을 보였으며, 이는 다양한 모델 간 설명 비교에 더 높은 신뢰성을 지닌다는 것을 시사한다.
  • 이견 기반 측정법을 사용할 경우 모든 데이터셋에서 할당 방법의 순위가 일관되게 나타나지 않아 방법 비교의 높은 불안정성을 보여주었다.
  • 이견 측정법 하에서 유효한 설명 전략의 해공간은 매우 광범위하며, 이는 설명을 인지적 도구로 의존하는 데서 도전 과제를 제기한다.
  • 본 연구는 유사한 성능를 보이는 모델 간에도 설명을 재사용하는 것은 신뢰할 수 없고, 특히 중요한 응용 분야에서는 오해의 소지가 있음을 정량적 증거로 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.