Skip to main content
QUICK REVIEW

[논문 리뷰] A Meta Survey of Quality Evaluation Criteria in Explanation Methods

Helena Löfström, Karl Hammar|arXiv (Cornell University)|2022. 03. 25.
Explainable Artificial Intelligence (XAI)참고 문헌 26인용 수 4
한 줄 요약

이 논문은 XAI에서 설명 방법의 비교 평가를 가능하게 하기 위해 '적절한 신뢰'를 측정 가능한 결과 지표로 제안한다. 15편의 문헌 조사 분석을 통해 모델, 설명, 사용자 세 가지 품질 측면에서 성능, 적절한 신뢰, 설명 만족도, 신뢰성의 네 가지 핵심 기준을 도출하여 평가의 표준화와 비교 연구에서의 주관성 해소를 위한 통합 모델을 제공한다.

ABSTRACT

Explanation methods and their evaluation have become a significant issue in explainable artificial intelligence (XAI) due to the recent surge of opaque AI models in decision support systems (DSS). Since the most accurate AI models are opaque with low transparency and comprehensibility, explanations are essential for bias detection and control of uncertainty. There are a plethora of criteria to choose from when evaluating explanation method quality. However, since existing criteria focus on evaluating single explanation methods, it is not obvious how to compare the quality of different methods. This lack of consensus creates a critical shortage of rigour in the field, although little is written about comparative evaluations of explanation methods. In this paper, we have conducted a semi-systematic meta-survey over fifteen literature surveys covering the evaluation of explainability to identify existing criteria usable for comparative evaluations of explanation methods. The main contribution in the paper is the suggestion to use appropriate trust as a criterion to measure the outcome of the subjective evaluation criteria and consequently make comparative evaluations possible. We also present a model of explanation quality aspects. In the model, criteria with similar definitions are grouped and related to three identified aspects of quality; model, explanation, and user. We also notice four commonly accepted criteria (groups) in the literature, covering all aspects of explanation quality: Performance, appropriate trust, explanation satisfaction, and fidelity. We suggest the model be used as a chart for comparative evaluations to create more generalisable research in explanation quality.

연구 동기 및 목표

  • XAI에서 설명 방법 평가의 공감대 부족과 표준화 부족 문제를 해결하기 위해.
  • 기존 서베이에서 공통으로 수용된 평가 기준을 도출하여 비교 평가를 가능하게 하기 위해.
  • 사용자 평가의 주관성을 해소하기 위해 '적절한 신뢰'를 객관적인 결과 지표로 제안하기 위해.
  • 모델, 설명, 사용자 측면의 기준을 통합한 설명 품질의 체계적 모델을 개발하기 위해.
  • XAI 연구에서 설명 방법의 일반화 가능하고 비교 가능한 평가를 위한 프레임워크를 제공하기 위해.

제안 방법

  • XAI 설명 방법 평가에 관한 15편의 문헌 서베이에 대한 반체계적인 메타-서베이를 수행하였다.
  • 서베이에서 도출된 평가 기준을 공통된 정의와 목적에 기반해 일관된 범주로 묶고 정리하였다.
  • 설명 품질의 세 핵심 요소인 모델, 설명, 사용자 세 가지를 식별하고, 각 요소에 관련된 기준을 연결하였다.
  • 주관적인 사용자 평가 기준의 객관적 비교를 가능하게 하기 위해 '적절한 신뢰'를 측정 가능한 결과 지표로 제안하였다.
  • 세 요소에 걸쳐 11개의 기준 그룹을 통합한 고수준의 설명 품질 모델을 개발하였다.
  • 모델의 유용성을 검증하기 위해, 성능, 적절한 신뢰, 설명 만족도, 신뢰성의 네 가지 기준이 15편의 서베이 중 초과 절반 이상에 등장하고 세 품질 요소 전반에 걸쳐 분포함을 입증하였다.

실험 결과

연구 질문

  • RQ1설명 방법 평가에 관한 문헌 서베이에서 가장 일관되게 사용되는 평가 기준은 무엇인가?
  • RQ2주관적인 사용자 평가 기준은 어떻게 객관적이고 비교 가능한 지표로 전환될 수 있는가?
  • RQ3설명 품질의 핵심 요소는 무엇이며, 평가 기준은 그 요소들과 어떻게 관련되는가?
  • RQ4기존 기준들로부터 비교 평가를 지원할 수 있는 통합된 설명 품질 모델을 구성할 수 있는가?
  • RQ5성능, 신뢰성, 설명 만족도, 적절한 신뢰는 설명 방법 평가의 기초 기준으로서 어느 정도의 중요성을 지닌다?

주요 결과

  • 성능, 적절한 신뢰, 설명 만족도, 신뢰성의 네 가지 기준은 조사된 15편의 문헌 서베이 중 초과 절반 이상에서 일관되게 언급되어 그 중요성에 대한 광범위한 공감대를 보여준다.
  • 메타-서베이에서 11개의 독립된 평가 기준 그룹을 식별하였으며, 이를 모델, 설명, 사용자 세 가지 품질 요소로 정리하였다.
  • '적절한 신뢰'는 주관적인 사용자 평가 기준의 성공을 객관적으로 측정할 수 있는 핵심 결과 지표로 확인되었으며, 다양한 방법 간 비교를 가능하게 한다.
  • 기존 평가 관행은 인간이 참여하는 평가에 크게 의존하고 있어, 연구 간 재현성과 비교 가능성에 도전 과제를 안고 있음을 발견하였다.
  • 제안된 설명 품질 모델은 다양한 평가 기준을 통합하고 XAI 연구의 보다 일반화 가능한 접근을 지원하는 체계적 프레임워크를 제공한다.
  • 많은 기준들이(예: 신뢰성, 자신감, 확신) 연구 간에 서로 뒤섞이거나 모호하게 사용되고 있어, 표준화된 정의와 기준이 필요하다는 점을 연구가 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.