Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring the Quality of Explanations: The System Causability Scale (SCS). Comparing Human and Machine Explanations

Andreas Holzinger, André Carrington|PubMed|2019. 12. 19.
Explainable Artificial Intelligence (XAI)참고 문헌 29인용 수 12
한 줄 요약

이 논문은 인간-AI 인터페이스에서 설명 품질을 평가하기 위해 시스템 사용성 척도를 영감으로 삼아 개발한 10개 항목으로 구성된 리커트 척도인 시스템 인과가능성 척도(Scale of Causability, SCS)를 소개한다. 특히 의료 AI 분야에서 적용된다. 신뢰도가 매우 높으며(Cronbach’s alpha = .91), 프레밍햄 위험 도구에 적용하여 높은 SCS 점수(0.86)를 기록하여 설명의 강력한 인과가능성이 인식됨을 보여준다.

ABSTRACT

Recent success in Artificial Intelligence (AI) and Machine Learning (ML) allow problem solving automatically without any human intervention. Autonomous approaches can be very convenient. However, in certain domains, e.g., in the medical domain, it is necessary to enable a domain expert to understand, <i>why</i> an algorithm came up with a certain result. Consequently, the field of Explainable AI (xAI) rapidly gained interest worldwide in various domains, particularly in medicine. Explainable AI studies transparency and traceability of opaque AI/ML and there are already a huge variety of methods. For example with layer-wise relevance propagation relevant parts of inputs to, and representations in, a neural network which caused a result, can be highlighted. This is a first important step to ensure that end users, e.g., medical professionals, assume responsibility for decision making with AI/ML and of interest to professionals and regulators. Interactive ML adds the component of human expertise to AI/ML processes by enabling them to re-enact and retrace AI/ML results, e.g. let them check it for plausibility. This requires new human-AI interfaces for explainable AI. In order to build effective and efficient interactive human-AI interfaces we have to deal with the question of <i>how to evaluate the quality of explanations</i> given by an explainable AI system. In this paper we introduce our System Causability Scale to measure the quality of explanations. It is based on our notion of Causability (Holzinger et al. in Wiley Interdiscip Rev Data Min Knowl Discov 9(4), 2019) combined with concepts adapted from a widely-accepted usability scale.

연구 동기 및 목표

  • 해석 가능 AI(xAI) 시스템에서 설명 품질을 평가하기 위한 표준화된 도구의 부족을 해결하기 위해.
  • 분야 전문가들이 인식하는 AI 설명의 인과적 이해 가능성과 사용 가능성을 측정하기 위한 신뢰도가 높고 신속하며 심리측정적으로 타당한 도구를 개발하기 위해.
  • 의료와 같은 고위험 분야에서 설명이 이해, 신뢰 및 의사결정 지원에 얼마나 효과적으로 기여하는지 평가하여 효과적인 인간-AI 인터페이스 설계를 뒷받침하기 위해.
  • 기존의 사용성 지표와의 비교를 통해 SCS의 타당성을 검증하고, 실제 의료 예측 모델에 적용 가능한지를 입증하기 위해.

제안 방법

  • 일반 사용성보다는 인과가능성에 초점을 맞춘 10개 항목의 리커트 척도 도구를 개발하기 위해 시스템 사용성 척도(SUS) 프레임워크를 변형하였다.
  • 완전한 인과적 요인의 포함 여부, 맥락 내 명확성, 세부 정보 조정 가능성, 외부 지원에 대한 독립성, 설명 제공의 적시성 등 핵심 차원을 평가할 수 있도록 항목을 설계하였다.
  • 실제 의료 환경에서 설명 품질을 평가하기 위해 널리 사용되는 임상 예측 모델인 프레밍햄 위험 도구(Framingham Risk Tool, FRT)에 SCS를 적용하였다.
  • 내적 일관성은 Cronbach’s alpha를 사용해 계산하였고, SCS와 원래 SUS 간의 상관관계를 분석하여 수렴 타당성을 평가하였다.
  • 각 항목에 대해 5점 리커트 척도(1 = 강하게 반대, 5 = 강하게 동의)를 사용하였으며, 총점은 0–1 범위로 정규화하였다.
  • 실제 의료 전문의를 대상으로 시범 평가를 수행하여 실제 적용 시 설명의 사용성과 인식된 품질을 점검하였다.

실험 결과

연구 질문

  • RQ1인간-AI 인터페이스에서 설명의 품질을 어떻게 체계적으로 측정할 수 있을까? 이는 설명의 인과적 투명성과 사용 가능성을 반영해야 한다.
  • RQ2SCS가 기존의 사용성 지표(예: SUS)와 얼마나 관련이 깊은가? 이는 SCS의 타당성을 입증하는 데 기여한다.
  • RQ3SCS는 실제 의료 AI 시스템(예: 프레밍햄 위험 도구)에서 설명의 인식된 품질을 효과적으로 구분할 수 있는가?
  • RQ4SCS는 다양한 사용자와 맥락에서 설명 품질 측정에 대해 얼마나 신뢰할 수 있는가?

주요 결과

  • 시스템 인과가능성 척도(SCS)는 Cronbach’s alpha가 .91로 매우 높은 내적 일관성을 보이며 강력한 신뢰도를 입증하였다.
  • 원래의 시스템 사용성 척도(SUS)와 매우 높은 상관관계(r = .985)를 보이며, 이는 SCS의 수렴 타당성을 뒷받침한다.
  • 프레밍햄 위험 도구에 적용한 결과, SCS는 정규화된 점수 0.86을 기록하여 설명의 강력한 인식된 인과가능성을 나타냈다.
  • '맥락 내에서 이해됨'(평가 5점) 및 '보조 지원이 필요 없음'(평가 5점)과 같은 항목이 가장 높은 점수를 받았으며, 이는 명확성과 독립성의 우수함을 반영한다.
  • 반면 '지식 기반과 함께 사용함'(평가 3점) 및 '빠르게 학습함'(평가 3점) 항목은 낮은 점수를 기록하여 인터페이스 개선이 필요한 영역임을 드러냈다.
  • 두 번째 유도된 척도와의 상관계수(r = .664)는 SCS가 일반 사용성과는 다소 다른 개념을 측정하지만, 관련된 개념임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.