Skip to main content
QUICK REVIEW

[논문 리뷰] Should We Trust (X)AI? Design Dimensions for Structured Experimental Evaluations

Fabian Sperrle, Mennatallah El‐Assady|arXiv (Cornell University)|2020. 09. 14.
Explainable Artificial Intelligence (XAI)참고 문헌 63인용 수 10
한 줄 요약

이 논문은 사용자 신뢰, 설명 품질, 모델 특성, 작업 맥락, 연구 설계를 중심으로 설명 가능 인공지능(XAI) 시스템 평가를 위한 구조적 프레임워크를 제안한다. 기존 XAI 평가 관행의 핵심 격차를 규명하고, 신뢰 및 편향 전파를 위한 종속성 모델을 도입함으로써 HCI, 시각화 및 기계학습 분야에서 보다 철저하고 사용자 중심의 실험적 평가가 가능하도록 한다.

ABSTRACT

This paper systematically derives design dimensions for the structured evaluation of explainable artificial intelligence (XAI) approaches. These dimensions enable a descriptive characterization, facilitating comparisons between different study designs. They further structure the design space of XAI, converging towards a precise terminology required for a rigorous study of XAI. Our literature review differentiates between comparative studies and application papers, revealing methodological differences between the fields of machine learning, human-computer interaction, and visual analytics. Generally, each of these disciplines targets specific parts of the XAI process. Bridging the resulting gaps enables a holistic evaluation of XAI in real-world scenarios, as proposed by our conceptual model characterizing bias sources and trust-building. Furthermore, we identify and discuss the potential for future work based on observed research gaps that should lead to better coverage of the proposed model.

연구 동기 및 목표

  • 다양한 연구 분야에서 설명 가능 인공지능(XAI) 시스템에 대한 표준화되고 체계적인 평가 방법의 부족을 해결하기 위해.
  • 의미 있는 비교 및 XAI 연구 설계의 특성화를 가능하게 하는 핵심 설계 차원을 식별하고 체계화하기 위해.
  • 기계학습, 인간-컴퓨터 상호작용(HCI), 시각 분석 분야 간 XAI 평가의 방법론적 격차를 메우기 위해.
  • XAI 과정 전반에 걸쳐 신뢰 구축과 편향 전파를 매핑하는 종속성 모델을 개발하여 통합적 평가를 가능하게 하기 위해.
  • 미사용된 설계 차원과 XAI 평가의 실험적 엄밀성 향상을 위한 기회를 식별함으로써 향후 연구를 이끌기 위해.

제안 방법

  • 최근 5년간의 HCI 및 시각화 공동체에서의 XAI 평가 연구에 대한 종합적인 문헌 고찰을 수행하였다.
  • 비교 연구 및 응용 논문들에서 유도된 설계 차원을 사용자, 설명, 모델, 작업 및 환경, 연구 설계의 다섯 핵심 그룹으로 분류하고 통합하였다.
  • 사용자, 설명기, 모델, 환경를 포함한 XAI 과정 전반에서 신뢰와 편향이 어떻게 전파되는지를 보여주는 종속성 모델을 제안하였다.
  • 분야 간 방법론적 차이를 분석하여 도메인 특화 평가 우선순위와 격차를 규명하였다.
  • 자기 보고 형식의 후행 설문지에 대한 의존도를 줄이기 위해, 시뮬레이션 가능성, 조언의 무게 등 신뢰의 프록시를 식별하였다.
  • 보고된 차원에 대한 정성적 코드 분석을 통해 일반화 가능한 프레임워크를 유도하였으며, 이는 XAI 평가 맥락 전반에 적용 가능하다.

실험 결과

연구 질문

  • RQ1어떤 핵심 설계 차원들이 XAI 시스템의 철저하고 비교 가능한 평가를 구조화하고 가능하게 하는가?
  • RQ2XAI 연구에서 기계학습, HCI, 시각 분석 공동체 간 평가 관행은 어떻게 다름가?
  • RQ3신뢰 조정과 설명의 정확성 측면에서 현재 XAI 평가 방법론의 주요 연구 격차는 무엇인가?
  • RQ4신뢰와 편향은 XAI 과정 전반에서 어떻게 전파되며, 이 체인에서 핵심적인 구성 요소는 무엇인가?
  • RQ5주관적인 자기 보고 형식에 의존하지 않고 XAI 시스템을 평가하기 위해 가장 효과적인 암묵적 또는 프록시 측정 방법은 무엇인가?

주요 결과

  • 문헌 고찰 결과, 대부분의 비교적 XAI 연구는 리커트 척도 기반의 신뢰성 평가에 크게 의존하여, 사용자의 사전 인식에 기인한 잠재적 편향을 유발할 수 있었다.
  • 많은 수의 XAI 평가가 해석 가능성, 책임성, 사용자 동기 등 핵심 차원을 체계적으로 평가하지 못하고 있었다.
  • 설명의 정확성은 종종 간과되며, 이는 사용자 신뢰를 악용하는 유사하지만 오류가 있는 설명을 생성할 위험을 내포하고 있다.
  • 종속성 모델은 사용자, 설명기, 모델, 환경를 포함한 다수의 주체를 통해 신뢰와 편향이 전파될 수 있음을 규명하며, 통합적 평가의 필요성을 강조한다.
  • 시뮬레이션 가능성과 조언의 무게와 같은 프록시는 자기 보고 형식의 신뢰 측정에 대한 의존도를 줄이며, 잠재적으로 편향을 유발할 수 있는 설문지에 대한 대안으로 유망한 것으로 나타났다.
  • 시각 분석, 추천 시스템, 전문가 중심 응용 분야의 고유한 목표와 부합하는 도메인 특화 설계 차원의 맞춤형 적용이 절실한 상황이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.