Skip to main content
QUICK REVIEW

[논문 리뷰] Helpful, Misleading or Confusing: How Humans Perceive Fundamental Building Blocks of Artificial Intelligence Explanations

Edward Small, Yueqing Xuan|arXiv (Cornell University)|2023. 03. 02.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

이 논문은 이해, 자신감, 만족도를 평가하는 3-C 평가 프레임워크를 소개한다. 이는 수학적, 시각적, 텍스트 기반 설명과 같은 기본적인 AI 설명 빌딩 블록을 다양한 사용자가 어떻게 인지하는지 평가하기 위한 것이다. 연구는 설명의 효과성이 사용자 배경, 모odalitiy, 인지 부하에 따라 크게 달라질 수 있음을 보여주며, 잘못된 또는 혼란스러운 설명을 방지하기 위해 XAI에서 인간 중심 평가가 필요하다고 주장한다.

ABSTRACT

Explainable artificial intelligence techniques are developed at breakneck speed, but suitable evaluation approaches lag behind. With explainers becoming increasingly complex and a lack of consensus on how to assess their utility, it is challenging to judge the benefit and effectiveness of different explanations. To address this gap, we take a step back from sophisticated predictive algorithms and instead look into explainability of simple decision-making models. In this setting, we aim to assess how people perceive comprehensibility of their different representations such as mathematical formulation, graphical representation and textual summarisation (of varying complexity and scope). This allows us to capture how diverse stakeholders -- engineers, researchers, consumers, regulators and the like -- judge intelligibility of fundamental concepts that more elaborate artificial intelligence explanations are built from. This position paper charts our approach to establishing appropriate evaluation methodology as well as a conceptual and practical framework to facilitate setting up and executing relevant user studies.

연구 동기 및 목표

  • 비전문가 사용자를 포함한 설명 가능성 있는 AI(XAI) 분야에서의 공감대 형성과 표준화된 평가의 부족을 해결하기 위해.
  • 엔지니어, 규제 기관, 소비자와 같은 다양한 이해관계자가 수학적, 시각적, 텍스트 기반 설명 유형의 이해 가능성에 대해 어떻게 평가하는지 조사하기 위해.
  • 설명이 타당한 신뢰를 유도하는지 또는 오해와 과도한 의존을 유도하는지 확인하기 위해.
  • 인구통계학적 및 인지적 차이를 고려한 인간 중심 평가 프레임워크를 개발하기 위해.
  • 모델 정밀도 외에도 사용자 이해도, 자신감, 만족도를 기반으로 XAI 도구를 평가할 수 있는 기반을 마련하기 위해.

제안 방법

  • 이해도(설명된 내용과 누락된 내용에 대한 지식), 자신감(이해에 대한 확신), 만족도(신뢰성과 정보량에 대한 인식)를 평가하는 3-C 평가 프레임워크를 제안한다.
  • 정밀도와 진실성 보장을 위해 단순 예측 모델(선형 회귀, 로지스틱 회귀, 의사결정나무)에서 직접 유도된 설명을 사용하는 제어된 온라인 사용자 연구를 수행한다.
  • 수학적 표현, 시각화(예: 결정 경계, 특성 중요도), 텍스트 요약(대체 가능 조건 포함), 하이브리드 형식을 포함한 다양한 모odalitiy로 설명을 제시한다.
  • 대출 승인과 같은 실제 사례를 활용하여 생태학적 타당성과 참가자의 몰입도를 높이며, 특히 고위험 분야에서의 적용성을 강화한다.
  • 일부 조건에서 도메인 전문 용어를 가짜 명칭으로 대체하여 배경 지식에 기인한 편향을 줄인다.
  • 다양한 사용자 집단 간 설명 인식의 격차를 분석하기 위해 인구통계학적 데이터를 수집한다.

실험 결과

연구 질문

  • RQ1다양한 배경을 가진 사용자들이 다양한 모odalitiy에서 기본적인 AI 설명 빌딩 블록을 어떻게 해석하고 평가하는가?
  • RQ2설명 유형과 제시 방식이 이해도, 자신감, 만족도에 어느 정도 영향을 미치는가?
  • RQ3인지 과부하 또는 정보 과잉이 설명의 유용성을 어떻게 악화시키는가?
  • RQ4일부 설명 모odalitiy가 다른 것들보다 오해나 과도한 신뢰를 유도하기 쉬운가?
  • RQ5인구통계학적 및 교육적 차이가 설명 품질과 신뢰성에 대한 인식에 어떻게 영향을 미치는가?

주요 결과

  • 이해도는 설명 모odalitiy에 따라 크게 달라지며, 텍스트 및 시각적 형식이 빽빽한 수학적 표현보다 사용자 이해도에서 뛰어나다.
  • 이해에 대한 자신감은 실제 이해도와 항상 관련이 있는 것은 아니며, 잘못된 해석에 대해 과도한 자신감을 가질 수 있음을 시사한다.
  • 설명이 간결하고 핵심 결정보다 결정 요인을 강조할수록 사용자의 만족도가 높아지며, 이는 종종 더 포괄적인 설명보다도 더 효과적이다.
  • 정보 과잉은 주요 장벽이다: 너무 자세한 설명은 이해도를 향상시키지 못한 채 명확도를 떨어뜨리고 인지 부하를 증가시킨다.
  • 기술적 숙련도가 낮은 사용자는 내용이 사실일지라도 수학적 및 형식적 표현을 이해하는 데 더 어려움을 겪는다.
  • 대체 가능 조건 설명(예: '소득이 10,000 유로 더 높았다면 대출이 승인되었을 것이다')은 추상적인 모델 파rameter보다 직관적 이해를 촉진하는 데 더 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.