Skip to main content
QUICK REVIEW

[논문 리뷰] How model accuracy and explanation fidelity influence user trust

Andrea Papenmeier, Gwenn Englebienne|arXiv (Cornell University)|2019. 07. 26.
Explainable Artificial Intelligence (XAI)참고 문헌 21인용 수 62
한 줄 요약

연구는 모델 정확도가 설명 충실도보다 사용자 신뢰를 더 강하게 좌우하며, 설명이 비합리적이거나 고정밀도 모델과 불일치하면 신뢰를 해칠 수 있다; 관찰된 신뢰와 자기보고된 신뢰가 다를 수 있다.

ABSTRACT

Machine learning systems have become popular in fields such as marketing, financing, or data mining. While they are highly accurate, complex machine learning systems pose challenges for engineers and users. Their inherent complexity makes it impossible to easily judge their fairness and the correctness of statistically learned relations between variables and classes. Explainable AI aims to solve this challenge by modelling explanations alongside with the classifiers, potentially improving user trust and acceptance. However, users should not be fooled by persuasive, yet untruthful explanations. We therefore conduct a user study in which we investigate the effects of model accuracy and explanation fidelity, i.e. how truthfully the explanation represents the underlying model, on user trust. Our findings show that accuracy is more important for user trust than explainability. Adding an explanation for a classification result can potentially harm trust, e.g. when adding nonsensical explanations. We also found that users cannot be tricked by high-fidelity explanations into having trust for a bad classifier. Furthermore, we found a mismatch between observed (implicit) and self-reported (explicit) trust.

연구 동기 및 목표

  • 자동 의사결정 시스템의 정확도가 사용자 신뢰에 어떤 영향을 미치는지 검토한다.
  • 설명의 존재 여부와 충실도가 사용자 신뢰에 어떤 영향을 미치는지 조사한다.
  • 정확도와 설명 충실도의 상호작용이 신뢰에 어떤 영향을 미치는지 평가한다.
  • 높은 및 낮은 충실도를 갖는 최소한의 설명 접근법을 검증한다.
  • 설명이 가능한 AI 실무자들을 위한 신뢰 역학에 대한 실증적 통찰을 제공한다.

제안 방법

  • 세 가지 정확도 수준(high, medium, low)과 세 가지 설명 충실도(high, low, none)를 결합한 아홉 가지 분류기-설명 조건을 개발한다.
  • 트윗을 공격적(모욕적)인지 여부로 분류하는 소셜 미디어 관리 시나리오를 사용한다.
  • 세 가지 분류기: 높은 정확도(CNN 기반), 중간 정확도(로지스틱 회귀), 낮은 정확도(역 라벨 CNN)로 학습시킨다.
  • 설명 생성: 높은 충실도는 CNN에서 L2X를 활용하여 높은 정확도 및 역레이블 모델에 대해; 중간은 높은 충실도 계수로; 낮은 충실도 설명은 임의의 단어 선택으로 생성한다.
  • 충실도를 검증하기 위해 텍스트를 선택된 특징으로 축소하고 예측이 ground truth와 일치하는지 확인한다.
  • 피험자 간 연구를 통해 327명의 참가자(286명의 유효 데이터)로 자기보고된 신뢰와 행동으로 관찰된 신뢰를 측정하는 연구를 수행한다.
  • 사전 연구에서 수동 라벨링 작업을 수행한 다음 시스템 보조 라벨링으로 15개의 트윗을 라벨링하고, Körber (2018) 설문지를 사용해 인지 이해도와 신뢰를 측정한다.
  • 신뢰 데이터를 Mann-Whitney U 검정과 다중 비교를 위한 Bonferroni 보정으로 분석한다.

실험 결과

연구 질문

  • RQ1RQ1: 자동 의사결정 시스템의 정확도가 사용자 신뢰에 어떤 영향을 미치는가?
  • RQ2RQ2: 설명의 존재 여부와 충실도 수준이 사용자 신뢰에 어떤 영향을 미치는가?
  • RQ3RQ3: 정확도와 설명 충실도가 상호작용하여 지각된 이해와 신뢰 역학을 어떻게 형성하는가?
  • RQ4RQ4: 관찰된(행동) 신뢰 지표가 자기보고 신뢰 설문지와 일치하는가?
  • RQ5RQ5: 높은 충실도 설명이 성능이 낮은 분류기를 사용자에게 오도할 수 있는가?

주요 결과

  • 정확도가 사용자 신뢰에 가장 큰 영향을 미쳤다; 더 높은 정확도가 일반적으로 더 높은 신뢰와 예측 가능성 평가를 가져왔다.
  • 설명의 존재가 어떤 조건에서도 자기보고 신뢰에 긍정적으로 작용하지 않았고, 고충실도 설명은 중간 정확도에서 신뢰를 유지할 수 있었지만 저충실도는 신뢰를 떨어뜨렸다.
  • 고정밀도 시스템의 경우 어떤 설명도(고충실도나 저충실도) 설명이 없는 경우보다 신뢰를 감소시키는 경향이 있었다.
  • 중간 정확도에서 고충실도 설명은 신뢰를 해치지 않았고, 저충실도 설명은 그랬다.
  • 참가자들은 고충실도 설명과 높은 정확도에 대해 더 높은 관찰된 신뢰(행동)를 보였으며, 설명이 없는 경우보다 차이가 있었다.
  • 나쁜 분류기를 설명과 함께 사용할 때도 사용자가 속지 않는다는 증거가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.