Skip to main content
QUICK REVIEW

[논문 리뷰] User Trust on an Explainable AI-based Medical Diagnosis Support System

Yao Rong, Nora Castner|arXiv (Cornell University)|2022. 04. 26.
Explainable Artificial Intelligence (XAI)인용 수 6
한 줄 요약

이 연구는 흉부 X-ray 진료를 위한 설명 가능한 AI 시스템에서 사용자 신뢰를 평가한다. 방사선 전문의들은 원인적 설명을 확인하고 이를 수정할 수 있다. 모델 정확도가 74.1%임에도 불구하고, 방사선 전문의 중 46.4%만 예측에 동의하였으며, 자가 보고 신뢰도는 평균 3.2/5로 나타나 설명 가능성에도 불구하고 신뢰도가 제한적임을 시사한다. 이는 설명에 대한 과도한 의존을 보여준다.

ABSTRACT

Recent research has supported that system explainability improves user trust and willingness to use medical AI for diagnostic support. In this paper, we use chest disease diagnosis based on X-Ray images as a case study to investigate user trust and reliance. Building off explainability, we propose a support system where users (radiologists) can view causal explanations for final decisions. After observing these causal explanations, users provided their opinions of the model predictions and could correct explanations if they did not agree. We measured user trust as the agreement between the model's and the radiologist's diagnosis as well as the radiologists' feedback on the model explanations. Additionally, they reported their trust in the system. We tested our model on the CXR-Eye dataset and it achieved an overall accuracy of 74.1%. However, the experts in our user study agreed with the model for only 46.4% of the cases, indicating the necessity of improving the trust. The self-reported trust score was 3.2 on a scale of 1.0 to 5.0, showing that the users tended to trust the model but the trust still needs to be enhanced.

연구 동기 및 목표

  • 원인적 설명이 설명 가능한 AI 시스템에서 방사선 전문의의 신뢰도 및 의존도에 미치는 영향을 조사하기 위해.
  • 실제 진료 환경에서 관찰된 신뢰도(모델 예측 및 설명에 대한 동의)와 자가 보고 신뢰도(사용자 평가)를 측정하기 위해.
  • 사용자가 모델 설명을 수정하는 방식이 과도한 의존 또는 자율적 신뢰 행동을 드러내는지 탐색하기 위해.
  • AI 시스템에 익숙하지 않은 방사선 전문의에서 설명 가능성의 영향을 고려한 신뢰도 캘리브레이션을 평가하기 위해.
  • 방사선 영상 진료에 AI를 통합하는 데 장애가 되는 신뢰 및 사용성의 격차를 규명하기 위해.

제안 방법

  • CXREye 데이터셋을 사용하여 흉부 X-ray 진료를 위한 설명 가능한 AI 모델을 개발하고, 최종 예측에 대한 원인적 설명을 생성하였다.
  • 방사선 전문의가 먼저 X-ray 영상을 해석한 후, 모델 예측 및 그 원인적 설명을 확인하는 사용자 연구를 설계하였다.
  • 의견이 다른 경우 설명을 수정할 수 있도록 허용하였으며, 이러한 수정 사항을 관찰된 신뢰도의 지표로 활용하였다.
  • 관찰된 신뢰도는 방사선 전문의와 모델 예측 간의 일치율(46.4%)과 설명 수정에 대한 윌코크슨 부호 순위 검정을 통해 측정하였다.
  • 5점 리커트 척도를 사용하여 자가 보고 신뢰도를 수집하였으며, 평균 점수는 3.2였다.
  • 딥 러닝 아키텍처를 사용하여 모델을 훈련하고, 성능 향상을 위해 지식 정렬 원리를 적용하였다.

실험 결과

연구 질문

  • RQ1원인적 설명을 제공할 경우 방사선 전문의의 AI 기반 진료 예측에 대한 관찰된 신뢰도는 어떻게 변화하는가?
  • RQ2방사선 전문의는 모델의 최종 예측 및 설명에 얼마나 동의하는가?
  • RQ3설명을 수정할 수 있는 능력이 과도한 의존 또는 자율적 신뢰 행동을 드러내는가?
  • RQ4XAI 기반 진료 시스템에서 자가 보고 신뢰도는 관찰된 신뢰도와 어떻게 비교되는가?
  • RQ5AI 시스템에 익숙하지 않은 방사선 전문의에서 신뢰도 캘리브레이션에 제약이 되는 요인은 무엇인가?

주요 결과

  • 모델은 CXREye 데이터셋에서 테스트 정확도 74.1%를 달성하여 뛰어난 기술적 성능를 보였다.
  • 방사선 전문의는 모델의 최종 진단에 46.4%의 경우에만 동의하여 낮은 관찰된 신뢰도를 보였다.
  • 윌코크슨 부호 순위 검정을 통해 사용자가 모델 설명과 뚜렷한 일치를 보였으며, 이는 설명에 대한 과도한 의존을 시사한다.
  • 자기 보고 신뢰도는 평균 3.2/5로 나타나 중간 수준이지만, 시스템에 대한 확신은 없음을 나타낸다.
  • AI 경험이 없는 방사선 전문의의 경우 설명 제공에도 불구하고 신뢰도 캘리브레이션에 어려움을 겪었을 가능성이 있다.
  • 의료 진료의 불확실성과 AI에서 명확하지 않은 신뢰도 신호가 조절되지 않으면, 원인적 설명이 있음에도 불구하고 낮은 신뢰도를 초래할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.