Skip to main content
QUICK REVIEW

[논문 리뷰] Reliable and Trustworthy Machine Learning for Health Using Dataset Shift Detection

Chunjong Park, Anas Awadalla|arXiv (Cornell University)|2021. 10. 26.
Machine Learning in Healthcare인용 수 12
한 줄 요약

이 논문은 건강 관련 기계학습 모델의 신뢰성과 신뢰도를 햖스키기 위해 분포 외 데이터(OOD) 탐지를 활용하는 것을 제안한다. 이는 훈련 분포에서 벗어난 데이터를 식별함으로써 이루어지며, 영상, 음성, 운동 데이터에서 맥컬로비스 거리 기반 및 그램 행렬 기반 OOD 탐지기를 평가하여, 분포 외 입력을 95% 이상의 정확도로 탐지하였다. 또한 사용자 연구를 통해 OOD 탐지에서 유도된 신뢰도 점수는 의료 AI 응용 분야에서 사용자의 신뢰도와 의사결정 능력을 크게 향상시킴을 입증하였다.

ABSTRACT

Unpredictable ML model behavior on unseen data, especially in the health domain, raises serious concerns about its safety as repercussions for mistakes can be fatal. In this paper, we explore the feasibility of using state-of-the-art out-of-distribution detectors for reliable and trustworthy diagnostic predictions. We select publicly available deep learning models relating to various health conditions (e.g., skin cancer, lung sound, and Parkinson's disease) using various input data types (e.g., image, audio, and motion data). We demonstrate that these models show unreasonable predictions on out-of-distribution datasets. We show that Mahalanobis distance- and Gram matrices-based out-of-distribution detection methods are able to detect out-of-distribution data with high accuracy for the health models that operate on different modalities. We then translate the out-of-distribution score into a human interpretable CONFIDENCE SCORE to investigate its effect on the users' interaction with health ML applications. Our user study shows that the \ extsc{confidence score} helped the participants only trust the results with a high score to make a medical decision and disregard results with a low score. Through this work, we demonstrate that dataset shift is a critical piece of information for high-stake ML applications, such as medical diagnosis and healthcare, to provide reliable and trustworthy predictions to the users.

연구 동기 및 목표

  • 분포 외 데이터에 노출되었을 때 건강 기계학습 모델이 데이터 분포 이동에 얼마나 취약한지 조사하기 위해.
  • 다양한 의료 데이터 모odal(영상, 음성, 운동)에서 최신 기술의 분포 외 탐지 방법을 평가하기 위해.
  • OOD 점수를 인간이 이해할 수 있는 신뢰도 점수로 변환하여 사용자 신뢰도를 향상시키기 위해.
  • 데이터 분포 이동 정보가 mHealth 응용 분야에서 사용자의 인식과 의사결정 행동에 미치는 영향을 평가하기 위해.

제안 방법

  • 피부암, 파킨슨병, 폐음향 분류를 위한 공개된 딥러닝 모델을 벤치마킹하였다.
  • 맥컬로비스 거리 및 그램 행렬 기반 OOD 탐지 방법을 적용하여 분포 외 입력을 식별하였다.
  • 사용자 인터페이스에 적합한 해석 가능한 신뢰도 점수로 OOD 점수를 매핑하였다.
  • 가상의 의료 시나리오를 기반으로 한 온라인 사용자 연구를 수행하여 신뢰도와 의사결정 행동을 평가하였다.
  • 분포 근접 데이터셋에서의 모델 성능을 평가하여 탐지 과제를 분석하였다.
  • 사용자 연구 자극의 현실성 향상을 위해 인구통계학적 특성(예: 피부 톤)을 반영한 데이터를 사용하였다.

실험 결과

연구 질문

  • RQ1다양한 모달에서 분포 외 데이터에 노출되었을 때 건강 기계학습 모델의 성능은 어떻게 되는가?
  • RQ2최신 기술의 OOD 탐지 방법은 의료 응용 분야에서 분포 외 입력을 신뢰성 있게 식별할 수 있는가?
  • RQ3OOD 점수를 신뢰도 점수로 변환하는 것이 사용자 신뢰도에 어떤 영향을 미치는가?
  • RQ4데이터 분포 이동 정보는 사용자가 모델 출력 기반으로 의료 결정을 내리는 데 얼마나 영향을 미치는가?
  • RQ5OOD 탐지는 건강 AI에서 데이터 편향과 모델 한계를 식별하는 데 어떤 함의를 지닌다?

주요 결과

  • 맥컬로비스 거리 기반 및 그램 행렬 기반 OOD 탐지기는 영상, 음성, 운동 모달 전반에서 분포 외 데이터 탐지에 95% 이상의 정확도를 달성하였다.
  • 참가자들은 높은 신뢰도 예측을 신뢰했으며, 이에 기반해 의료 결정을 내릴 의향이 더 높았다. 반면 낮은 신뢰도 결과는 기각하였다.
  • OOD 탐지에서 도출된 신뢰도 점수는 사용자가 건강 AI 예측의 정당성에 대해 느끼는 신뢰도를 크게 향상시켰다.
  • 모델 개발자는 OOD 탐지를 통해 훈련 데이터의 분포 격차와 잠재적 편향(예: 특정 피부 톤 또는 센서 유형의 부족)을 식별할 수 있다.
  • 근접 분포 샘플은 여전히 탐지하기 어려웠으며, 이는 이 영역에서 보다 향상된 탐지 방법이 필요함을 시사한다.
  • 사용자 연구를 통해 OOD 정보는 사용자가 데이터 품질 문제를 인지하고 더 잘 정보화된 결정을 내리는 데 도움이 되었으며, 이는 가상 환경에서도 동일하게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.