Skip to main content
QUICK REVIEW

[論文レビュー] Reliable and Trustworthy Machine Learning for Health Using Dataset Shift Detection

Chunjong Park, Anas Awadalla|arXiv (Cornell University)|Oct 26, 2021
Machine Learning in Healthcare被引用数 12
ひとこと要約

本論文では、訓練分布から逸脱するデータを特定することで、医療関連の機械学習モデルの信頼性と信頼性を向上させるため、分布外(OOD)検出の利用を提案している。画像、音声、モーショングラフデータの3つのモダリティにおいて、マハラノビス距離およびグラム行列ベースのOOD検出手法を評価し、分布外入力を95%以上の精度で検出することに成功した。また、ユーザースタディを通じて、OOD検出から得られる信頼度スコアが、医療AIアプリケーションにおけるユーザーチャンスと意思決定を顕著に向上させることを示した。

ABSTRACT

Unpredictable ML model behavior on unseen data, especially in the health domain, raises serious concerns about its safety as repercussions for mistakes can be fatal. In this paper, we explore the feasibility of using state-of-the-art out-of-distribution detectors for reliable and trustworthy diagnostic predictions. We select publicly available deep learning models relating to various health conditions (e.g., skin cancer, lung sound, and Parkinson's disease) using various input data types (e.g., image, audio, and motion data). We demonstrate that these models show unreasonable predictions on out-of-distribution datasets. We show that Mahalanobis distance- and Gram matrices-based out-of-distribution detection methods are able to detect out-of-distribution data with high accuracy for the health models that operate on different modalities. We then translate the out-of-distribution score into a human interpretable CONFIDENCE SCORE to investigate its effect on the users' interaction with health ML applications. Our user study shows that the \ extsc{confidence score} helped the participants only trust the results with a high score to make a medical decision and disregard results with a low score. Through this work, we demonstrate that dataset shift is a critical piece of information for high-stake ML applications, such as medical diagnosis and healthcare, to provide reliable and trustworthy predictions to the users.

研究の動機と目的

  • 医療MLモデルが分布外データにさらされた際のデータセットシフトに対する脆弱性を調査すること。
  • 画像、音声、モーショングラフなど多様な医療データモダリティにおいて、最先端の分布外検出手法を評価すること。
  • OODスコアを人間が理解可能な信頼度スコアに変換し、ユーザーチャンスを向上させること。
  • データセットシフトの情報が、mHealthアプリケーションにおけるユーザーパーセプションと意思決定行動に与える影響を評価すること。

提案手法

  • 皮膚がん、パーキンソン病、肺音分類のための公に利用可能な深層学習モデルをベンチマークした。
  • マハラノビス距離およびグラム行列ベースのOOD検出手法を用いて、分布外入力を同定した。
  • ユーザーフェーシングの解釈を可能にするために、OODスコアを人間が読み取り可能な信頼度スコアにマッピングした。
  • 仮想の医療シナリオを用いたオンラインユーザースタディを実施し、信頼度と意思決定行動を評価した。
  • 検出の課題を評価するため、近似分布データセット上のモデル性能を評価した。
  • ユーザースタディの刺激要因として、肌色などデモグラフィック要因に整合したデータを用いた。

実験結果

リサーチクエスチョン

  • RQ1異なるモダリティにおいて、医療MLモデルは分布外データにさらされた際にどのように動作するか?
  • RQ2最先端のOOD検出手法は、医療応用において分布外入力を信頼性高く同定できるか?
  • RQ3OODスコアを信頼度スコアに変換することで、ユーザーチャンスにおけるモデル予測への信頼度はどのように変化するか?
  • RQ4データセットシフトの情報は、ユーザーがモデル出力に基づいて医療意思決定を行う意欲にどの程度影響を与えるか?
  • RQ5OOD検出は、医療AIにおけるデータバイアスとモデルの限界を特定する上でどのような意味を持つのか?

主な発見

  • マハラノビス距離およびグラム行列ベースのOOD検出器は、画像、音声、モーショングラフの3つのモダリティにおいて、95%以上の精度で分布外データを検出した。
  • 参加者は高信頼度の予測を信頼し、それらに基づいて医療意思決定を行う意欲を示したが、低信頼度の結果は無視した。
  • OOD検出から得られる信頼度スコアは、医療AI予測のユーザーチャンスとしての信頼性を顕著に向上させた。
  • モデル開発者は、OOD検出を用いて、特定の肌色やセンサータイプの不足など、トレーニングデータにおけるデータ分布のギャップや潜在的バイアスを同定できる。
  • 近似分布のサンプルは依然として検出が困難であり、この分野における検出手法の改善が求められることが示された。
  • ユーザースタディでは、OOD情報がユーザーがデータ品質の問題を認識し、仮想的な状況でもより情報に基づいた意思決定を下すのを支援することが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。