Skip to main content
QUICK REVIEW

[論文レビュー] User Trust on an Explainable AI-based Medical Diagnosis Support System

Yao Rong, Nora Castner|arXiv (Cornell University)|Apr 26, 2022
Explainable Artificial Intelligence (XAI)被引用数 6
ひとこと要約

本研究では、胸部レントゲン診断における説明可能なAI(XAI)システムにおけるユーザーの信頼について評価する。放射線科医は因果的説明を閲覧し、必要に応じてそれらを修正できる。74.1%のモデル精度にもかかわらず、放射線科医のうち46.4%しか予測に同意せず、自己報告による信頼度は平均3.2/5にとどまり、説明可能性にもかかわらず信頼が限定的であることが示された。また、説明に過剰に依存する兆候も確認された。

ABSTRACT

Recent research has supported that system explainability improves user trust and willingness to use medical AI for diagnostic support. In this paper, we use chest disease diagnosis based on X-Ray images as a case study to investigate user trust and reliance. Building off explainability, we propose a support system where users (radiologists) can view causal explanations for final decisions. After observing these causal explanations, users provided their opinions of the model predictions and could correct explanations if they did not agree. We measured user trust as the agreement between the model's and the radiologist's diagnosis as well as the radiologists' feedback on the model explanations. Additionally, they reported their trust in the system. We tested our model on the CXR-Eye dataset and it achieved an overall accuracy of 74.1%. However, the experts in our user study agreed with the model for only 46.4% of the cases, indicating the necessity of improving the trust. The self-reported trust score was 3.2 on a scale of 1.0 to 5.0, showing that the users tended to trust the model but the trust still needs to be enhanced.

研究の動機と目的

  • 因果的説明を含むXAIシステムが、放射線科医の医療診断における信頼と依存度に与える影響を調査すること。
  • 現実の診断環境において、観察された信頼(モデル予測および説明との一致)と自己報告信頼(ユーザー評価)の両方を測定すること。
  • ユーザーがモデルの説明を修正する行動が、過剰依存または自己依存の行動を示すかどうかを調査すること。
  • AIシステムに不慣れな放射線科医において、モデルの説明可能性が信頼の補正に与える影響を評価すること。
  • 放射線科におけるAIの臨床的統合を妨げる信頼と使いやすさのギャップを特定すること。

提案手法

  • CXREyeデータセットを用いて、胸部レントゲン診断のための説明可能なAIモデルを開発し、最終予測の因果的説明を生成した。
  • 放射線科医がまずX線画像を解釈し、その後でモデルの予測とその因果的説明を閲覧するユーザースタディを設計した。
  • 放射線科医が説明に同意しない場合、それらを変更できるようにし、その変更を観察された信頼の指標とした。
  • 観察された信頼を、放射線科医とモデルの予測との一致率(46.4%)および説明編集に対するウィルコクソン符号順位検定で測定した。
  • 自己報告信頼度を5段階リッカート尺度で収集し、平均スコアは3.2であった。
  • 深層学習アーキテクチャを用いてモデルを訓練し、性能向上のため知識蒸留の原則を適用した。

実験結果

リサーチクエスチョン

  • RQ1因果的説明の提供が、放射線科医のAIによる診断に対する観察された信頼にどのように影響するか?
  • RQ2放射線科医はどの程度、モデルの最終予測および説明に同意するか?
  • RQ3説明の修正が可能であることが、過剰依存または自己依存の行動を明らかにするか?
  • RQ4XAIベースの診断システムにおいて、自己報告信頼度と観察された信頼度はどのように比較されるか?
  • RQ5AIに不慣れな放射線科医において、信頼の補正が制限される要因は何か?

主な発見

  • モデルはCXREyeデータセットで74.1%のテスト精度を達成し、強力な技術的性能を示した。
  • 放射線科医はモデルの最終診断に46.4%のケースでのみ同意しており、観察された信頼度が低いことが示された。
  • ウィルコクソン符号順位検定により、ユーザーがモデルの説明と著しく一致していることが確認され、説明に過剰に依存していることが示唆された。
  • 自己報告信頼度は平均3.2/5であり、中程度ではあるが、システムに対する自信はない信頼度を示した。
  • AI経験のない放射線科医が多かったため、説明の存在にもかかわらず信頼の補正が困難であった可能性がある。
  • 医療診断における不確実性や、AIにおける明確でない信頼度の信号が、因果的説明があっても低信頼を引き起こす要因となっている可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。