[論文レビュー] Assessing the communication gap between AI models and healthcare professionals: explainability, utility and trust in AI-driven clinical decision-making
本研究は、がんおよびCOVID-19患者のトリアージを想定した現実世界のシミュレーション(CORONET)を用いて、臨床意思決定支援における説明可能なAIの効果を評価した。説明は信頼を高め、自動化バイアスを軽減するが、一方で確認バイアスや認知的負荷を引き起こす可能性もある。研究では、機械学習の説明可能性を実用的に評価するフレームワークを提唱し、曇った状況における意思決定を改善し、経験の浅い臨床職員を支援することを示した。
This paper contributes with a pragmatic evaluation framework for explainable Machine Learning (ML) models for clinical decision support. The study revealed a more nuanced role for ML explanation models, when these are pragmatically embedded in the clinical context. Despite the general positive attitude of healthcare professionals (HCPs) towards explanations as a safety and trust mechanism, for a significant set of participants there were negative effects associated with confirmation bias, accentuating model over-reliance and increased effort to interact with the model. Also, contradicting one of its main intended functions, standard explanatory models showed limited ability to support a critical understanding of the limitations of the model. However, we found new significant positive effects which repositions the role of explanations within a clinical context: these include reduction of automation bias, addressing ambiguous clinical cases (cases where HCPs were not certain about their decision) and support of less experienced HCPs in the acquisition of new domain knowledge.
研究の動機と目的
- 説明可能な機械学習モデルが現実の臨床状況における医療従事者の意思決定に与える実用的影響を調査すること。
- モデルの説明が、複雑でデータドリブンな意思決定文脈における信頼、使いやすさ、臨床的パフォーマンスに与える影響を評価すること。
- 臨床ワークフローにおける説明のポジティブおよびネガティブな影響、すなわちバイアスや認知的負荷を特定すること。
- 単なるモデル出力にとどまらない、臨床現場における説明可能なAIの実用的価値と使いやすさを評価するフレームワークの構築および検証すること。
提案手法
- 23名の医療従事者を対象に、がんおよびCOVID-19患者の入院意思決定を支援する現実世界の臨床意思決定支援ツール(CORONET)を用いた被験者内ユーザー研究を実施した。
- 10件のシミュレートされた患者ケースにおいて、説明あり(スコア+カラーバー)と説明なし(スコア+寄与要因)のモデル性能を比較した。
- モデルの説明を臨床的価値、認知的モデル、意思決定結果に結びつける実用的評価フレームワークを採用した。
- 認識された信頼、使いやすさ、認知的負担、意思決定の自信に関する定性的および定量的フィードバックを収集した。
- 分野の専門家が設計した臨床ケースシナリオを用い、人工的ではあるが臨床的整合性と現実性を確保した。
- 説明が自動化バイアス、確認バイアス、およびモデルの限界の理解に与える影響を分析した。
実験結果
リサーチクエスチョン
- RQ1説明は、AIドリブンの臨床意思決定支援システムにおける医療従事者の信頼および認識された価値にどのように影響するか?
- RQ2説明は、臨床意思決定における認知的・行動的影響(確認バイアスや自動化バイアスを含む)にどのような影響を及えるか?
- RQ3説明は、モデルの誤りを検出する能力や、モデルの限界を理解する能力を、どの程度向上させるか?
- RQ4説明は、曇った臨床的状況や経験の浅い臨床職員の意思決定をどの程度支援するか?
- RQ5単なるモデル出力にとどまらない、現実世界の臨床ワークフローに統合された状況における説明の実用的価値は何か?
主な発見
- 説明は、特に医療従事者がモデルの推奨に反対する場合に自動化バイアスを軽減し、より深い考察を促した。
- 参加者の17–35%において、説明は認知的負担を増加させ、確認バイアスを助長する可能性があり、結果としてモデルへの過剰依存を強化するおそれがある。
- 説明が提供されても、57%の参加者がモデルの誤りを検出できず、モデルの限界に対する批判的理解の向上が限定的であることが示された。
- 曇った臨床的状況では、説明が意思決定を顕著に改善した。この状況では、臨床職員自身の判断に不確実性を感じていた。
- 経験の浅い医療従事者の中には、説明のおかげで新しい臨床分野の知識を習得できたと報告した者もいた。
- 信頼のメカニズムとしての説明への肯定的態度がある一方で、その実用的価値は文脈に依存し、一貫して有益であるとは限らない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。