[論文レビュー] A Dempster-Shafer approach to trustworthy AI with application to fetal brain MRI segmentation
本論文は、熟練医療知識に反する予測を検出・是正するため、デュエスター=シャーマー理論を統合した信頼性の高いAIフレームワークを提案する。このフレームワークは、一貫性のないボクセルに対してフォールバックモデルを用いる。本手法は、多様なスキャナーや病理的症例においても耐障害性を向上させ、13施設からなる540スキャンの大型データセットにおいて、最先端のモデルと同等または優れた性能を達成する。
Deep learning models for medical image segmentation can fail unexpectedly and spectacularly for pathological cases and images acquired at different centers than training images, with labeling errors that violate expert knowledge. Such errors undermine the trustworthiness of deep learning models for medical image segmentation. Mechanisms for detecting and correcting such failures are essential for safely translating this technology into clinics and are likely to be a requirement of future regulations on artificial intelligence (AI). In this work, we propose a trustworthy AI theoretical framework and a practical system that can augment any backbone AI system using a fallback method and a fail-safe mechanism based on Dempster-Shafer theory. Our approach relies on an actionable definition of trustworthy AI. Our method automatically discards the voxel-level labeling predicted by the backbone AI that violate expert knowledge and relies on a fallback for those voxels. We demonstrate the effectiveness of the proposed trustworthy AI approach on the largest reported annotated dataset of fetal MRI consisting of 540 manually annotated fetal brain 3D T2w MRIs from 13 centers. Our trustworthy AI method improves the robustness of a state-of-the-art backbone AI for fetal brain MRIs acquired across various centers and for fetuses with various brain abnormalities.
研究の動機と目的
- 深層学習ベースの医療画像分類における信頼性の欠如、特に分布外のケースや病理的スキャンに対して、信頼性を向上させること。
- AIの予測と熟練医療知識の間の局所的矛盾を検出するフェイルセーフメカニズムを開発すること。
- 解剖学的および生理学的制約への準拠を保証することで、臨床現場へのAIモデルの信頼性を向上させること。
- 多施設にまたがる多様な病理状態や画像取得プロトコルを含む大型の胎児MRIデータセットを用いて、本フレームワークの有効性を実証すること。
提案手法
- バックボーンの深層学習モデル(nnU-Net)と、登録とマルチアトラス原理に基づくより耐障害性の高いフォールバックモデルを用いる。
- 脳解剖学に関する熟練知識を、不確実性や不完全な解剖学的制約を表現する部分的信念関数として、デュエスター=シャーマー理論に組み込む。
- フェイルセーフメカニズムは、デュエスターの結合則を用いてバックボーンモデルの予測と熟練知識の予測を統合し、矛盾するボクセルレベルのラベルを破棄する。
- アトラスベースおよび強度ベースの事前知識を用いて、ボクセルレベルで矛盾を検出し、不確実性領域を定義するマージンを設定する。
- AIの予測が熟練知識に反するボクセルに対して、システムは自動的にフォールバックモデルに切り替える。
- ユーザーがマージンを調整できるようにすることで、インタラクティブな修正が可能となり、継続的学習に向けた部分的アノテーションの生成が可能になる。
実験結果
リサーチクエスチョン
- RQ1デュエスター=シャーマー理論に基づくフェイルセーフメカニズムは、胎児MRI画像分類において熟練医療知識に反するAI予測を検出し、是正できるか?
- RQ2フォールバックモデルを統合することで、多様なMRIスキャナーや病理的状態において、耐障害性がどのように向上するか?
- RQ3分布外のケースにおいて、信頼性の高いAIフレームワークは、標準的な深層学習モデルに比べて、DiceスコアおよびHausdorff距離の観点でどの程度優れているか?
- RQ4システムのインcidントログギングメカニズムは、デプロイ後におけるバックボーンモデルの継続的改善を支援できるか?
- RQ5安全マージンに対するユーザーのインタラクションは、医療画像分類における信頼性とアノテーション効率をどの程度向上させるか?
主な発見
- 信頼性の高いAIフレームワークは、13の取得施設および多様な脳異常を示す胎児において、著しく耐障害性を向上させ、最先端のモデルを上回るか同等の性能を発揮した。
- 本手法は、特に21週以上経過した胎児において、ベースラインモデルと同等または優れたDiceスコアおよびHausdorff距離を達成した。
- 信頼性の高いAIアルゴリズムの信頼区間は、他のアルゴリズムと同等または狭く、信頼性の向上を示した。
- システムは、特に皮質のような複雑な解剖学的領域において、熟練知識に反する局所的ラベル誤りを効果的に検出し是正した。
- マージンの手動調整を可能にするインタラクティブな修正が可能であり、半教師あり学習に向けた部分的アノテーションの生成に利用できる。
- インcidントレポート機能をサポートしており、将来的なモデル再トレーニングの指針となり、EU MDR第87条の医療機器インcidント報告要件にも適合する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。