[论文解读] A Dempster-Shafer approach to trustworthy AI with application to fetal brain MRI segmentation
本文提出了一种可信人工智能框架,用于胎儿脑部MRI分割,通过引入Dempster-Shafer理论检测并纠正违反专家知识的预测,对不一致的体素使用回退模型。该方法在不同扫描仪和病理病例中均提升了鲁棒性,在来自13家中心的540例扫描的大规模数据集上,性能优于或相当于当前最先进模型。
Deep learning models for medical image segmentation can fail unexpectedly and spectacularly for pathological cases and images acquired at different centers than training images, with labeling errors that violate expert knowledge. Such errors undermine the trustworthiness of deep learning models for medical image segmentation. Mechanisms for detecting and correcting such failures are essential for safely translating this technology into clinics and are likely to be a requirement of future regulations on artificial intelligence (AI). In this work, we propose a trustworthy AI theoretical framework and a practical system that can augment any backbone AI system using a fallback method and a fail-safe mechanism based on Dempster-Shafer theory. Our approach relies on an actionable definition of trustworthy AI. Our method automatically discards the voxel-level labeling predicted by the backbone AI that violate expert knowledge and relies on a fallback for those voxels. We demonstrate the effectiveness of the proposed trustworthy AI approach on the largest reported annotated dataset of fetal MRI consisting of 540 manually annotated fetal brain 3D T2w MRIs from 13 centers. Our trustworthy AI method improves the robustness of a state-of-the-art backbone AI for fetal brain MRIs acquired across various centers and for fetuses with various brain abnormalities.
研究动机与目标
- 为解决基于深度学习的医学图像分割中缺乏可信性的问题,特别是针对分布外情况和病理扫描。
- 开发一种故障安全机制,用于检测AI预测与专家知识之间的局部冲突。
- 通过确保符合解剖和生理约束,提高AI模型在临床部署中的可靠性。
- 在包含多样化病理和采集协议的大型多中心胎儿MRI数据集上,证明该框架的有效性。
提出的方法
- 该框架采用主干深度学习模型(nnU-Net)和基于配准与多图谱原理的更鲁棒的回退模型。
- 将关于脑部解剖的专家知识编码为Dempster-Shafer理论中的部分信任函数,以表示不确定或不完整的解剖约束。
- 故障安全机制应用Dempster的组合规则,将主干模型与专家知识的预测结果合并,丢弃冲突的体素级标签。
- 通过基于图谱和基于强度的先验知识,在体素层面检测冲突,并利用边界定义不确定性区域。
- 当预测与专家知识冲突时,系统会自动切换至回退模型。
- 该方法支持交互式优化,允许用户调整边界,从而生成部分标注以支持持续学习。
实验结果
研究问题
- RQ1基于Dempster-Shafer理论的故障安全机制能否检测并纠正胎儿MRI分割中违反专家解剖知识的AI预测?
- RQ2集成回退模型在不同MRI扫描仪和病理条件下如何提升鲁棒性?
- RQ3在分布外病例中,该可信人工智能框架在Dice分数和Hausdorff距离方面相较于标准深度学习模型的性能提升程度如何?
- RQ4系统的事件日志机制是否能支持部署后对主干模型的持续改进?
- RQ5用户与安全边界的交互如何提升可信度和医学图像分割的标注效率?
主要发现
- 该可信人工智能框架在13家采集中心及存在各种脑部异常的胎儿中显著提升了鲁棒性,性能优于或等同于当前最先进模型。
- 该方法在妊娠21周及以上时,Dice分数和Hausdorff距离与基线模型相比达到相当或更优水平。
- 可信人工智能算法的置信区间与其它算法相似或更窄,表明其可靠性得到提升。
- 系统成功检测并纠正了违反专家知识的局部标注错误,尤其在皮层等复杂解剖区域表现突出。
- 该框架支持交互式优化,允许手动调整边界,可用于生成部分标注以支持半监督学习。
- 该方法支持事件报告,可指导未来模型的再训练,并符合欧盟MDR第87条关于医疗设备事件报告的要求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。