Skip to main content
QUICK REVIEW

[논문 리뷰] A Dempster-Shafer approach to trustworthy AI with application to fetal brain MRI segmentation

Lucas Fidon, Michaël Aertsen|arXiv (Cornell University)|2022. 04. 05.
Fetal and Pediatric Neurological Disorders참고 문헌 55인용 수 6
한 줄 요약

이 논문은 13개 센터에서 수집한 540건의 스캔 데이터셋을 바탕으로, 전문가 지식 위반 예측을 탐지하고 수정하기 위해 델타-샤퍼 이론을 통합한 신뢰할 수 있는 AI 프레임워크를 제안한다. 이 프레임워크는 일관성 없는 볼륨에서 보조 모델을 사용하여 예측을 보완한다. 이 방법은 다양한 스캐너와 병리적 경우에서의 강건성을 향상시키며, 최신 기술 수준의 모델과 비교해도 뛰어나거나 유사한 성능을 달성한다.

ABSTRACT

Deep learning models for medical image segmentation can fail unexpectedly and spectacularly for pathological cases and images acquired at different centers than training images, with labeling errors that violate expert knowledge. Such errors undermine the trustworthiness of deep learning models for medical image segmentation. Mechanisms for detecting and correcting such failures are essential for safely translating this technology into clinics and are likely to be a requirement of future regulations on artificial intelligence (AI). In this work, we propose a trustworthy AI theoretical framework and a practical system that can augment any backbone AI system using a fallback method and a fail-safe mechanism based on Dempster-Shafer theory. Our approach relies on an actionable definition of trustworthy AI. Our method automatically discards the voxel-level labeling predicted by the backbone AI that violate expert knowledge and relies on a fallback for those voxels. We demonstrate the effectiveness of the proposed trustworthy AI approach on the largest reported annotated dataset of fetal MRI consisting of 540 manually annotated fetal brain 3D T2w MRIs from 13 centers. Our trustworthy AI method improves the robustness of a state-of-the-art backbone AI for fetal brain MRIs acquired across various centers and for fetuses with various brain abnormalities.

연구 동기 및 목표

  • 딥 러닝 기반 의료 영상 분할에서 분포 외 사례 및 병리적 스캔에 대한 신뢰성 부족 문제를 해결하기 위해.
  • AI 예측과 전문가 지식 간 국소적 갈등을 탐지하는 실패 보호 메커니즘을 개발하기 위해.
  • 해부학적 및 생리학적 제약 조건을 준수함으로써 임상 적용에서 AI 모델의 신뢰성을 향상시키기 위해.
  • 다양한 병리와 촬영 프로토콜을 포함한 대규모 다중 센터 출신의 태아 뇌 MRI 데이터셋에서 프레임워크의 효과성을 입증하기 위해.

제안 방법

  • 프레임워크는 백본 딥 러닝 모델(nnU-Net)과 정렬 및 다중 아틀라스 원리를 기반으로 한 더 강건한 보조 모델을 사용한다.
  • 뇌 해부학에 대한 전문가 지식은 델타-샤퍼 이론 내 부분 신뢰 함수로 표현되어 불확실하거나 불완전한 해부학적 제약 조건을 나타낸다.
  • 실패 보호 메커니즘은 백본 모델의 예측과 전문가 지식을 융합하기 위해 델타의 조합 규칙을 적용하며, 충돌하는 볼륨 수준의 레이블을 기각한다.
  • 아틀라스 기반 및 강도 기반 사전 지식을 사용해 볼륨 수준에서 갈등을 탐지하며, 불확실성 영역을 정의하는 마진을 설정한다.
  • AI 예측이 전문가 지식과 모순되는 볼륨 영역에서는 시스템이 자동으로 보조 모델로 전환한다.
  • 사용자가 마진을 조정할 수 있도록 허용함으로써 상호작용 기반 개선이 가능하며, 지속적 학습을 위한 부분 주석 생성에도 활용할 수 있다.

실험 결과

연구 질문

  • RQ1델타-샤퍼 이론 기반 실패 보호 메커니즘이 태아 뇌 영상 분할에서 전문가 해부학 지식을 위반하는 AI 예측을 탐지하고 수정할 수 있는가?
  • RQ2보조 모델을 통합함으로써 다양한 MRI 스캐너와 병리적 조건에서의 강건성이 어떻게 향상되는가?
  • RQ3분포 외 사례에서 신뢰할 수 있는 AI 프레임워크가 기준 모델 대비 딱시 스코어와 하우스도르프 거리 측정치에서 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4시스템의 사고 기록 메커니즘이 배포 후 백본 모델의 지속적 개선을 지원할 수 있는가?
  • RQ5안전 마진에 대한 사용자 상호작용이 의료 영상 분할의 신뢰도 향상과 주석 효율성 향상에 어떻게 기여하는가?

주요 결과

  • 신뢰할 수 있는 AI 프레임워크는 13개 촬영 센터와 다양한 뇌 이상이 있는 태아에서 강건성을 크게 향상시켰으며, 최신 기술 수준의 모델을 능가하거나 유사한 성능을 보였다.
  • 특히 임신 21주 이상의 임신 기간에서 기준 모델과 비교해 유사하거나 뛰어난 딱시 스코어와 하우스도르프 거리 측정치를 달성했다.
  • 신뢰할 수 있는 AI 알고리즘의 신뢰구간은 다른 알고리즘과 유사하거나 더 좁아 신뢰성 향상을 시사했다.
  • 특히皮질과 같은 복잡한 해부학적 영역에서 전문가 지식을 위반하는 국소적 레이블링 오류를 성공적으로 탐지하고 수정했다.
  • 사용자가 마진을 수동 조정할 수 있도록 허용함으로써 상호작용 기반 개선이 가능했으며, 반감독 학습을 위한 부분 주석 생성에도 활용할 수 있었다.
  • 사고 보고 기능을 지원하여 향후 모델 재학습을 이끌 수 있었으며, 유럽의료기기규정(MDR) 제87조의 의료기기 사고 보고 요구사항과도 부합했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.