Skip to main content
QUICK REVIEW

[논문 리뷰] BabyNet: Residual Transformer Module for Birth Weight Prediction on Fetal Ultrasound Video

Szymon Płotka, Michal K. Grzeszczyk|arXiv (Cornell University)|2022. 05. 19.
Neonatal and fetal brain pathology참고 문헌 19인용 수 17
한 줄 요약

BabyNet는 2D + t 태반 초음파 영상 스캔에서 표준 평면 검출이 필요 없이 직접 태아 출생 체중을 예측할 수 있는 엔드 투 엔드 딥 러닝 프레임워크이다. 이는 새로운 잔차 트랜스포머 모듈(RTM)을 사용하며, 최신 기술 및 전문가 임상의 수준의 정확도를 달성한다. 인간과 모델 예측을 조합했을 때 가장 뛰어난 성능을 보였으며, mMAPE는 5.2%였다.

ABSTRACT

Predicting fetal weight at birth is an important aspect of perinatal care, particularly in the context of antenatal management, which includes the planned timing and the mode of delivery. Accurate prediction of weight using prenatal ultrasound is challenging as it requires images of specific fetal body parts during advanced pregnancy which is difficult to capture due to poor quality of images caused by the lack of amniotic fluid. As a consequence, predictions which rely on standard methods often suffer from significant errors. In this paper we propose the Residual Transformer Module which extends a 3D ResNet-based network for analysis of 2D+t spatio-temporal ultrasound video scans. Our end-to-end method, called BabyNet, automatically predicts fetal birth weight based on fetal ultrasound video scans. We evaluate BabyNet using a dedicated clinical set comprising 225 2D fetal ultrasound videos of pregnancies from 75 patients performed one day prior to delivery. Experimental results show that BabyNet outperforms several state-of-the-art methods and estimates the weight at birth with accuracy comparable to human experts. Furthermore, combining estimates provided by human experts with those computed by BabyNet yields the best results, outperforming either of other methods by a significant margin. The source code of BabyNet is available at https://github.com/SanoScience/BabyNet.

연구 동기 및 목표

  • 2D + t 초음파 영상 스캔에서 직접 태아 출생 체중을 예측하기 위한 엔드 투 엔드 딥 러닝 방법을 개발하기 위해.
  • 기존 방법이 표준 태아 평면 식별 및 히우리스틱 공식에 의존하는 데에 기인한 한계를 해결하기 위해.
  • 3D 멀티헤드 자기주의(MHSA)와 잔차 연결, 시간적 위치 인코딩을 통합하여 예측 정확도를 향상시키기 위해.
  • 실제 임상 환경에서의 적용 가능성을 확보하기 위해 출생 1일 전에 촬영한 데이터셋을 사용해 모델을 평가하기 위해.
  • 인간 전문가 추정치와 AI 예측을 조합하여 더 뛰어난 성능을 달성할 수 있는 잠재력을 탐색하기 위해.

제안 방법

  • BabyNet는 3D ResNet-18 기반 아키텍처를 사용하며, 마지막 두 개의 잔차 모듈을 새로운 잔차 트랜스포머 모듈(RTM)으로 대체한다.
  • RTM는 3D 멀티헤드 자기주의(MHSA), 3D 컨볼루션 레이어 및 배치 정규화를 통합하여 국소적이고 전역적인 특징 학습을 동시에 수행한다.
  • 영상 입력의 시공간 순서를 유지하기 위해 MHSA 메커니즘에 시간적 위치 인코딩(TPE)을 통합한다.
  • 네트워크는 16프레임 영상 세그먼트를 처리하고, 전역 평균 풀링을 적용한 후 환자당 하나의 출생 체중 예측값을 출력한다.
  • 모델은 출생 1일 전에 촬영한 75명의 환자에서 확보한 총 225개의 영상으로 구성된 전용 임상 데이터셋을 사용해 엔드 투 엔드로 훈련된다.
  • 성능 평가에는 5겹 교차검증을 사용하며, 평가 지표로 평균 절대 오차(mMAE), 평균 제곱근 오차(mRMSE), 평균 절대 퍼센티지 오차(mMAPE)를 사용한다.

실험 결과

연구 질문

  • RQ1표준 평면 검출이 필요 없이 2D + t 초음파 영상 스캔에서 직접 태아 출생 체중을 예측할 수 있는 하이브리드 CNN-Transformer 아키텍처의 효과성은 어떠한가?
  • RQ2시간적 위치 인코딩을 통합한 잔차 트랜스포머 모듈의 통합은 표준 3D CNN 또는 순수 트랜스포머보다 예측 정확도를 향상시키는가?
  • RQ3BabyNet의 성능는 표준 임상 도구를 사용하는 전문가 임상의와 비교해 어떻게 되는가?
  • RQ4인간 전문가의 추정치와 BabyNet의 출력을 조합하면 개별 방법보다 유의미하게 더 나은 결과를 얻을 수 있는가?
  • RQ5작은 임상 데이터셋(출생 직전에 확보)에서 모델의 일반화 능력은 어느 정도인가?

주요 결과

  • 테스트 세트에서 BabyNet는 평균 절대 오차(mMAE) 254 ± 230 g, 평균 제곱근 오차(mRMSE) 341 ± 215 g, 평균 절대 퍼센티지 오차(mMAPE) 7.5 ± 6.6%를 기록했다.
  • 전문가 추정치와 BabyNet의 예측을 조합했을 때 가장 뛰어난 성능을 보였으며, mMAE는 180 ± 156 g, mRMSE는 237 ± 145 g, mMAPE는 5.2 ± 4.6%였다.
  • 이전 연구에서 보고된 전문가 임상의의 성능와 비교했을 때 BabyNet의 성능는 통계적으로 유의미하지 않았다(p-value = 0.6). 다만 별도의 비교에서는 전문가를 초월하는 성능를 보였다(p-value = 0.07).
  • 추이적 분석을 통해 RTM 및 시간적 위치 인코딩을 추가함으로써 기본 3D ResNet-18보다 성능 향상이 뚜렷하게 확인되었다.
  • 3D 컨볼루션과 MHSA, TPE를 융합한 하이브리드 RTM 설계가 순수 CNN, 순수 트랜스포머, 또는 CNN+Transformer 하이브리드보다 더 우수한 성능를 보였다.
  • 모델은 원시 영상 클립에서 엔드 투 엔드 학습이 전문가 수준의 정확도를 달성할 수 있음을 보여주었으며, 이는 임상 의사결정 지원 도구로서의 강력한 임상 유용성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.