[논문 리뷰] Towards Realistic Ultrasound Fetal Brain Imaging Synthesis
이 논문은 출생 전 초음파 영상에서의 데이터 부족 문제를 해결하기 위해, 분산-초해상도-GAN(DSR-GAN)과 트랜스포머 기반-GAN(TB-GAN)을 사용하여 고해상도(256×256) 태반 후두부 뇌 초음파 영상을 합성하는 GAN 기반 접근법을 제안한다. DSR-GAN은 FID 점수 평균 7.04, 최고 5.09로 TB-GAN(평균 36.02, 최고 28.93)보다 유의미하게 낮은 점수를 기록하여, 제한된 데이터로도 뛰어난 현실성과 안정적인 학습 성능을 입증하였다.
Prenatal ultrasound imaging is the first-choice modality to assess fetal health. Medical image datasets for AI and ML methods must be diverse (i.e. diagnoses, diseases, pathologies, scanners, demographics, etc), however there are few public ultrasound fetal imaging datasets due to insufficient amounts of clinical data, patient privacy, rare occurrence of abnormalities in general practice, and limited experts for data collection and validation. To address such data scarcity, we proposed generative adversarial networks (GAN)-based models, diffusion-super-resolution-GAN and transformer-based-GAN, to synthesise images of fetal ultrasound brain planes from one public dataset. We reported that GAN-based methods can generate 256x256 pixel size of fetal ultrasound trans-cerebellum brain image plane with stable training losses, resulting in lower FID values for diffusion-super-resolution-GAN (average 7.04 and lower FID 5.09 at epoch 10) than the FID values of transformer-based-GAN (average 36.02 and lower 28.93 at epoch 60). The results of this work illustrate the potential of GAN-based methods to synthesise realistic high-resolution ultrasound images, leading to future work with other fetal brain planes, anatomies, devices and the need of a pool of experts to evaluate synthesised images. Code, data and other resources to reproduce this work are available at \url{https://github.com/budai4medtech/midl2023}.
연구 동기 및 목표
- 데이터 부족, 개인정보 우려, 전문가 확보 어려움으로 인해 공개된 태아 초음파 영상 데이터셋이 제한적인 데 기인한 심각한 문제를 해결한다.
- 딥 생성 모델을 활용한 데이터 증강 전략을 개발하여, 향상된 AI/ML 훈련을 위한 현실적인 고해상도 태아 뇌 초음파 영상을 합성한다.
- 소규모 공개 데이터셋에서 전뇌엽 평면 영상 합성에 대해 두 가지 GAN 아키텍처인 분산-초해상도-GAN과 트랜스포머 기반-GAN의 성능을 평가한다.
- 제한된 실제 데이터로도 GAN 기반 합성이 안정적인 학습과 낮은 FID 점수를 기록하며 현실적인 태아 초음파 영상을 생성할 수 있음을 입증한다.
- 향후 다른 태아 뇌 평면, 해부학적 구조, 영상 장치에 대한 합성 데이터 기반 합성 기반의 기초를 마련한다.
제안 방법
- 두 단계 생성 프레임워크: 먼저, 미세조정된 노이즈 제거 확률 모델(DDPM)이 128×128 픽셀 영상을 생성한 후, 초해상도 GAN(SRGAN)을 통해 256×256 픽셀로 업샘플링한다.
- 실제 영상과 합성 영상 간 히스토그램 매칭을 적용하여 색상 분포를 일치시키고 시각적 현실감을 향상시킨다.
- 트랜스포머 기반-GAN의 경우, 고주파 수치를 잘 포착하면서도 메모리 사용량을 줄이기 위해 Swin 트랜스포머 블록을 사용한 StyleSwin 아키텍처를 적용한다.
- 작은 훈련 데이터로 인한 판별기 과적합을 방지하기 위해, 가분성 데이터 증강(DiffAug)과 적응형 가짜 증강(APA)을 적용한다.
- 모델은 Adam 옵timizer를 사용하고, 두 시간 척도 업데이트 규칙을 적용하며, 전이 학습을 통해 전뇌엽 평면 데이터로 사전 훈련한 후, 전뇌엽 평면 영상으로 미세조정한다.
- 이미지 품질 평가에는 실제 영상과 생성 영상 간 분포 유사도를 측정하는 Fréchet Inception Distance(FID)를 사용한다.

실험 결과
연구 질문
- RQ1소규모 공개 데이터셋에서 GAN 기반 방법이 현실적인 256×256 태아 초음파 전뇌엽 뇌 영상을 효과적으로 합성할 수 있는가?
- RQ2분산-초해상도-GAN과 트랜스포머 기반-GAN은 훈련 안정성과 이미지 품질 측면에서 어떻게 비교되는가?
- RQ3데이터 증강과 전이 학습은 제한된 태아 초음파 데이터로 훈련된 GAN의 성능을 어느 정도 향상시킬 수 있는가?
- RQ4이 맥락에서 FID 점수는 합성된 태아 초음파 영상의 현실성 여부를 신뢰성 있게 나타낼 수 있는가?
- RQ5이러한 합성 데이터는 향후 태아 뇌 영상 분야의 AI/ML 응용 분야에서 어떤 잠재력을 지닐 수 있는가?
주요 결과
- 분산-초해상도-GAN(DSR-GAN)은 평균 FID 점수 7.04, 최고 점수 5.09를 기록하여 높은 현실성과 안정적인 학습을 입증하였다.
- 트랜스포머 기반-GAN(TB-GAN)은 평균 36.02, 최고 점수 28.93로 FID 점수가 유의미하게 높아 현실감이 떨어지는 영상 생성을 보였다.
- DSR-GAN은 TB-GAN보다 빠른 수렴 속도와 더 안정적인 학습 손실을 보였으며, TB-GAN은 최고 FID 성능에 도달하기 위해 60 에포크가 소요되었다.
- 히스토그램 매칭을 통한 색상 일치화는 실제 영상과 합성 영상 간 색상 일관성을 향상시켜 시각적 타당성을 높였다.
- 더 큰 전뇌엽 평면 데이터셋에서의 전이 학습은 소규모 전뇌엽 평면 데이터셋에서 TB-GAN의 미세조정 성능을 향상시켰다.
- 결과적으로, 제한된 임상 데이터로도 GAN 기반 합성이 현실적인 태아 초음파 영상을 생성하는 데 유용한 솔루션임을 시사하며, 향후 데이터 효율적인 AI 개발을 지원할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.