[논문 리뷰] Beware of diffusion models for synthesizing medical images -- A comparison with GANs in terms of memorizing brain MRI and chest x-ray images
이 연구는 뇌 MRI 및 흉부 X-ray 영상의 합성에 있어서 확산 모델과 StyleGAN을 비교하며, 특히 소규모 데이터셋과 2D 슬라이스에서 확산 모델이 GAN보다 훨씬 더 강하게 훈련 데이터를 기억한다는 것을 발견하여, 의료 영상 생성 시 개인정보 보호 문제를 제기한다.
Diffusion models were initially developed for text-to-image generation and are now being utilized to generate high quality synthetic images. Preceded by GANs, diffusion models have shown impressive results using various evaluation metrics. However, commonly used metrics such as FID and IS are not suitable for determining whether diffusion models are simply reproducing the training images. Here we train StyleGAN and a diffusion model, using BRATS20, BRATS21 and a chest x-ray pneumonia dataset, to synthesize brain MRI and chest x-ray images, and measure the correlation between the synthetic images and all training images. Our results show that diffusion models are more likely to memorize the training images, compared to StyleGAN, especially for small datasets and when using 2D slices from 3D volumes. Researchers should be careful when using diffusion models (and to some extent GANs) for medical imaging, if the final goal is to share the synthetic images.
연구 동기 및 목표
- 확산 모델과 GAN이 의료 영상 합성에서 어떻게 기억 행동을 보이는지 평가하기.
- FID 및 IS와 같은 일반적으로 사용되는 지표들이 합성 의료 영상에서 기억 행동을 탐지할 수 있는지 평가하기.
- 데이터셋 크기와 3D 볼륨에서 추출한 2D 슬라이스가 확산 모델과 GAN의 기억 행동에 미치는 영향을 조사하기.
- 특히 데이터 프라이버시 측면에서, 생성 모델을 의료 영상 분야에서 책임감 있게 사용하기 위한 지침 제공하기.
- 임상 영상 생성에서 확산 모델과 StyleGAN 간의 일반화 대비 기억의 상호 교환 관계를 비교하기.
제안 방법
- 뇌 MRI 및 흉부 X-ray 합성을 위해 BRATS20, BRATS21 및 흉부 X-ray 폐렴 데이터셋에 대해 StyleGAN과 확산 모델을 훈련시었다.
- 실제 임상 조건을 반영하기 위해 3D MRI 볼륨에서 추출한 2D 축방향 슬라이스를 사용하여 기억 행동을 평가하였다.
- 합성 영상과 모든 훈련 영상 간의 상관관계를 측정하여 기억 행동을 정량화하였으며, 영상 수준의 유사도 지표를 사용하였다.
- 다양한 데이터셋 크기에서 성능을 평가하여 데이터 부족이 기억 행동에 미치는 영향을 분석하였다.
- 표준 생성 모델 평가 지표(FID, IS)를 기억 전용 분석과 함께 적용하여 모델 행동을 대비 분석하였다.
- 동일한 훈련 및 평가 프로토콜 하에서 확산 모델과 StyleGAN 간의 기억 비율을 비교하였다.
실험 결과
연구 질문
- RQ1뇌 MRI 및 흉부 X-ray 영상을 생성할 때, 확산 모델의 기억 비율이 StyleGAN보다 어떻게 다른가?
- RQ2특히 소규모 데이터셋에서, 확산 모델이 훈련 영상의 복제를 얼마나 많이 수행하는가, 일반화보다는?
- RQ33D 볼륨에서 추출한 2D 슬라이스 사용이 확산 모델과 GAN의 기억 행동에 어떻게 영향을 미치는가?
- RQ4FID 및 IS와 같은 표준 생성 모델 지표들이 의료 영상 합성에서 기억 행동을 탐지하는 데 충분한가?
- RQ5임상 환경에서 합성 의료 영상 생성에 확산 모델을 사용할 경우 개인정보 보호에 어떤 영향을 미치는가?
주요 결과
- 확산 모델은 특히 소규모 데이터셋에서 StyleGAN보다 훨씬 더 강하게 훈련 영상을 기억한다.
- 3D MRI 볼륨에서 추출한 2D 슬라이스를 생성할 경우 기억 행동이 더 두드러지며, 이는 해부학적 맥락이 기억 패턴에 영향을 준다는 것을 시사한다.
- 모든 데이터셋에서 확산 모델의 합성 영상과 훈련 영상 간 상관관계가 StyleGAN보다 일관되게 높다.
- FID 및 IS와 같은 표준 지표들은 기억 행동을 탐지하지 못하며, 이는 의료 영상 합성에서 개인정보 위험을 평가하는 데 부적절하다는 것을 시사한다.
- 유사한 FID 점수를 기록함에도 불구하고, 확산 모델은 GAN보다 더 많은 수의 동일하거나 거의 동일한 복제본을 생성한다.
- 데이터 부족 상황에서 기억 위험은 증가하며, 이는 훈련 데이터가 제한된 경우 확산 모델이 개인정보 보호에 민감한 의료 영상 생성에 적합하지 않다는 것을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.