[논문 리뷰] Unsupervised Multi-Modal Medical Image Registration via Discriminator-Free Image-to-Image Translation
이 논문은 비지도 다중 모odal 의료 영상 정렬을 위한 디스criminатор 없고 형태 보존 가능한 이미지 간 번역 프레임워크를 제안한다. 적대적 훈련을 픽셀 손실과 패치 단위 대비 손실(PatchNCE)으로 대체함으로써 변형 필드 정확도를 향상시키고 잡음과 기하학적 왜곡을 줄였다. 이로 인해 Learn2Reg 2021 데이터셋에서 DSC 점수가 최대 0.966, HD95가 4.367로 최신 기술 수준을 달성하였다.
In clinical practice, well-aligned multi-modal images, such as Magnetic Resonance (MR) and Computed Tomography (CT), together can provide complementary information for image-guided therapies. Multi-modal image registration is essential for the accurate alignment of these multi-modal images. However, it remains a very challenging task due to complicated and unknown spatial correspondence between different modalities. In this paper, we propose a novel translation-based unsupervised deformable image registration approach to convert the multi-modal registration problem to a mono-modal one. Specifically, our approach incorporates a discriminator-free translation network to facilitate the training of the registration network and a patchwise contrastive loss to encourage the translation network to preserve object shapes. Furthermore, we propose to replace an adversarial loss, that is widely used in previous multi-modal image registration methods, with a pixel loss in order to integrate the output of translation into the target modality. This leads to an unsupervised method requiring no ground-truth deformation or pairs of aligned images for training. We evaluate four variants of our approach on the public Learn2Reg 2021 datasets \cite{hering2021learn2reg}. The experimental results demonstrate that the proposed architecture achieves state-of-the-art performance. Our code is available at https://github.com/heyblackC/DFMIR.
연구 동기 및 목표
- GAN 기반의 다중 모달 정렬에서 발생하는 정확도 낮고 일관성 없는 영상 번역 문제를 해결하기 위해, 디스criminator가 도메인 특화 변형을 잘못 이해함으로써 발생하는 잡음과 기하학적 왜곡을 제거하고자 한다.
- 지식 기반 변형 필드가 필요로 하지 않는 조건에서 영상 번역을 통해 문제를 단일 모달 정렬 작업으로 전환함으로써 비지도 다중 모달 정렬 성능을 향상시키고자 한다.
- 대비 손실과 픽셀 손실을 사용하여 교차 모달 번역에서 형태 일관성과 외관 충실도를 향상시키고, 적대적 훈련을 대체하고자 한다.
- 디스criminator를 사용하지 않고도 최신 기술 수준의 정렬 정확도를 달성하고자 하며, 이는 디스criminator가 비합리적인 변형을 유도하여 성능 저하를 초래한다는 점을 고려한 것이다.
- 공개 데이터셋에서의 성능 검증과 주요 구성 요소의 분석을 통해 국소 및 전역 손실의 역할과 디스criminator의 영향을 평가하고자 한다.
제안 방법
- 도메인 특화 변형으로 인한 잡음 유발을 방지하기 위해 표준 GAN 기반의 이미지 간 번역을 디스criminator가 없는 생성자 네트워크로 대체한다.
- 모달 간 번역 과정에서 구조적 및 형태 일관성을 유지하기 위해 패치 단위 대비 손실(PatchNCE)을 적용한다.
- 번역된 영상이 목표 모달의 외관과 일치하도록 픽셀 단위 재구성 손실을 사용하여 단일 모달 유사도 지표의 활용을 가능하게 한다.
- 지역적(PatchNCE) 및 전역적(픽셀 손실) 일치 손실을 통합하여 정확한 변형 필드 도출을 위한 정규화를 유도한다.
- 지식 기반 변형 필드나 쌍으로 정렬된 영상이 필요 없이 오직 영상 유사도만을 사용하여 등록 네트워크를 엔드 투 엔드로 훈련시킨다.
- 이중 스트림 아키텍처를 적용하여 하나는 영상 번역(원본 모달에서 목표 모달로)을, 다른 하나는 변형 필드 예측을 담당하며 공유된 특징 학습을 수행한다.
실험 결과
연구 질문
- RQ1GAN 기반의 이미지 간 번역에서 디스criminator를 제거하면 다중 모달 의료 영상 정렬에서 형태 일관성 향상과 잡음 감소에 기여하는가?
- RQ2적대적 감독 없이도 대비 손실(PatchNCE)이 교차 모달 번역 과정에서 해부학적 구조를 효과적으로 보존하는가?
- RQ3비지도 설정에서 외관 전달과 결합된 픽셀 손실이 정규화 네트워크 훈련을 위한 효과적인 유사도 지표로 기능하는가?
- RQ4지식 기반 레이블이 없는 조건에서 국소 및 전역 일치 손실이 정렬 정확도 향상에 어떻게 상호 보완적으로 기여하는가?
- RQ5디스criminator의 부재가 실제 의료 영상 데이터에서 GAN 기반 기준 모델 대비 더 나은 일반화 능력과 성능 향상에 기여하는가?
주요 결과
- 제안된 방법은 Learn2Reg 2021 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, Insp-Exp 데이터셋에서 DSC는 0.938 (±0.025), HD95는 7.737 mm (±1.791)를 기록하였다.
- Insp-Exp 데이터셋에서 DSC는 0.966 (±0.019), HD95는 4.367 mm (±1.048)를 기록하여 SbR 및 RGPT를 포함한 모든 기준 모델을 초월하였다.
- 절단 실험 결과, 국소(PatchNCE) 또는 전역(픽셀) 손실을 제거할 경우 성능 저하가 발생하여 이들이 상호 보완적인 역할을 한다는 점을 확인하였다.
- 디스criminator가 포함된 변종(w/ dis)은 제안된 방법보다 성능이 열 劣하므로, 디스criminator가 유해한 잡음을 유발하고 정렬 정확도를 저하시킨다는 점을 입증하였다.
- 시각화 결과, 특히 큰 변형이 발생하는 영역에서 제안된 방법은 RGPT 및 SbR보다 더 매끄러운 변형 필드와 더 나은 경계 일치를 제공함을 확인하였다.
- RGPT 대비 변형 필드의 노이즈와 진동을 효과적으로 줄였으며, SbR가 큰 해부학적 변화를 처리하지 못하는 실패를 방지하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.