[논문 리뷰] Multimodal Interactive Lung Lesion Segmentation: A Framework for Annotating PET/CT Images based on Physiological and Anatomical Cues
이 논문은 PET/CT 폐 병변 주석 작업을 위한 다중모달 상호작용 세그멘테이션 프레임워크를 제안한다. 해부학적(CT) 및 생리학적(PET) 단서를 활용하여 수동 주석 작업을 줄인다. 새로운 타원체 기반 사용자 시뮬레이션과 RoI 최적화된 지오데식 거리 변환을 통해 전문가 사용자가 기준 방법 대비 병변당 약 12.5% 시간을 절약하면서 더 빠르고 정확한 세그멘테이션을 달성한다.
Recently, deep learning enabled the accurate segmentation of various diseases in medical imaging. These performances, however, typically demand large amounts of manual voxel annotations. This tedious process for volumetric data becomes more complex when not all required information is available in a single imaging domain as is the case for PET/CT data. We propose a multimodal interactive segmentation framework that mitigates these issues by combining anatomical and physiological cues from PET/CT data. Our framework utilizes the geodesic distance transform to represent the user annotations and we implement a novel ellipsoid-based user simulation scheme during training. We further propose two annotation interfaces and conduct a user study to estimate their usability. We evaluated our model on the in-domain validation dataset and an unseen PET/CT dataset. We make our code publicly available: https://github.com/verena-hallitschke/pet-ct-annotate.
연구 동기 및 목표
- 특히 단일 모odal에서 병변이 명확히 드러나지 않는 다중모달 PET/CT 자료에서 3차원 의료 영상 세그멘테이션의 높은 주석 부담을 해결한다.
- 대규모 볼륨 수준 주석에 의존하는 것을 줄이기 위해 최소한의 사용자 입력(예: 스크래치)으로도 상호작용 세그멘테이션을 가능하게 한다.
- 주석 과정에서 PET(대사 활동)와 CT(해부학적 세부 정보) 모달 간의 통합을 통해 세그멘테이션 정확도와 효율성을 향상시킨다.
- 동시 시각화 대비 순차적 시각화 방식의 사용자 인터페이스 설계가 주석 속도와 품질에 미치는 영향을 평가한다.
- 학습 분포 외의 새로운 데이터셋에 대한 모델의 일반화 능력을 입증한다.
제안 방법
- 제안된 P-Net 및 R-Net 네트워크에 동일한 CNN 아키텍처를 사용하여 双모달 입력(PET 및 CT)을 처리할 수 있도록 DeepIGeoS 모델을 수정한다.
- 학습 중에 실제 사용자 상호작용 없이도 모델 일반화 능력을 향상시키기 위해 현실적인 전경 및 배경 스크래치를 생성하는 새로운 타원체 기반 사용자 시뮬레이션 기법을 도입한다.
- 공간적 맥락을 유지하면서 계산 비용을 줄이기 위해 영역-중점(RoI) 기반 지오데식 거리 변환을 사용자 상호작용에 인코딩한다.
- 두 가지 사용자 인터페이스 설계를 구현한다: (1) 동기화된 PET 및 CT 표시를 위한 옆으로 배열된 디스플레이, (2) 집중력을 높이기 위한 전환 가능한 모달 디스플레이.
- 3D Slicer와 MONAI Label을 사용하여 실시간 모델 추론과 반복적 보완을 가능하게 하는 상호작용 주석 플러그인을 구축한다.
- AutoPET 데이터셋에서 엔드 투 엔드로 모델을 훈련하고, 도메인 내 및 도메인 외부(Lung-PET-CT-Dx) 데이터셋에서 평가하여 일반화 능력을 평가한다.

실험 결과
연구 질문
- RQ1사용자 인터페이스에서 PET 및 CT 모달을 동시에 표시하는 것이 순차적 시각화에 비해 더 빠르고 정확한 폐 병변 세그멘테이션을 가능하게 하는가?
- RQ2다중모달 상호작용 세그멘테이션 프레임워크가 PET/CT 볼륨에서 폐 병변 주석 작업의 시간과 노력을 크게 줄일 수 있는가?
- RQ3제안된 타원체 기반 사용자 시뮬레이션 기법이 실제 사용자 상호작용 없이도 훈련 중 모델의 강건성 향상에 얼마나 효과적인가?
- RQ4모델이 미리 보지 않은 PET/CT 데이터셋에서 초기 딥러닝 예측을 상호작용 보완을 통해 얼마나 향상시킬 수 있는가?
- RQ5생리학적(PET) 및 해부학적(CT) 단서의 통합이 단일 모달 접근에 비해 세그멘테이션 성능을 얼마나 향상시키는가?
주요 결과
- 두 뷰 인터페이스(동시 PET 및 CT 표시)는 GraphCut 및 단일 뷰 설정 대비 주석 시간을 약 12.5% 감소시켰으며, 다중모달 가시성으로 인한 더 빠른 주석이 확인되었다.
- 모든 사용자가 제안된 방법과 함께 두 뷰 인터페이스를 사용할 경우 유의미한 Dice 점수(>0.7)를 달성했으며, GraphCut는 사용 가능한 세그멘테이션을 생성하지 못해 근처 0에 가까운 Dice 점수를 기록했다.
- 단일 뷰 인터페이스는 대부분의 사용자에게 두 뷰 인터페이스와 유사한 Dice 점수를 제공했지만, 주석 속도가 상당히 느렸다. 이는 동시에 시각화하는 것이 효율성을 향상시킨다는 것을 시사한다.
- 모델은 미리 보지 않은 데이터셋(Lung-PET-CT-Dx)에서 초기 P-Net 예측을 성공적으로 향상시켜, 다양한 데이터 분포 간의 강력한 일반화 능력을 입증했다.
- 설문 조사 후 피드백에서 모든 전문가가 다중모달 인터페이스가 유용하다고 평가했으며, 모델의 초기 예측 속도와 품질에 대해 매우 만족한다고 보고했다.
- 최적화된 사용자 상호작용 모델링을 통해 생리학적 및 해부학적 단서를 통합함으로써, 이 프레임워크는 PET/CT에 대한 상호작용 세그멘테이션 분야에서 최고 성능을 달성했다.
![Fig. 2 : The workflow of our proposed method. Blue boxes indicate the segmentation models which are adapted from Wang et al. [ 6 ] to multimodal inputs.](https://ar5iv.labs.arxiv.org/html/2301.09914/assets/images/final_architecture.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.