[논문 리뷰] PolypDB: A Curated Multi-Center Dataset for Development of AI Algorithms in Colonoscopy
PolypDB는 미국, 스웨덴, 베트남 등 다양한 지역의 10개 의료기관에서 확보한 총 3,934장의 내 endoscopic polyp 영상으로 구성된 대규모 다센터, 다모달리티 데이터셋으로, AI 기반 폴립 탐지 및 분할을 향상시키기 위해 구축되었다. 이 연구는 최신 기술 모델들을 평가하여, 특히 SSFormer-L과 YOLOv10이 뛰어난 성능을 보이며 mIoU 최고 0.8821, F2 스코어 0.8941을 기록함으로써 임상용 AI 개발을 위한 견고한 벤치마크를 확립하였다.
Colonoscopy is the primary method for examination, detection, and removal of polyps. However, challenges such as variations among the endoscopists' skills, bowel quality preparation, and the complex nature of the large intestine contribute to high polyp miss-rate. These missed polyps can develop into cancer later, underscoring the importance of improving the detection methods. To address this gap of lack of publicly available, multi-center large and diverse datasets for developing automatic methods for polyp detection and segmentation, we introduce PolypDB, a large scale publicly available dataset that contains 3934 still polyp images and their corresponding ground truth from real colonoscopy videos. PolypDB comprises images from five modalities: Blue Light Imaging (BLI), Flexible Imaging Color Enhancement (FICE), Linked Color Imaging (LCI), Narrow Band Imaging (NBI), and White Light Imaging (WLI) from three medical centers in Norway, Sweden, and Vietnam. We provide a benchmark on each modality and center, including federated learning settings using popular segmentation and detection benchmarks. PolypDB is public and can be downloaded at \url{https://osf.io/pr7ms/}. More information about the dataset, segmentation, detection, federated learning benchmark and train-test split can be found at \url{https://github.com/DebeshJha/PolypDB}.
연구 동기 및 목표
- 대장내시경에서 폴립 탐지 및 분할을 위한 강력한 AI 모델을 훈련시키기 위해 다양하고 실제적인 데이터가 필수적이라는 점을 해결하기 위해.
- 기존 데이터셋의 한계를 극복하기 위해, 지리적으로 다양하고 다센터, 다모달리티(WLI, NBI, LCI)의 내시경 영상 자료를 포함함으로써.
- 다양한 영상 모달리티 간에 상태의 최신 기술 모델들을 평가하고 비교할 수 있는 표준화된 벤치마크를 제공하기 위해.
- 다양한 폴립 유형, 특히 도말성 및 평판 폴립과 같은 도전적인 유형을 포함함으로써 모델의 일반화 능력과 임상 적용 가능성을 향상시키기 위해.
- 폴립 누락률을 줄이고 조기 대장암 검출을 향상시키기 위한 AI 시스템 개발을 지원하기 위해.
제안 방법
- 미국, 스웨덴, 베트남 등에서 활동하는 10개 의료기관에서 확보한 총 3,934장의 폴립 영상으로 구성된 다센터 데이터셋을 구축하여 환자 인구 통계 및 영상 프로토콜의 다양성을 확보하였다.
- 백색광 영상(WLI), 협폭대역 영상(NBI), 연결내시경 영상(LCI)의 세 가지 내시경 모달리티를 포함하여 실제 임상 실무를 반영하였다.
- 전문가 검증을 통한 폴립 주석 및 품질 관리를 포함한 철저한 데이터 정제를 수행하여 높은 주석 정확도를 확보하였다.
- 표준 평가 지표(mIoU, mDSC, 정밀도, 재현율, F2 스코어)를 사용하여 모든 세 모달리티에서 최신 기술 분할 및 탐지 모델(예: SSFormer-L, YOLOv10, PVT-CASCADE)을 평가하였다.
- SSFormer-L에서 MiT-PLD-B4 백본을 활용하여 다양한 시각적 특징 간의 다스케일 특징 학습 능력과 강건성을 향상시켰다.
- 모달리티 간 성능을 평가하여 각 모달리티의 특성에 맞는 강점과 임상 적용 결정을 위한 가이드라인을 도출하였다.

실험 결과
연구 질문
- RQ1대규모, 다센터, 다모달리티 데이터셋이 대장내시경에서 폴립 탐지 및 분할을 위한 AI 모델의 일반화 능력과 강건성을 향상시킬 수 있는가?
- RQ2PolypDB에서 훈련 및 평가된 최신 기술 분할 및 탐지 모델이 WLI, NBI, LCI 등 다양한 내시경 영상 모달리티에서 어떻게 성능을 발휘하는가?
- RQ3다양한 폴립 유형과 영상 조건에서 mIoU, mDSC, 재현율, F2 스코어 측면에서 최고 성능을 내는 모델 아키텍처는 무엇인가?
- RQ4작은 폴립이나 평판 폴립과 같은 미세하거나 도전적인 폴립 구조를 탐지할 때 모델 간의 주요 성능 차이는 무엇인가?
- RQ5모달리티별 벤치마크는 실시간 대장내시경 환경에서 최적의 AI 모델을 선정하는 데 어떻게 기여할 수 있는가?
주요 결과
- SSFormer-L은 WLI 데이터셋에서 최고의 mIoU(0.8821)와 mDSC(0.9294)를 기록하였으며, 높은 재현율(0.9314)과 정밀도(0.9438)를 보여, 높은 분할 정확도를 입증하였다.
- PVT-CASCADE는 NBI 데이터셋에서 최고의 F2 스코어(0.8941)와 재현율(0.9385)을 기록하여 미세한 폴립 구조 탐지에서 뛰어난 성능을 보였다.
- YOLOv10과 SSFormer-L은 모든 모달리티에서 다른 모델들을 압도하며 향후 폴립 탐지 및 분할 연구를 위한 강력한 기준선을 확립하였다.
- MiT-PLD-B4 백본은 다양한 영상 조건에서 효과적인 다스케일 특징 추출을 가능하게 하여 모델의 강건성을 크게 향상시켰다.
- PolypDB의 다센터 및 다모달리티 설계 덕분에 도메인 이동 문제를 줄이고 실제 임상 적용 가능성을 높인 모델 훈련이 가능해졌다.
- 이 데이터셋과 벤치마크는 실시간 대장내시경 절차 중 동적 폴립 탐지 기록을 위한 영상 기반 AI 시스템의 향후 개발 기반을 마련한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.