[論文レビュー] PolypDB: A Curated Multi-Center Dataset for Development of AI Algorithms in Colonoscopy
PolypDB は、米国、スウェーデン、ベトナムを含む10の医療機関から収集した、WLI、NBI、LCI の3つのモダリティにおける3,934枚の内視鏡的ポリープ画像から構成される大規模でマルチセンターマルチモダリティデータセットであり、AIを用いたポリープ検出およびセグメンテーションの向上を目的としている。本研究では最先端モデルのベンチマークを実施し、特に SSFormer-L および YOLOv10 が優れた性能を示し、mIoU は最大 0.8821、F2 スコアは 0.8941 に達した。これにより、臨床的AI開発のための堅牢なベンチマークが確立された。
Colonoscopy is the primary method for examination, detection, and removal of polyps. However, challenges such as variations among the endoscopists' skills, bowel quality preparation, and the complex nature of the large intestine contribute to high polyp miss-rate. These missed polyps can develop into cancer later, underscoring the importance of improving the detection methods. To address this gap of lack of publicly available, multi-center large and diverse datasets for developing automatic methods for polyp detection and segmentation, we introduce PolypDB, a large scale publicly available dataset that contains 3934 still polyp images and their corresponding ground truth from real colonoscopy videos. PolypDB comprises images from five modalities: Blue Light Imaging (BLI), Flexible Imaging Color Enhancement (FICE), Linked Color Imaging (LCI), Narrow Band Imaging (NBI), and White Light Imaging (WLI) from three medical centers in Norway, Sweden, and Vietnam. We provide a benchmark on each modality and center, including federated learning settings using popular segmentation and detection benchmarks. PolypDB is public and can be downloaded at \url{https://osf.io/pr7ms/}. More information about the dataset, segmentation, detection, federated learning benchmark and train-test split can be found at \url{https://github.com/DebeshJha/PolypDB}.
研究の動機と目的
- コロノスコピーにおけるポリープ検出およびセグメンテーションのための堅牢なAIモデルを訓練するための多様で現実世界のデータの重要性に対応する。
- 既存のデータセットの限界を克服するため、地理的に多様な臨床環境から得たマルチセンターマルチモダリティ(WLI、NBI、LCI)の内視鏡画像を統合する。
- 異なる画像モダリティ間で、最先端のセグメンテーションおよび検出モデルを評価・比較するための標準化されたベンチマークを提供する。
- 多様なポリープタイプ、特に難易度の高い微小および平坦ポリープを含めることで、モデルの汎化性能と臨床応用性を向上させる。
- ポリープの見逃し率を低減し、早期大腸がん検出を促進するAIシステムの開発を支援する。
提案手法
- 米国、スウェーデン、ベトナムの10の医療機関から、患者のデモグラフィック要因および画像プロトコルの多様性を確保した、3,934枚のポリープ画像を含むマルチセンターデータセットを収集した。
- 白金画像(WLI)、狭帯域画像(NBI)、連結内視鏡的画像(LCI)という3つの内視鏡モダリティをカバーし、現実の臨床実践を反映した。
- 熟練医によるポリープアノテーションと品質管理を実施し、厳密なデータキュレーションを実施することで、高いアノテーション精度を確保した。
- 標準指標(mIoU、mDSC、精度、再現率、F2 スコア)を用いて、すべてのモダリティで最先端のセグメンテーションおよび検出モデル(例:SSFormer-L、YOLOv10、PVT-CASCADE)をベンチマーク化した。
- SSFormer-L において、多スケール特徴抽出と多様な視覚的特徴に対する耐性を高めるために、MiT-PLD-B4 バックボーンを採用した。
- 異なるモダリティ間でのモデル性能を評価し、モダリティ固有の強みを特定することで、臨床現場への導入意思決定を支援した。

実験結果
リサーチクエスチョン
- RQ1大規模でマルチセンターマルチモダリティのデータセットは、コロノスコピーにおけるポリープ検出およびセグメンテーションのためのAIモデルの汎化性能と耐性を向上させることができるか?
- RQ2PolypDB で訓練および評価された最先端のセグメンテーションおよび検出モデルは、WLI、NBI、LCI という異なる内視鏡画像モダリティにおいて、どのように性能を発揮するか?
- RQ3多様なポリープタイプおよび画像条件において、mIoU、mDSC、再現率、F2 スコアの観点から、どのモデルアーキテクチャが最高の性能を達成するか?
- RQ4微小または平坦ポリープのような微細または挑戦的なポリープ構造を検出する際、モデル間で顕著な性能差は生じるか?
- RQ5モダリティ固有のベンチマークは、リアルタイムコロノスコピー環境における最適なAIモデルの選定をどのように支援できるか?
主な発見
- SSFormer-L は WLI データセットで最高の mIoU(0.8821)と mDSC(0.9294)を達成し、高い再現率(0.9314)と精度(0.9438)を示しており、高いセグメンテーション精度を示している。
- PVT-CASCADE は NBI データセットで最高の F2 スコア(0.8941)と再現率(0.9385)を記録し、微細なポリープ構造の検出において優れた性能を示している。
- YOLOv10 および SSFormer-L は、すべてのモダリティで他のモデルを上回り、今後のポリープ検出およびセグメンテーション研究の強固なベースラインを確立した。
- MiT-PLD-B4 バックボーンは、多様な画像条件において効果的な多スケール特徴抽出を可能にし、モデルの耐性を顕著に向上させた。
- PolypDB のマルチセンターマルチモダリティ設計により、ドメインシフトの低減と現実世界での臨床的応用性の向上を図った、汎化性能の高いモデルのトレーニングが可能になった。
- 本データセットおよびベンチマークは、リアルタイムコロノスコピー手技中に動的なポリープ検出を捉える動画ベースAIシステムの今後の開発基盤を提供する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。