Skip to main content
QUICK REVIEW

[論文レビュー] Endoscopy Disease Detection and Segmentation (EDD2020)

Sharib Ali, Barbara Braden|arXiv (Cornell University)|Jan 15, 2020
Gastrointestinal Bleeding Diagnosis and Treatment参考文献 3被引用数 15
ひとこと要約

本論文は、病変検出およびセグメンテーションのための、386枚のアノテート済み消化管内視鏡フレームを含む、複数施設・複数臓器・複数モodalitiyのデータセット、EDD2020チャレンジを紹介する。mAP、IoU、F1スコアという指標を用いて、境界ボックス局在、ピクセルレベルのセグメンテーション、およびサンプル外一般化性能を評価し、最高のアンサンブルモデルで平均mAPが45%に達したが、クラス不均衡や困難なケースが存在した。

ABSTRACT

Endoscopy is a widely used clinical procedure for the early detection of cancers in hollow-organs such as oesophagus, stomach, and colon. Computer-assisted methods for accurate and temporally consistent localisation and segmentation of diseased region-of-interests enable precise quantification and mapping of lesions from clinical endoscopy videos which is critical for monitoring and surgical planning. Innovations have the potential to improve current medical practices and refine healthcare systems worldwide. However, well-annotated, representative publically-available datasets for disease detection for assessing reproducibility and facilitating standardised comparison of methods is still lacking. Many methods to detect diseased regions in endoscopy have been proposed however these have primarily focussed on the task of polyp detection in the gastrointestinal tract with demonstration on datasets acquired from at most a few data centres and single modality imaging, most commonly white light. Here, we present our multi-class disease detection and segmentation challenge in clinical endoscopy. With this sub-challenge we aim to establish a comprehensive dataset to benchmark algorithms for disease detection.

研究の動機と目的

  • 内視鏡病変検出およびセグメンテーションのための包括的で公開可能な複数施設のデータセットが不足しているという問題に対処すること。
  • 複数の臓器および画像モダリティをカバーする現実世界の臨床データ上で、ディープラーニングモデルのベンチマークを確立すること。
  • 内視鏡における頑健で一般化可能で臨床応用可能なコンピュータ支援診断システムの研究を促進すること。
  • 標準化された指標を用いて、検出、セグメンテーション、およびサンプル外一般化性能のモデル性能を評価すること。
  • クラウドソーシングチャレンジフレームワークを通じて、再現可能で比較可能なアルゴリズム評価を促進すること。

提案手法

  • 本データセットは、4か国の国際的施設から得られた386枚の内視鏡フレームで構成され、大腸、食道、胃をカバーしており、5つの疾患クラス(NDBE、懸念される病変、高リスク異形成、がん、ポリープ)を含む。
  • アノテーションは臨床専門家および博士研究員がVIAツールを用いて実施し、境界ボックスはPASCAL VOC形式、セグメンテーションマスクは5チャンネルTIFF画像として提供された。
  • 評価には3つのタスクが含まれる:検出(境界ボックス局在)、セマンティックセグメンテーション(ピクセルレベルのラベル付け)、およびサンプル外検出(訓練・検証に含まれない施設への一般化)。
  • 性能評価には、検出ではmAPd(IoU閾値0.25~0.75、ステップ0.05での平均平均適合率)とIoU、セグメンテーションではF1、F2、精度、再現率が用いられた。
  • スコアは加重スコア(0.6×mAPd + 0.4×IoUd)で順位付けされ、標準偏差が同率の解消に用いられた。
  • サンプル外一般化性能は、deviationスコア |mAPd − mAPg| で評価され、低い値がより優れた耐性を示す。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングモデルは、多様な臓器および画像モダリティをカバーする多様な消化管疾患の検出および局在化において、どの程度の性能を示すのか?
  • RQ2モデルは、トレーニングまたは検証に含まれない未観測の施設やデータ分布に対して、どの程度一般化できるのか?
  • RQ3mAPおよびIoU指標は、内視鏡画像解析における臨床的妥当性とどの程度相関しているのか?
  • RQ4クラス不均衡(例:がん症例が少ない)は、モデル性能および一般化性能にどのような影響を与えるのか?
  • RQ5アンサンブル手法は、困難で曖昧、または重複する病変を抱える状況での検出およびセグメンテーション性能を向上させることができるのか?

主な発見

  • 全テストデータセット全体での平均mAPは35%であったが、主にがん症例が不足しており、バーレット食道組織と重複するポリープのような複雑なケースが影響した。
  • ベースラインアルゴリズムは8枚のテスト画像のサブセットで58.52%のmAPを達成し、mAP25およびmAP50はともに62.5%であった。これは代表的な症例における強力な局在性能を示している。
  • 3つのモデルのアンサンブルにより、平均mAPが45%以上に向上し、曖昧またはまれな症例の処理においてモデル結合の利点が明らかになった。
  • アルゴリズム1はがんを検出できず、小さなバーレット病変をポリープと誤分類した。これは微細な病変認識の難しさを示している。
  • 最高性能を示したモデルは、低いdeviationスコア(devg → 0)を達成し、トレーニングデータおよび未観測データの両方で一貫したmAPを示しており、サンプル外一般化性能が優れていた。
  • チャレンジの結果、小さなサブセットで高いmAPを達成しても、全データセットでの性能が保証されないことが判明し、耐性および一般化性能の重要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。