Skip to main content
QUICK REVIEW

[論文レビュー] 3D Context Enhanced Region-based Convolutional Neural Network for End-to-End Lesion Detection

Ke Yan, Mohammadhadi Bagheri|arXiv (Cornell University)|Jun 25, 2018
Radiomics and Machine Learning in Medical Imaging参考文献 11被引用数 6
ひとこと要約

本稿では、複数の隣接するCTスライスからの特徴マップを統合することで、2次元の領域ベースCNNに3次元の文脈を組み込む、メモリ効率的でエンドツーエンドの深層学習フレームワーク、3Dコンテキスト強化領域ベースCNN(3DCE)を提案する。事前学習済みの2次元バックボーンと2次元のバウンディングボックスアノテーションを活用することで、DeepLesionデータセットにおいて1画像あたり4つの偽陽性を許容した状況で、病変検出感度を4.05%向上(80.32%から84.37%)し、3次元CNNや2段階FPR手法を凌駕した。

ABSTRACT

Detecting lesions from computed tomography (CT) scans is an important but difficult problem because non-lesions and true lesions can appear similar. 3D context is known to be helpful in this differentiation task. However, existing end-to-end detection frameworks of convolutional neural networks (CNNs) are mostly designed for 2D images. In this paper, we propose 3D context enhanced region-based CNN (3DCE) to incorporate 3D context information efficiently by aggregating feature maps of 2D images. 3DCE is easy to train and end-to-end in training and inference. A universal lesion detector is developed to detect all kinds of lesions in one algorithm using the DeepLesion dataset. Experimental results on this challenging task prove the effectiveness of 3DCE. We have released the code of 3DCE in https://github.com/rsummers11/CADLab/tree/master/lesion_detector_3DCE.

研究の動機と目的

  • CTスキャンにおける真の病変と偽陽性を区別する課題に取り組む。ここでは3次元の文脈が重要であるが、既存の2次元ベースのエンドツーエンド検出器では十分に活用されていない。
  • 3次元CNNや3次元バウンディングボックスアノテーションを必要とせず、3次元の文脈を組み込むメモリ効率的でエンドツーエンドの深層学習フレームワークを開発する。
  • 大規模なDeepLesionデータセットを用いて学習された1つの統合モデルにより、多様な病変タイプに普遍的に適用可能な病変検出を実現する。
  • 3次元CNNを初期から訓練する必要を回避するため、事前学習済みの2次元CNN重み(例:VGG-16)を転移学習に活用する。

提案手法

  • 3DCEはM個の連続するCTスライスをM個の3チャンネル画像にグループ化し、2次元CNNとの入力互換性を維持する。
  • 各スライスに2次元の領域ベースの完全畳み込みネットワーク(R-FCN)を適用し、得られた特徴マップをスライス間で空間的に統合することで3次元の文脈を符号化する。
  • 隣接スライスの特徴マップを連結し、分類および回帰のための追加の全結合層とReLU層を備えた共有で改善されたR-FCNヘッドを処理する。
  • 小規模な病変の空間分解能を保持するため、プーリング層pool4およびpool5を削減した変更版VGG-16バックボーンを採用する。
  • 3次元アノテーションや2段階FPRパイプラインを必要とせず、2次元バウンディングボックスアノテーションのみでエンドツーエンドの学習と推論を可能にする。
  • スライス数に比例して推論時間が線形に増加するスケーラブルで効率的な手法であり、ボリュメトリックデータにおける特徴マップキャッシュの恩恵を受ける。

実験結果

リサーチクエスチョン

  • RQ13次元畳み込み層や3次元アノテーションを必要とせずに、2次元領域ベースCNNに3次元文脈を効果的に組み込むことは可能か?
  • RQ2複数の2次元スライスの特徴マップレベルの統合は、データレベルの統合や3次元CNNに比べて病変検出感度を向上させるか?
  • RQ3多様な病変タイプを学習データに含む1つの統合モデルが、2次元バウンディングボックスアノテーションと事前学習済み2次元モデルのみで高い性能を達成できるか?
  • RQ42段階FPR手法や3次元CNNと比較して、3DCEは感度、学習効率、メモリ使用量の観点で優れているか?

主な発見

  • 3DCEは、DeepLesionテストセットにおいて1画像あたり4つの偽陽性を許容した状況で、病変検出感度を80.32%から84.37%まで向上させ、病変タイプにわたり一貫した向上を示した。
  • 9枚の入力スライスを用いた場合、4 FPsあたり84.34%の感度を達成し、27枚のスライスでは4 FPsで85.65%の感度を達成し、文脈の深さに応じたスケーラビリティを示した。
  • 3次元CNNを初期から訓練した手法(4 FPsあたり79.7%の感度)を上回ったが、これは事前学習済み2次元重みと因子化された3次元特徴統合のおかげである。
  • 追加の全結合層を備えた改良版R-FCNバックボーンは、元のR-FCNと同等の推論速度を維持しながら、精度を0.7%向上させた。
  • 11枚のスライスを用いたデータレベル統合(4 FPsあたり83.02%の感度)や、ファストRCNN(4 FPsあたり81.62%)よりも優れた性能を達成したことで、特徴レベル統合の優位性が確認された。
  • 公式のDeepLesionデータ分割(4,817枚の画像)において、3DCEは16 FPsあたり89.62%の感度、4 FPsあたり84.34%の感度を達成し、病変タイプや直径にかかわらず一貫した向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。