Skip to main content
QUICK REVIEW

[論文レビュー] 3D Anisotropic Hybrid Network: Transferring Convolutional Features from 2D Images to 3D Anisotropic Volumes

Siqi Liu, Daguang Xu|arXiv (Cornell University)|Nov 23, 2017
AI in cancer detection被引用数 7
ひとこと要約

本稿では、ImageNetから事前学習された2D畳み込み特徴量を、非等方的3Dボリュームに転移する3D非等方的ハイブリッドネットワーク(AH-Net)を提案する。非等方的3D畳み込みとスキップ接続を用いてスライス間の文脈をモデル化しながら、優れた一般化性能を維持する。本手法は、DBTにおける病変検出およびCTにおける肝臓/病変セグメンテーションで最先端の性能を達成しており、2Dマルチスライス手法よりも高速な推論を実現する。

ABSTRACT

While deep convolutional neural networks (CNN) have been successfully applied for 2D image analysis, it is still challenging to apply them to 3D anisotropic volumes, especially when the within-slice resolution is much higher than the between-slice resolution and when the amount of 3D volumes is relatively small. On one hand, direct learning of CNN with 3D convolution kernels suffers from the lack of data and likely ends up with poor generalization; insufficient GPU memory limits the model size or representational power. On the other hand, applying 2D CNN with generalizable features to 2D slices ignores between-slice information. Coupling 2D network with LSTM to further handle the between-slice information is not optimal due to the difficulty in LSTM learning. To overcome the above challenges, we propose a 3D Anisotropic Hybrid Network (AH-Net) that transfers convolutional features learned from 2D images to 3D anisotropic volumes. Such a transfer inherits the desired strong generalization capability for within-slice information while naturally exploiting between-slice information for more effective modelling. The focal loss is further utilized for more effective end-to-end learning. We experiment with the proposed 3D AH-Net on two different medical image analysis tasks, namely lesion detection from a Digital Breast Tomosynthesis volume, and liver and liver tumor segmentation from a Computed Tomography volume and obtain the state-of-the-art results.

研究の動機と目的

  • 非等方的医用ボリューム上で3D CNNをスクラッチから訓練する際の3Dデータの限界と一般化性能の低さという課題に対処すること。
  • 高スライス内解像度と低スライス間解像度を有する非等方的ボリュームにおいて、標準的な等方的カーネルを有する3D CNNの限界を克服すること。
  • 2D特徴量の事前学習を活用して一般化性能を向上させるとともに、非等方的畳み込みを用いて3D文脈を効果的にモデル化すること。
  • 2Dネットワーク出力をスタックする手法と比較して、より高速なエンドツーエンド3D推論を可能にすること。

提案手法

  • 複数の2Dスライスを入力として用い、ImageNetで2D畳み込み型ResNetを事前学習する。
  • 2Dカーネルを追加次元で3Dに拡張することで、2Dエンコーダーの重みを3Dネットワークに転移する。
  • スライス内特徴量とスライス間特徴量に重点を置くために、3×3×1および1×1×3カーネルを用いた非等方的畳み込みブロックを用いて3D特徴デコーダーを構築する。
  • U-Netにインspiredした密接続とエンコーダー・デコーダー間のスキップ接続を統合し、空間的詳細を保持する。
  • ネットワークの終端部にピラミッドボリュームプーリングモジュールを適用し、マルチスケール特徴量を抽出する。
  • 難易度の高い例のマイニングを可能にするために、フォーカル損失を用いて3Dパッチで3D AH-Netを微調整し、学習の安定性と性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1事前学習された2D特徴量は、低データ環境下で非等方的3Dボリュームに効果的に転移可能であり、一般化性能の向上に寄与するか?
  • RQ2高非等方的解像度(例:DBTおよびCT)を持つボリュームにおいて、3D文脈を効果的にモデル化できるか?
  • RQ33×3×1および1×1×3の非等方的畳み込みカーネルを用いることで、標準的な等方的3×3×3カーネルよりも性能が向上するか?
  • RQ42D-3Dハイブリッドアーキテクチャは、2Dマルチスライス推論と比較してより高速な推論を実現できるか、かつ精度を維持または向上できるか?
  • RQ5クラス不均衡を有する3Dセグメンテーションタスクにおいて、フォーカル損失は学習を改善するか?

主な発見

  • AH-Netは、LITS 2017チャレンジデータセットにおいて、病変セグメンテーションでDice Globalスコア0.834、肝臓セグメンテーションで0.970の最先端性能を達成した。
  • 病変ではDice Per Caseスコア0.634、肝臓では0.963を記録し、チャレンジに参加した他のすべての提出物を上回った。
  • ImageNetからの転移学習のおかげで、標準的な3D U-Netや他の3Dモデルと比較して優れた一般化性能を示した。
  • 2Dマルチスライス推論パイプラインと比較して、GPU推論時間が短く、エンドツーエンド3D処理を可能にした。
  • フォーカル損失の使用により、特に病変セグメンテーションにおいて、難易度の高い、まれな、または曖昧なボクセルでの学習が顕著に向上した。
  • スライス厚さが0.45–6.0 mmで変動する多様な非等方的CTスキャンにおいても、良好な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。