Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Vertebra Labeling in Large-Scale 3D CT using Deep Image-to-Image Network with Message Passing and Sparsity Regularization

Dong Yang, Tao Xiong|arXiv (Cornell University)|May 17, 2017
Medical Imaging and Analysis参考文献 9被引用数 9
ひとこと要約

本稿では、3次元CTスキャンにおける自動椎骨ラベリングのため、メッセージ伝達とスパarsity正則化を備えたディープ画像対画像ネットワーク(DI2IN)を提案する。大規模データセット上で90%の同定率を達成し、GPUで1スキャンあたり約3秒の処理時間で、10mm未満の局在誤差を達成する最先端の手法を上回る性能を発揮した。

ABSTRACT

Automatic localization and labeling of vertebra in 3D medical images plays an important role in many clinical tasks, including pathological diagnosis, surgical planning and postoperative assessment. However, the unusual conditions of pathological cases, such as the abnormal spine curvature, bright visual imaging artifacts caused by metal implants, and the limited field of view, increase the difficulties of accurate localization. In this paper, we propose an automatic and fast algorithm to localize and label the vertebra centroids in 3D CT volumes. First, we deploy a deep image-to-image network (DI2IN) to initialize vertebra locations, employing the convolutional encoder-decoder architecture together with multi-level feature concatenation and deep supervision. Next, the centroid probability maps from DI2IN are iteratively evolved with the message passing schemes based on the mutual relation of vertebra centroids. Finally, the localization results are refined with sparsity regularization. The proposed method is evaluated on a public dataset of 302 spine CT volumes with various pathologies. Our method outperforms other state-of-the-art methods in terms of localization accuracy. The run time is around 3 seconds on average per case. To further boost the performance, we retrain the DI2IN on additional 1000+ 3D CT volumes from different patients. To the best of our knowledge, this is the first time more than 1000 3D CT volumes with expert annotation are adopted in experiments for the anatomic landmark detection tasks. Our experimental results show that training with such a large dataset significantly improves the performance and the overall identification rate, for the first time by our knowledge, reaches 90 %.

研究の動機と目的

  • 脊椎変形、金属アーチファクト、視野制限などの病理を伴う3次元CTスキャンにおける正確な椎骨局在化の課題に対処すること。
  • 低コントラストまたはアーチファクトが多いスキャンにおいて、粗い分類に依存するか、文脈的モデリングを欠く既存手法の限界を克服すること。
  • 中間特徴抽出を経ずに、3次元ボリュームから直接椎骨中心点を回帰するエンドツーエンドのディープラーニングフレームワークの構築。
  • 椎骨間の関係をモデル化するためのメッセージ伝達と、誤検出を抑えるためのスパarsity正則化を統合することで、耐障害性と正確性を向上させること。
  • 大規模なトレーニングの利点を実証するため、1,000体を超える追加のアノテート済み3次元CTボリュームを用いて再トレーニングを行い、性能を著しく向上させること。

提案手法

  • 3次元CTボリュームを多チャンネルの椎骨中心点確率マップに直接マッピングする、ボクセル単位の回帰を実行する、完全畳み込み型のエンコーダ・デコーダベースのディープ画像対画像ネットワーク(DI2IN)を採用する。
  • 多段階のスキップ接続とディープスーパービジョンを用いて、トレーニング中に特徴学習と局在精度を向上させる。
  • 確率マップ上でのメッセージ伝達スキームを適用し、椎骨間の空間的関係と相互一貫性を活用して予測を精緻化する。
  • 最終的な確率マップにおけるスパースな活性化パターンを強制することで、誤検出を抑えるスパarsity正則化を導入する。
  • 教師データとしての椎骨中心点位置を用いて、マルチチャンネルボクセル単位の回帰により、エンドツーエンドでモデルをトレーニングする。
  • 一般化性能と性能を向上させるために、専門家がアノテートした1,000体を超える追加の3次元CTボリュームを含む拡張データセットを用いてDI2INを再トレーニングする。

実験結果

リサーチクエスチョン

  • RQ1事前処理や粗い検出ステージに依存せずに、ディープ画像対画像ネットワークが3次元CTスキャンにおいて椎骨中心点を効果的に局在化できるか。
  • RQ2アーチファクトや病理を伴う状況下で、椎骨間のメッセージ伝達が局在精度をどのように向上させるか。
  • RQ3複雑なまたは低コントラストな脊椎CTスキャンにおいて、スパarsity正則化が誤検出をどの程度低減できるか。
  • RQ41,000体を超えるアノテート済み3次元CTボリュームを含む大規模データセットでトレーニングすることで、小規模ベンチマークと比較して同定および局在性能が著しく向上するか。
  • RQ5提案手法が、臨床的応用に適した環境で、高精度かつリアルタイムの推論速度(例:1スキャンあたり約3秒)を達成できるか。

主な発見

  • 1,000体を超える追加の3次元CTボリュームでトレーニングした結果、テストセットで90%の同定率を達成し、以前の最先端手法を著しく上回った。
  • 拡張されたトレーニングデータを用いることで、全テストセットにおける平均局在誤差は6.4 mm(標準偏差5.9 mm)にまで低下し、従来手法を上回った。
  • 拡張データセットでトレーニングした結果、頸椎では93%、腰椎では90%の同定率を達成した。
  • メッセージ伝達とスパarsity正則化の各モジュールは、ベースとなるDI2INモデルと比較して、平均局在誤差をそれぞれ2.7 mmおよび1.1 mm低減した。
  • GPU上での平均推論時間は1スキャンあたり約3秒であり、臨床現場への導入に適した高い効率性を示した。
  • 1,000体を超えるアノテート済み3次元CTボリュームを含む大規模データセットで再トレーニングすることで、性能が著しく向上した。これは、椎骨ランドマーク検出において、このような大規模なトレーニングセットを初めて用いた試みである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。