Skip to main content
QUICK REVIEW

[論文レビュー] Hepatic vessel segmentation based on 3D swin-transformer with inductive biased multi-head self-attention

Mian Wu, Yinling Qian|arXiv (Cornell University)|Nov 5, 2021
Advanced Neural Network Applications参考文献 28被引用数 7
ひとこと要約

本稿では、CTボリュームにおける正確な肝臓血管分離を目的として、インダクティブバイアスを備えたマルチヘッド自己注意を組み込んだ3Dスウィントランスフォーマーに基づくIBIMHAV-Netを提案する。ボクセル単位の埋め込み、マルチスケール畳み込み、相対的位置バイアス学習を組み合わせることで、グローバルな文脈モデリングとローカルな詳細の保持を向上させ、3DIRCADbデータセットで74.8%のDiceスコアを達成した。これは、先行するディープラーニングおよびグラフカット手法を上回る性能である。

ABSTRACT

Purpose: Segmentation of liver vessels from CT images is indispensable prior to surgical planning and aroused broad range of interests in the medical image analysis community. Due to the complex structure and low contrast background, automatic liver vessel segmentation remains particularly challenging. Most of the related researches adopt FCN, U-net, and V-net variants as a backbone. However, these methods mainly focus on capturing multi-scale local features which may produce misclassified voxels due to the convolutional operator's limited locality reception field. Methods: We propose a robust end-to-end vessel segmentation network called Inductive BIased Multi-Head Attention Vessel Net(IBIMHAV-Net) by expanding swin transformer to 3D and employing an effective combination of convolution and self-attention. In practice, we introduce the voxel-wise embedding rather than patch-wise embedding to locate precise liver vessel voxels, and adopt multi-scale convolutional operators to gain local spatial information. On the other hand, we propose the inductive biased multi-head self-attention which learns inductive biased relative positional embedding from initialized absolute position embedding. Based on this, we can gain a more reliable query and key matrix. To validate the generalization of our model, we test on samples which have different structural complexity. Results: We conducted experiments on the 3DIRCADb datasets. The average dice and sensitivity of the four tested cases were 74.8% and 77.5%, which exceed results of existing deep learning methods and improved graph cuts method. Conclusion: The proposed model IBIMHAV-Net provides an automatic, accurate 3D liver vessel segmentation with an interleaved architecture that better utilizes both global and local spatial features in CT volumes. It can be further extended for other clinical data.

研究の動機と目的

  • 低コントラストおよび複雑な血管構造のため、CTにおける正確な3D肝臓血管分離の課題に対処すること。
  • 局所的受容野に依存するCNNベースのモデル(例:U-Net)が長距離依存性を扱うのを困難とするという制限を克服すること。
  • 3Dボリューム設定において、グローバル自己注意とローカル畳み込み特徴学習を統合することで、分離精度を向上させること。
  • さまざまな血管複雑性および病理的状態に一般化可能な、堅牢でエンドツーエンドのフレームワークを開発すること。
  • 手動介入なしに自動的かつ正確に分離可能であり、手術計画および画像誘導治療を支援すること。

提案手法

  • 2Dスウィントランスフォーマーを3Dに拡張し、ボリュームデータにおける長距離空間的依存性をモデル化すること。
  • パッチ単位の埋め込みではなくボクセル単位の埋め込みを採用することで、血管ボクセルの正確な空間局在化を維持すること。
  • 並列パスにマルチスケール畳み込み層を統合し、微細なローカル空間特徴を捉えること。
  • 初期化された絶対位置から相対的位置埋め込みを学習するインダクティブバイアス付きマルチヘッド自己注意を提案し、クエリ-キー行列の信頼性を向上させること。
  • デコーダーで3D転置畳み込み層を採用し、三線形補間やパッチ拡張よりも優れた性能を発揮すること。
  • 3Dパッチマージングではなく、小スティルの畳み込み層をダウンサンプリングに用いることで、空間階層をよりよく保持し、性能を向上させること。

実験結果

リサーチクエスチョン

  • RQ1ボクセル単位の埋め込みとインダクティブバイアスを備えた3Dスウィントランスフォーマーは、標準的なCNNベースのモデルと比較して、肝臓血管分離の精度を向上させることができるか?
  • RQ2ハイブリッドアーキテクチャにおいてマルチスケール畳み込みと自己注意を統合することで、3D CTボリュームにおける特徴表現にどのような影響を与えるか?
  • RQ3低コントラストで複雑な血管環境下において、3Dトランスフォーマー基盤の分離ネットワークの最適なダウンサンプリングおよびアップサンプリング戦略は何か?
  • RQ4提案されたインダクティブバイアス付き位置埋め込みは、標準的な絶対位置または相対位置埋め込みと比較して、どのように注意学習を向上させるか?
  • RQ5本モデルは、肝臓CTスキャンにおける構造的複雑性および病理的状態の変動に、どの程度一般化可能か?

主な発見

  • IBIMHAV-Netは3DIRCADbデータセットで平均74.8%のDice係数を達成し、既存のディープラーニングおよびグラフカット手法を上回った。
  • 本モデルは感度77.5%を示し、微小で湾曲した血管の検出性能が優れていた。
  • 3D転置畳み込みによるアップサンプリングが、三線形補間(72.21%)やパッチ拡張(67.11%)と比較して最高のDiceスコア(74.83%)を達成した。
  • 3Dパッチマージングではなく小スティルの畳み込み層をダウンサンプリングに用いることで、血管分離で74.83%のDiceスコア、背景分離で96.92%のスコアを達成した。
  • 局所特徴抽出ブロックを削除すると、Diceスコアが7.5%低下し、精度が12%低下した。これは、微細なディテールを保持する上でそのモジュールが極めて重要であることを確認した。
  • 入力解像度128×128×96は、性能と計算コストの良いトレードオフを提供しており、より大きな入力ではわずか±0.3%のDiceスコア向上しか得られず、計算コストが著しく増加した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。