[論文レビュー] Accurate Esophageal Gross Tumor Volume Segmentation in PET/CT using Two-Stream Chained 3D Deep Network Fusion
本稿では、PETおよびRTCT画像を統合することで食道がんの全腫瘍体積(GTV)分類を向上させる二本のスレッドで接続された3次元深層学習フレームワークを提案する。解剖学的レジistrationと新規のプログレッシブ意味的ネストドネットワーク(PSNN)を活用することで、先行研究の最良手法に比べ11%の絶対的スコア向上(Diceスコア:0.764 ± 0.134)を達成し、ハウスドルフ距離と表面距離が低減された。
Gross tumor volume (GTV) segmentation is a critical step in esophageal cancer radiotherapy treatment planning. Inconsistencies across oncologists and prohibitive labor costs motivate automated approaches for this task. However, leading approaches are only applied to radiotherapy computed tomography (RTCT) images taken prior to treatment. This limits the performance as RTCT suffers from low contrast between the esophagus, tumor, and surrounding tissues. In this paper, we aim to exploit both RTCT and positron emission tomography (PET) imaging modalities to facilitate more accurate GTV segmentation. By utilizing PET, we emulate medical professionals who frequently delineate GTV boundaries through observation of the RTCT images obtained after prescribing radiotherapy and PET/CT images acquired earlier for cancer staging. To take advantage of both modalities, we present a two-stream chained segmentation approach that effectively fuses the CT and PET modalities via early and late 3D deep-network-based fusion. Furthermore, to effect the fusion and segmentation we propose a simple yet effective progressive semantically nested network (PSNN) model that outperforms more complicated models. Extensive 5-fold cross-validation on 110 esophageal cancer patients, the largest analysis to date, demonstrates that both the proposed two-stream chained segmentation pipeline and the PSNN model can significantly improve the quantitative performance over the previous state-of-the-art work by 11% in absolute Dice score (DSC) (from 0.654 to 0.764) and, at the same time, reducing the Hausdorff distance from 129 mm to 47 mm.
研究の動機と目的
- 食道がんの放射線治療計画において、不一致があり時間がかかる手動によるGTV線引きの課題に対処すること。
- 軟部組織対比が低く、腫瘍境界が不明瞭なRTCTのみを用いた分類の限界を克服すること。
- 診断用PET/CTスキャン(ステージングのための早期に取得)を活用し、時間的ズレがあるにもかかわらず、RTCTに基づくGTV分類を改善すること。
- PET(高い代謝対比)とCT(解剖的詳細)の補完的情報を統合する、堅牢で自動化された手法を開発し、分類精度を向上させること。
- これまでで最大の食道GTV分類データセット(n=110例)を用いて、最先端の性能を示すこと。
提案手法
- 縦断的RTCTおよびPET/CTスキャンを解剖学的基準で初期化し、マルチモodal統合のためのレジストレーションを実施する。
- 二本のスレッドで接続されたパイプラインを設計:一方のスレッドは解剖的文脈を取得するためRTCTのみを処理し、他方のスレッドはレジストレーション済みPETとRTCTを統合して代謝感受性を向上させる。
- プログレッシブ意味的ネストドネットワーク(PSNN)を導入:高レベルの意味的特徴を低レベルの高分解能特徴に伝達する、深層監視付きの3次元U-Netの変種。
- エンコーダーでPETおよびCT入力を早期統合(EF)し、デコーダーで特徴マップを後期統合(LF)することで、補完的情報を統合する。
- 全ボリューム予測のため、80×80×64のサブボリュームと48×48×32のストライドを用いた3次元スライディングウィンドウ推論を実装し、確率マップの集約を実施する。
- Adam最適化法を用い、重み減衰とモーメンタムを40エポックにわたり適用し、患者レベルでの5分割交差検証を実施する。
実験結果
リサーチクエスチョン
- RQ1診断用PETと治療段階のCTを併用することで、RTCT単独使用に比べGTV分類精度が向上するか?
- RQ2PETおよびCT入力の早期統合(EF)と後期統合(LF)の間で、GTV分類性能に差異は生じるか?
- RQ3提案されたPSNNアーキテクチャは、既存の3次元U-NetおよびP-HNNベースのモデルに比べ、食道GTV分類で優れた性能を示すか?
- RQ4特に腫瘍境界が曖昧な症例において、二本のスレッドで接続された統合パイプラインは、分類誤差をどの程度低減できるか?
- RQ5これまでで最大の食道GTVデータセット(n=110例)を用いて、多様な患者の解剖学的特徴および腫瘍の表現に一般化可能か?
主な発見
- 提案されたPSNNモデルはDiceスコア0.764 ± 0.134を達成し、先行研究の最良手法(DenseUNet:0.654 ± 0.210)に比べ11%の絶対的スコア向上を達成した。
- ハウスドルフ距離はDenseUNetの129.0 ± 73.0 mmから、最良のPSNNベースパイプラインでは47.1 ± 56.0 mmに低減され、境界精度の顕著な向上が示された。
- 正解との平均表面距離(ASD)は3.2 ± 3.3 mmにまで低減され、前回最良手法に比べ2.0 mmの改善が得られた。
- 二本のスレッドで接続された統合パイプライン(EF+LF)は、DenseUNet、P-HNN、PSNNのすべてのバックボーンネットワークで一貫して性能向上を示し、汎用性が裏付けられた。
- PSNNモデルは、RTCTのみで学習させた場合でもP-HNNおよびDenseUNetを上回る性能を示し、優れた特徴学習および深層監視設計の有効性を示した。
- 本手法は、これまでで最大の食道GTV分類データセット(n=110例)で最良の性能を達成し、その堅牢性およびスケーラビリティが検証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。