Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Segmentation of Head and Neck Tumor: How Powerful Transformers Are?

Ikboljon Sobirov, Otabek Nazarov|arXiv (Cornell University)|Jan 17, 2022
Radiomics and Machine Learning in Medical Imaging被引用数 8
ひとこと要約

この論文は、マルチモodalなCT/PETスキャンにおける頭頸部腫瘍の自動セグメンテーションを目的とした、ビジョントランスフォーマー基盤のモデル(UNETR)を評価しており、最先端のCNNベースのモデルと比較している。スクラッチから訓練されたトランスフォーマー・モデルは、平均DSC 0.736を達成し、トップクラスのCNNモデルと同等の性能を示しており、医療画像セグメンテーションにおけるトランスフォーマーの強力な潜在的可能性を示している。

ABSTRACT

Cancer is one of the leading causes of death worldwide, and head and neck (H&N) cancer is amongst the most prevalent types. Positron emission tomography and computed tomography are used to detect, segment and quantify the tumor region. Clinically, tumor segmentation is extensively time-consuming and prone to error. Machine learning, and deep learning in particular, can assist to automate this process, yielding results as accurate as the results of a clinician. In this paper, we investigate a vision transformer-based method to automatically delineate H&N tumor, and compare its results to leading convolutional neural network (CNN)-based models. We use multi-modal data from CT and PET scans to perform the segmentation task. We show that a solution with a transformer-based model has the potential to achieve comparable results to CNN-based ones. With cross validation, the model achieves a mean dice similarity coefficient (DSC) of 0.736, mean precision of 0.766 and mean recall of 0.766. This is only 0.021 less than the 2020 competition winning model (cross validated in-house) in terms of the DSC score. On the testing set, the model performs similarly, with DSC of 0.736, precision of 0.773, and recall of 0.760, which is only 0.023 lower in DSC than the 2020 competition winning model. This work shows that cancer segmentation via transformer-based models is a promising research area to further explore.

研究の動機と目的

  • マルチモーダルなCTおよびPET画像を用いた頭頸部腫瘍の自動セグメンテーションにおいて、ビジョントランスフォーマー基盤のモデルの性能を調査すること。
  • セグメンテーション精度の観点から、トランスフォーマー基盤のモデルと最先端のCNNベースのモデル(例:SEベースのU-Net、nnU-Net)を比較すること。
  • この医療画像セグメンテーションタスクにおけるデータ拡張の影響を評価すること。
  • 元々の応用範囲を超えて、異なる医療画像コンテキストにおいて新たに提案されたUNETRアーキテクチャの一般化能とロバストネスを評価すること。
  • トランスフォーマーが、複雑でコントラストが低く、アーチファクトを含む医療画像セグメンテーションタスクにおいて、CNNを同等または上回る性能を示せるかどうかを検討すること。

提案手法

  • 3D ViTエンコーダを用いてグローバルな文脈的特徴を抽出し、U-Net風のデコーダを備えた、ビジョントランスフォーマー基盤のアーキテクチャであるUNETRを採用した。
  • 交差エントロピー損失とDice損失を用い、HECKTORデータセットのマルチモーダル3D CTおよびPETスキャン上で、モデルをエンドツーエンドで訓練した。
  • 一般化を向上させるために、強度のジャイタリング、回転、反転、およびエラスティック変形を含む、広範なデータ拡張技術を適用した。
  • 多様な臨床施設およびスキャンプロトコルをカバーするため、1施設を除いて全施設を用いたリーブ・オール・センタ・アウト交差検証戦略を採用した。
  • 2つの優れたCNNベースのモデル(2020年コンペティション優勝のSEベースのU-Net、自動設定が可能な最先端のU-Net変種であるnnU-Net)と結果を比較した。
  • 予測マスクの定性的な分析を実施し、正解との比較を行い、低コントラスト、小規模な腫瘍、CTアーチファクトに起因する失敗事例を同定した。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマー基盤のモデルは、頭頸部腫瘍セグメンテーションにおいて、最先端のCNNベースのモデルと同等の性能を達成できるか?
  • RQ2データ拡張は、この医療画像タスクにおけるトランスフォーマー基盤のモデル性能にどのように影響するか?
  • RQ3マルチモーダルなCT/PETスキャンにおける頭頸部腫瘍のセグメンテーションにおいて、トランスフォーマー基盤のモデルの主な失敗モードは何か?
  • RQ4UNETRの性能は、異なる臨床施設およびスキャン取得プロトコル間でどのように一般化されるか?
  • RQ5マルチモーダルなCTおよびPET入力は、腫瘍の正確な局在化能力にどの程度寄与しているか?

主な発見

  • ビジョントランスフォーマー基盤のUNETRモデルは、交差検証において平均Dice類似係数(DSC)0.736(±0.043)を達成した。これは2020年コンペティション優勝のSEベースのU-Netよりわずか0.021低い水準であり、同等の性能を示している。
  • 独立したHECKTORテストセットでは、DSC 0.736、精度 0.773、再現率 0.760を達成した。DSCにおいて2020年優勝モデルと0.023以内の差にとどまり、非常に近い性能を示した。
  • 3つのモデル(UNETR、SEベースのU-Net、nnU-Net)とも、ほとんどすべての症例で非常に類似したセグメンテーションマスクを生成しており、微細な差異が観察された。
  • 失敗事例の主な原因は、PETスキャンにおける低コントラスト、小規模な腫瘍、およびCTアーチファクト(例:歯科インプラントに起因するストリークアーチファクト)であった。
  • モデルはCT(解剖的構造のため)およびPET(強度差の区別に役立つ)の両方に強く依存しており、マルチモーダル入力の重要性が示された。
  • 自己教師あり事前学習が行われていない状況下でも、データ拡張は訓練の安定化と一般化の向上に不可欠であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。