Skip to main content
QUICK REVIEW

[論文レビュー] The Fully Convolutional Transformer for Medical Image Segmentation

Athanasios Tragakis, Chaitanya Kaul|arXiv (Cornell University)|Jun 1, 2022
Radiomics and Machine Learning in Medical Imaging被引用数 7
ひとこと要約

本稿では、医療画像セグメンテーションのための新規でコンactな完全畳み込み型トランスフォーマーであるFully Convolutional Transformer (FCT)を提案する。FCTは畳み込み注意機構と、長距離依存関係および階層的特徴を捉えるためのマルチリソリューション拡張畳み込み型Wide-Focusモジュールを組み合わせた。FCTは、nnUNet や TransUNet などの競合モデルと比較して最大5倍少ないパラメータで、複数のデータセットで最先端の性能を達成しており、Diceスコアで最大4.4%の向上を示した。

ABSTRACT

We propose a novel transformer model, capable of segmenting medical images of varying modalities. Challenges posed by the fine grained nature of medical image analysis mean that the adaptation of the transformer for their analysis is still at nascent stages. The overwhelming success of the UNet lay in its ability to appreciate the fine-grained nature of the segmentation task, an ability which existing transformer based models do not currently posses. To address this shortcoming, we propose The Fully Convolutional Transformer (FCT), which builds on the proven ability of Convolutional Neural Networks to learn effective image representations, and combines them with the ability of Transformers to effectively capture long-term dependencies in its inputs. The FCT is the first fully convolutional Transformer model in medical imaging literature. It processes its input in two stages, where first, it learns to extract long range semantic dependencies from the input image, and then learns to capture hierarchical global attributes from the features. FCT is compact, accurate and robust. Our results show that it outperforms all existing transformer architectures by large margins across multiple medical image segmentation datasets of varying data modalities without the need for any pre-training. FCT outperforms its immediate competitor on the ACDC dataset by 1.3%, on the Synapse dataset by 4.4%, on the Spleen dataset by 1.2% and on ISIC 2017 dataset by 1.1% on the dice metric, with up to five times fewer parameters. Our code, environments and models will be available via GitHub.

研究の動機と目的

  • 従来のトランスフォーマーに基づくモデルがUNetの細粒度特徴学習能力に欠けるという限界を是正すること。
  • 医療画像における長距離の意味的依存関係および階層的なグローバルコンテキストを効果的に捉える完全畳み込み型トランスフォーマーを構築すること。
  • 事前学習を必要とせず、軽量で正確かつ頑健なモデルを構築し、最先端の性能を上回ること。
  • 位置エンコーディングやパッチトークン化を不要にするように、畳み込み演算と自己注意メカニズムを統合すること。

提案手法

  • FCTは、2つの主要なコンponentから成る新規な完全畳み込み型トランスフォーマーレイヤーを採用している:畳み込み注意モジュールとWide-Focusモジュール。
  • 畳み込み注意モジュールは、深さ分離畳み込みを用いて重複する空間的認識パッチを生成し、標準的なパッチ埋め込みを置き換え、位置エンコーディングの必要性を排除する。
  • Wide-Focusモジュールは、3本のブランチで異なる拡張率を有するマルチリソリューションの拡張畳み込みを適用し、局所的からグローバルな特徴の階層的捕捉を実現する。
  • モデルは2段階で処理を行う:まず畳み込み注意モジュールで長距離の意味的依存関係を学習し、次にWide-Focusモジュールで階層的なグローバル表現を構築する。
  • エンコーダからデコーダへのスキップ接続をUNetの設計に従い採用し、空間的詳細の保持と特徴の伝搬改善を図る。
  • 標準的なデータオーグメンテーションを用いてエンドツーエンドで学習し、重複予測を平均化するための後処理を施したスライディングウィンドウ推論を推論に用いる。

実験結果

リサーチクエスチョン

  • RQ1事前学習を必要としない完全畳み込み型トランスフォーマーは、従来のCNNおよびトランスフォーマー基盤モデルを上回る性能を示せるか?
  • RQ2畳み込み注意とマルチリソリューション拡張畳み込みの統合が、長距離および細粒度特徴の捉え方に対して性能に与える影響は何か?
  • RQ3医療画像セグメンテーションにおいて、Wide-Focusモジュールの最適な構成(ブランチ数および拡張率)は何か?
  • RQ4本稿で提案するFCTアーキテクチャにおいて、スキップ接続は性能向上にどの程度寄与しているか?
  • RQ5コンパクトなトランスフォーマー基盤モデルは、従来のモデルと比較して顕著に少ないパラメータで最先端の結果を達成できるか?

主な発見

  • ACDCデータセットでは、事前学習を一切行わず、Diceスコアで1.3%の向上を示し、すべての既存のトランスフォーマーおよびCNNベースのモデルを上回った。
  • Synapseデータセットでは、直近の競合モデルと比較してDiceスコアで4.4%の向上を達成し、nnUNetと比較して5倍少ないパラメータを用いた。
  • Spleenデータセットでは、次に優れたモデルと比較してDiceスコアで1.2%向上を示し、異なる解剖的構造に対して高い頑健性を示した。
  • ISIC 2017データセットでは、最も近い競合モデルと比較してDiceスコアが1.1%高く、多様な画像モodalitiesへの一般化能力を確認した。
  • ACDC Post-2017-MICCAI-Challengeのオンラインテストセットでは、FCTは3170万パラメータで、大規模アンサンブルモデルやnnUNetを上回る最先端の性能を達成し、新たな記録を樹立した。
  • アブレーションスタディの結果、スキップ接続およびWide-Focusモジュールの最適構成(3本のブランチと線形に増加する拡張率)がピーク性能を発揮するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。