[論文レビュー] ConvFormer: Combining CNN and Transformer for Medical Image Segmentation
この論文では、畳み込みニューラルネットワーク(CNN)の局所的なインダクティブバイアスとトランスフォーマーのグローバルな長距離モデリングを統合することで、医療画像セグメンテーションのための階層的CNN-TransformerハイブリッドアーキテクチャであるConvFormerを提案する。変形可能トランスフォーマーに畳み込み型フィードフォワードモジュールを導入した拡張された変形可能トランスフォーマー、残留接続型のハイブリッドスタム、および追加のマルチスケールエンコーダーを導入することで、2Dおよび3Dの医療画像データセットにおいて、従来のCNNのみやトランスフォーマーのみのモデルを上回る最先端の性能を達成し、事前学習を用いないスクラッチからの効率的な学習を実現する。
Convolutional neural network (CNN) based methods have achieved great successes in medical image segmentation, but their capability to learn global representations is still limited due to using small effective receptive fields of convolution operations. Transformer based methods are capable of modelling long-range dependencies of information for capturing global representations, yet their ability to model local context is lacking. Integrating CNN and Transformer to learn both local and global representations while exploring multi-scale features is instrumental in further improving medical image segmentation. In this paper, we propose a hierarchical CNN and Transformer hybrid architecture, called ConvFormer, for medical image segmentation. ConvFormer is based on several simple yet effective designs. (1) A feed forward module of Deformable Transformer (DeTrans) is re-designed to introduce local information, called Enhanced DeTrans. (2) A residual-shaped hybrid stem based on a combination of convolutions and Enhanced DeTrans is developed to capture both local and global representations to enhance representation ability. (3) Our encoder utilizes the residual-shaped hybrid stem in a hierarchical manner to generate feature maps in different scales, and an additional Enhanced DeTrans encoder with residual connections is built to exploit multi-scale features with feature maps of different scales as input. Experiments on several datasets show that our ConvFormer, trained from scratch, outperforms various CNN- or Transformer-based architectures, achieving state-of-the-art performance.
研究の動機と目的
- 畳み込みニューラルネットワーク(CNN)が有効受容 field が小さいために長距離相関を捉えきれないという制限を解消すること。
- 純粋なトランスフォーマーモデルに局所的なインダクティブバイアスが欠如しているため、医療画像セグメンテーションの性能に悪影響を及えるという問題を克服すること。
- 階層的エンコーダー構造において、異なる段階からの特徴マップを統合することで、マルチスケール特徴表現を向上させること。
- 医療画像データに適応するための位置エンコーディングの柔軟性を高めること。
- 従来のCNNベースおよびトランスフォーマーに基づく手法を凌駕する、統合的でエンドツーエンドで学習可能なアーキテクチャを設計すること。
提案手法
- Deformable Transformer(DeTrans)のフィードフォワードモジュールを畳み込み層に再設計することで、局所的特徴抽出を強化し、拡張されたDeTransモジュールを構築する。
- 深さ方向分離畳み込みと拡張されたDeTransを組み合わせた残留接続型のハイブリッドスタムを開発し、複数スケールで局所的およびグローバルな表現を同時に捉える。
- ハイブリッドスタムを用いて階層的エンコーダーを構築し、マルチスケール特徴マップを生成。その後、残差接続を備えた追加の拡張されたDeTransエンコーダーに供給することで、スケール間の文脈情報を効果的に活用する。
- 固定された正弦波位置エンコーディングに畳み込み層を追加することで、特徴表現における適応性と柔軟性を向上させる、拡張された位置エンコーディング(EPE)を導入する。
- U-Netスタイルのデコーダーにスキップ接続を適用し、エンコーダーからの特徴を用いてセグメンテーションマスクを精緻化する。
- 事前学習を用いないで、公開および社内データセット上で、ネットワーク全体をスクラッチからエンドツーエンドで学習する。

実験結果
リサーチクエスチョン
- RQ1CNNとトランスフォーマーをハイブリッド化することで、局所的およびグローバルな特徴抽出のバランスを図ることで、医療画像セグメンテーションの性能が向上するか?
- RQ2DeTransに畳み込み型フィードフォワードモジュールを導入することで、医療画像における局所的文脈のモデリング能力が向上するか?
- RQ3標準の単一スケールエンコーダーと比較して、マルチスケール特徴入力を備えた階層的エンコーダーは、セグメンテーション性能にどの程度寄与するか?
- RQ4提案された拡張された位置エンコーディング(EPE)は、モデルの汎化性能と特徴表現の質を向上させるのにどの程度有効か?
- RQ5スクラッチから学習可能な統合的CNN-Transformerアーキテクチャは、多様な医療画像タスクにおいて最先端の性能を達成できるか?
主な発見
- 2017 ISIC皮膚腫瘍画像データセットでは、ConvFormerはDiceスコア0.955、IoU 0.914を達成し、UNETR や CoTr を含むすべての比較手法を上回った。
- 2017 MM-WHS CTデータセットでは、ConvFormerはDiceスコア0.980、IoU 0.957を達成し、3D腹部臓器セグメンテーションにおいて優れた性能を示した。
- 社内リンパ節データセットでは、ConvFormerはDiceスコア0.844、IoU 0.740を達成し、2番目に良い手法よりもDiceスコアで0.031の向上を示した。
- アブレーションスタディの結果、拡張されたDeTransモジュールを削除するとF1スコアが0.4%低下し、追加のマルチスケールエンコーダーを削除すると0.5%低下した。これにより、両者の貢献が裏付けられた。
- ハイブリッドスタムを削除(つまり、CNNのみを使用)した場合、F1スコアは9.6%低下した。これは、局所的・グローバルな特徴の統合学習が極めて重要であることを示している。
- 拡張された位置エンコーディング(EPE)を用いることで、固定された正弦波エンコーディングに比べてF1スコアが0.4%向上した。これにより、特徴表現における有効性が確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。