Skip to main content
QUICK REVIEW

[論文レビュー] CMU-Net: A Strong ConvMixer-based Medical Ultrasound Image Segmentation Network

Fenghe Tang, Lingtao Wang|arXiv (Cornell University)|Oct 24, 2022
Medical Imaging and Analysis参考文献 15被引用数 15
ひとこと要約

CMU-Net は、グローバルなコンテキストを捉えるために ConvMixer モジュールを統合し、強化されたスキップ接続のためにマルチスケールアテンションゲートを備えた、医療超音波画像セグメンテーションのための新しい完全畳み込みネットワークである。BUSI データセットでは 73.27% の平均 IoU と 84.16% の F1 スコアを達成し、TUS データセットでは 84.75% の IoU と 91.71% の F1 スコアを記録し、小規模なデータセットにおいて U-Net やトランスフォーマー基盤のモデルを上回る最先端の性能を発揮した。

ABSTRACT

U-Net and its extensions have achieved great success in medical image segmentation. However, due to the inherent local characteristics of ordinary convolution operations, U-Net encoder cannot effectively extract global context information. In addition, simple skip connections cannot capture salient features. In this work, we propose a fully convolutional segmentation network (CMU-Net) which incorporates hybrid convolutions and multi-scale attention gate. The ConvMixer module extracts global context information by mixing features at distant spatial locations. Moreover, the multi-scale attention gate emphasizes valuable features and achieves efficient skip connections. We evaluate the proposed method using both breast ultrasound datasets and a thyroid ultrasound image dataset; and CMU-Net achieves average Intersection over Union (IoU) values of 73.27% and 84.75%, and F1 scores of 84.81% and 91.71%. The code is available at https://github.com/FengheTan9/CMU-Net.

研究の動機と目的

  • U-Net の局所的受容 field が超音波画像におけるグローバルコンテキストを捉えるのを制限する問題に対処する。
  • 単純な連結を学習可能なアテンションメカニズムに置き換えることで、スキップ接続における特徴量伝達を改善する。
  • 過度な計算コストを伴わずに、小規模な医療画像データセットにおいても優れた性能を発揮する、効率的な完全畳み込みアーキテクチャを開発する。
  • ConvMixer およびマルチスケールアテンションゲートの有効性が、乳がんおよび甲状腺超音波画像のセグメンテーション精度を向上させることを検証する。

提案手法

  • エンコーダーは、標準的な 3×3 畳み込みに続き、長距離の空間的依存関係を集約するための大きなカーネルサイズの深度分離畳み込みとポイントワイド畳み込みを備えた ConvMixer ブロックを用いる。
  • ConvMixer ブロックは、カーネルサイズ 7×7 の深度分離畳み込みと 1×1 ポoinwise 畳み込みを適用し、その後に GELU 活性化関数とバッチ正則化を適用する。
  • マルチスケールアテンションゲートは、複数のスケールで学習可能なアテンション重みを用いて、スキップ接続内の不要な特徴量を抑制し、顕著な特徴量を強調する。
  • デコーダーはバイリニア補間とゲーテッド特徴量との連結を用い、セグメンテーションマスクを精緻化する。
  • クラスの不均衡を補正するため、二値交差エントロピー損失と Dice 損失を組み合わせたハイブリッド損失関数を用いてネットワークを訓練する。
  • 実験では、ランダムな回転と反転を含むデータ拡張を実施し、入力サイズを 256×256 にリサイズし、300 エポックにわたりバッチサイズ 8 で学習した。

実験結果

リサーチクエスチョン

  • RQ1ConvMixer を用いたエンコーダーは、局所的畳み込みが失敗する超音波画像において、グローバルコンテキストを効果的に捉えることができるか?
  • RQ2提案されたマルチスケールアテンションゲートは、標準的な連結処理と比較して、スキップ接続における特徴量伝達を向上させるか?
  • RQ3CMU-Net は、U-Net や TransUnet などのトランスフォーマー基盤のモデルと比較して、小規模な医療超音波データセットにおいてどのように性能を発揮するか?
  • RQ4このセグメンテーションタスクにおいて、ConvMixer ブロックの最適な深さとカーネルサイズは何か?
  • RQ5アブレーションの各構成要素(ConvMixer およびアテンションゲート)が最終的な性能向上にどの程度寄与しているか?

主な発見

  • BUSI 乳がん超音波画像データセットにおいて、CMU-Net は平均交差率(IoU)73.27% および F1 スコア 84.16% を達成し、U-Net よりも IoU で 2.89 パcentage points、F1 スコアで 2.00 パcentage points 以上優れた性能を示した。
  • TUS 甲状腺超音波画像データセットでは、CMU-Net は IoU 84.75% および F1 スコア 91.71% を達成し、TransUnet を含むすべての比較モデルを上回る優れた性能を示した。
  • アブレーションスタディの結果、ConvMixer ブロックの追加により、IoU は元の U-Net の 68.49% から 72.36% に向上し、さらにマルチスケールアテンションゲートを追加することで 73.27% に上昇した。
  • マルチスケールアテンションゲートは、顕著な特徴量を強調することで、メトリクス全体にわたり一貫した性能向上を実現し、知識伝達の向上を顕著に示した。
  • CMU-Net は複数のランダムな分割においても高い精度(97.33%)と頑健性を維持しており、小規模データセットにおける強い汎化能力を示した。
  • CMU-Net は小規模データセットにおいて TransUnet を上回ったことから、ConvMixer を用いたアプローチが、CNN-Transformer ハイブリッドアーキテクチャに比べてよりデータに効率的であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。