Skip to main content
QUICK REVIEW

[論文レビュー] TranSiam: Fusing Multimodal Visual Features Using Transformer for Medical Image Segmentation

Xuejian Li, Shiqiang Ma|arXiv (Cornell University)|Apr 26, 2022
Advanced Neural Network Applications被引用数 15
ひとこと要約

TranSiamは、クロスアテンションと自己アテンションを組み合わせた新しいTMMブロックを用いて特徴を統合する2次元二重パス変換器-畳み込みニューラルネットワークを提案する。この手法は、BraTS 2019および2020で最先端の性能を達成し、Diceスコア89.26%、HD95が4.77を記録。畳み込みニューラルネットワークと純粋な変換器を上回る性能を発揮しながら、パrameter数はわずか7.98Mにとどまる。

ABSTRACT

Automatic segmentation of medical images based on multi-modality is an important topic for disease diagnosis. Although the convolutional neural network (CNN) has been proven to have excellent performance in image segmentation tasks, it is difficult to obtain global information. The lack of global information will seriously affect the accuracy of the segmentation results of the lesion area. In addition, there are visual representation differences between multimodal data of the same patient. These differences will affect the results of the automatic segmentation methods. To solve these problems, we propose a segmentation method suitable for multimodal medical images that can capture global information, named TranSiam. TranSiam is a 2D dual path network that extracts features of different modalities. In each path, we utilize convolution to extract detailed information in low level stage, and design a ICMT block to extract global information in high level stage. ICMT block embeds convolution in the transformer, which can extract global information while retaining spatial and detailed information. Furthermore, we design a novel fusion mechanism based on cross attention and selfattention, called TMM block, which can effectively fuse features between different modalities. On the BraTS 2019 and BraTS 2020 multimodal datasets, we have a significant improvement in accuracy over other popular methods.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)がグローバルな文脈を捉える能力に欠けること、および変換器が低データ医療画像処理において細部を失うという点を是正する。
  • 異なる画像モodal間の視覚的特徴を効果的に統合することで、マルチモーダル医療画像セグメンテーションを向上させること。
  • 畳み込みと自己アテンションメカニズムの長所を組み合わせた、軽量でパラメータ効率の良いアーキテクチャを設計すること。
  • モダリティ固有の特徴差を低減し、統合段階でのモダリティ間特徴の整合性を高めること。

提案手法

  • TranSiamは、モダリティ固有の特徴を抽出する二重パスエンコーダーを採用。低レベル特徴には標準畳み込み、高レベルグローバル表現にはICMTブロックを用いる。
  • ICMTブロックは、深さ方向畳み込みを自己アテンション機構に統合し、空間的・詳細情報の保持と同時にグローバル文脈モデリングを可能にする。
  • 新規のTMM(変換器ベースマルチモーダル)統合ブロックは、クロスアテンションと自己アテンションを用い、高レベル層でのモダリティ間相関をモデル化し、特徴を統合する。
  • U-Netに類似したデコーダーを採用し、スキップ接続を介して統合された高レベル特徴を統合し、高精度なセグメンテーションを実現する。
  • 変換器における標準的な線形プロジェクションとMLPを、深さ方向畳み込みと3×3リーマンスブロックに置き換えることで、パラメータ効率と詳細情報の保持を向上させる。
  • 公平な比較のため、BraTS 2019および2020データセット上でアンサンブルや後処理を用いずに訓練を実施する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドCNN-変換器アーキテクチャは、リソースが限られた医療画像セグメンテーションにおいて、局所的詳細とグローバル文脈の両方を効果的に捉えることができるか?
  • RQ2異なる画像シーケンスから得られるマルチモーダル視覚的特徴を、モダリティ固有の情報を保持したまま効果的に統合できるか?
  • RQ3畳み込みのインダクティブバイアスを備えた軽量な変換器バージョンは、標準の変換器やCNNを上回る性能を示せるか?
  • RQ4高レベル層でのみ特徴を統合することで、モダリティ固有の干渉を低減し、セグメンテーション精度を向上させられるか?

主な発見

  • TranSiamは、BraTS 2019の検証セットで89.26%のDiceスミリアリティスコアを達成し、3D U-Net、V-Net、TransBTSを含むすべての3D古典的手法を上回った。
  • HD95は4.77であり、比較されたすべての手法よりも低く、境界精度が優れていることを示している。
  • BraTS 2020では、比較されたすべての手法の中で最高のDiceスコアと感度スコアを記録し、病変領域の検出能力が優れていることを示した。
  • アブレーションスタディの結果、ICMTおよびTMMブロックによる畳み込みと変換器の統合が最良の性能を発揮し、線形プロジェクションやMLPのみを用いたモデルを上回った。
  • TranSiamはわずか7.98Mのパラメータで運用され、TransBTS(32.99M)よりも顕著に少ない。これは、高い性能を維持しながらも、効率性が優れていることを裏付けている。
  • 可視化分析により、他のモデルが見逃す小さな、コントラストが低い腫瘍をTranSiamが効果的にセグメンテーションしていることが確認され、細部の保持能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。