Skip to main content
QUICK REVIEW

[論文レビュー] Mutual Attention-based Hybrid Dimensional Network for Multimodal Imaging Computer-aided Diagnosis

Yin Dai, Yifan Gao|arXiv (Cornell University)|Jan 24, 2022
Radiomics and Machine Learning in Medical Imaging被引用数 5
ひとこと要約

本稿では、2次元および3次元畳み込みモジュールを組み合わせることで、マルチモodal 3次元医療画像分類の性能を向上させる、相互注意に基づくハイブリッド次元ネットワークMMNetを提案する。事前学習済みImageNetモデルを活用し、深さ方向の文脈的モデリングにためのステレオスコピックアテンション、およびクロスモーダル整合性を向上させるための相互アテンション機構を用いることで、PROSTATExデータセットで90.0%の精度を達成し、最先端の性能を実現した。

ABSTRACT

Recent works on Multimodal 3D Computer-aided diagnosis have demonstrated that obtaining a competitive automatic diagnosis model when a 3D convolution neural network (CNN) brings more parameters and medical images are scarce remains nontrivial and challenging. Considering both consistencies of regions of interest in multimodal images and diagnostic accuracy, we propose a novel mutual attention-based hybrid dimensional network for MultiModal 3D medical image classification (MMNet). The hybrid dimensional network integrates 2D CNN with 3D convolution modules to generate deeper and more informative feature maps, and reduce the training complexity of 3D fusion. Besides, the pre-trained model of ImageNet can be used in 2D CNN, which improves the performance of the model. The stereoscopic attention is focused on building rich contextual interdependencies of the region in 3D medical images. To improve the regional correlation of pathological tissues in multimodal medical images, we further design a mutual attention framework in the network to build the region-wise consistency in similar stereoscopic regions of different image modalities, providing an implicit manner to instruct the network to focus on pathological tissues. MMNet outperforms many previous solutions and achieves results competitive to the state-of-the-art on three multimodal imaging datasets, i.e., Parotid Gland Tumor (PGT) dataset, the MRNet dataset, and the PROSTATEx dataset, and its advantages are validated by extensive experiments.

研究の動機と目的

  • 限られたラベル付きデータと高いパラメータ数のため、医療画像における深層3次元畳み込みニューラルネットワーク(3D CNN)の学習に直面する課題に対処すること。
  • 2次元および3次元畳み込みを組み合わせることで、マルチモーダル3次元医療画像分類における特徴抽出と診断精度を向上させること。
  • 相互アテンション機構を用いて、異なるモダリティを処理する二重スレッドネットワーク間の特徴再キャリブレーションを実現し、病変領域の表現の一貫性を高めること。
  • ハイブリッド次元構造と事前学習済み特徴の転移を活用することで、学習の複雑さとモデルパラメータ数を削減しながら、性能を維持または向上させること。

提案手法

  • モデルは、2次元および3次元畳み込み層を統合したハイブリッド次元ブロック(HDB)を用い、パrameter数の削減とImageNet事前学習モデルからの転移学習を可能にする。
  • ステレオスコピックアテンションモジュール(SAM)は、同じ解剖的領域内の異なる深さスライス間の文脈的依存関係を捉え、病変変化の局在化を向上させる。
  • 相互アテンションフレームワーク(MAF)は、異なる画像モダリティを処理する二重スレッドネットワーク間の特徴再キャリブレーションを可能にし、病変領域表現の一貫性を促進する。
  • MAFは、学習可能なパrameter α を用いてアテンション重みを動的にバランスさせ、クロスモーダル特徴交換を最適化し、補完的情報の活用を強化する。
  • ネットワークは交差エントロピー損失を用いてエンドツーエンドで学習され、受信器操作特性曲線(ROC-AUC)、正確性、感度、特異度といった標準指標を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ12次元および3次元畳み込みを統合したハイブリッド次元アーキテクチャは、3次元医療画像分類においてモデルの複雑さを低減しつつ高い性能を維持できるか?
  • RQ2ステレオスコピックアテンションモジュールは、3次元医療画像における深さ方向の文脈的依存関係をどれほど効果的に捉えることができるか?
  • RQ3相互アテンション機構は、マルチモーダル3次元医療画像解析におけるクロスモーダル整合性と診断精度をどの程度向上できるか?
  • RQ4マルチモーダル診断における性能を最大化するための最適なクロスモーダルアテンション重み(α)は何か?

主な発見

  • MMNetはPROSTATExデータセットで平均90.0% ± 3.2%の正確性を達成し、MISN や P3D といった最先端手法を上回った。
  • アブレーションスタディの結果、ステレオスコピックアテンションモジュール(SAM)を追加すると正確性が83.6%から86.4%に上昇し、さらに相互アテンションフレームワーク(MAF)を追加することで90.0%に上昇した。
  • 最適な自己アテンション重み α = 0.6 が、90.02%の最高正確性を達成した。これは、中程度のクロスモーダル特徴交換が性能を最大化することを示している。
  • クラスアクティビティマッピングの可視化により、MMNetは3D-ResNet や R2D、P3D と比較して、病変領域をよりよく強調していることが確認された。これらは3次元情報の損失を抱える傾向にあった。
  • 2次元ブランチにImageNetの事前学習済み重みを適用したモデルは顕著に性能向上を示し、低データ環境における転移学習の有効性を裏付けた。
  • MRNetおよびPGTデータセットでも、MMNetは競争力のある結果を示した。特に、より大きなPROSTATExモデルでは、ROC-AUCが0.94、正確性が0.81を達成し、既存の3D-CNNおよび事前学習ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。