Skip to main content
QUICK REVIEW

[論文レビュー] Transformers in Medical Imaging: A Survey

Fahad Shamshad, Salman Khan|arXiv (Cornell University)|Jan 24, 2022
Advanced Neural Network Applications被引用数 15
ひとこと要約

本サーベイは、画像分類、検出、再構成、臨床レポート生成を含む、医療画像におけるビジョントランスフォーマー(ViT)の応用について包括的なレビューを提供する。アーキテクチャ設計を分析し、応用固有の課題を特定し、トレンドを強調することで、CNNの局所的インダクティブバイアスではなくグローバルコンテキストモデリングに注目する、急激に進化する分野を歩む研究者へのロードマップを提示する。

ABSTRACT

Following unprecedented success on the natural language tasks, Transformers have been successfully applied to several computer vision problems, achieving state-of-the-art results and prompting researchers to reconsider the supremacy of convolutional neural networks (CNNs) as {de facto} operators. Capitalizing on these advances in computer vision, the medical imaging field has also witnessed growing interest for Transformers that can capture global context compared to CNNs with local receptive fields. Inspired from this transition, in this survey, we attempt to provide a comprehensive review of the applications of Transformers in medical imaging covering various aspects, ranging from recently proposed architectural designs to unsolved issues. Specifically, we survey the use of Transformers in medical image segmentation, detection, classification, reconstruction, synthesis, registration, clinical report generation, and other tasks. In particular, for each of these applications, we develop taxonomy, identify application-specific challenges as well as provide insights to solve them, and highlight recent trends. Further, we provide a critical discussion of the field's current state as a whole, including the identification of key challenges, open problems, and outlining promising future directions. We hope this survey will ignite further interest in the community and provide researchers with an up-to-date reference regarding applications of Transformer models in medical imaging. Finally, to cope with the rapid development in this field, we intend to regularly update the relevant latest papers and their open-source implementations at \url{https://github.com/fahadshamshad/awesome-transformers-in-medical-imaging}.

研究の動機と目的

  • 多様な医療画像処理タスクにおけるビジョントランスフォーマー(ViT)の応用を包括的かつ最新の視点からレビューすること。
  • ViTベースの手法における最近の進展を統合することで、コンピュータビジョンと医療画像分野のギャップを埋めること。
  • 画像分類、セグメンテーション、レポート生成などの医療画像処理タスクにおける応用固有の課題を特定すること。
  • 医療画像におけるViTの採用における主なトレンド、アーキテクチャ的イノベーション、未解決問題を強調すること。
  • 臨床的・診断的画像処理におけるトランスフォーマーに基づくソリューションを探索する研究者にとってのロードマップおよびリファレンスとしての役割を果たすこと。

提案手法

  • 応用分野(セグメンテーション、分類、検出、再構成、合成、登録、臨床レポート生成、その他の分野)に基づいて、125篇以上の関連論文を体系的に分類する。
  • 各応用分野のための分類法を構築し、ViTベースのモデルにおけるアーキテクチャ設計および手法的イノベーションを分析する。
  • 医療画像における長距離依存関係およびグローバルコンテキストを捉える能力を評価することで、ViTと従来のCNNを比較する。
  • 埋め込み空間のマハラノビス距離および主成分分析(PCA)投影を用いて、分布外(OOD)検出の性能を分析する。
  • MRI、CT、レントゲン、超音波、顕微鏡画像などのモダリティおよびタスクごとに、ベンチマーク研究からの実証的結果を用いてViTの性能を評価する。
  • ドメインシフト、不確実性推定、医療ViTシステムにおける標準化された評価プロトコルの欠如といった、未解決の課題を強調する。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーは、医療画像における長距離依存関係を捉える点で、畳み込みニューラルネットワーク(CNN)をどのように上回るのか?
  • RQ2特定の医療画像処理タスクに特化したViTベースのモデルにおける、主なアーキテクチャ的および手法的イノベーションは何か?
  • RQ3臨床応用に向けたViTの導入において、特に耐性および不確実性推定の観点から、主な課題は何か?
  • RQ4OOD検出において、ViTはCNNと比較してどのように性能を発揮するのか?また、人間の予測と整合性が高まっているという証拠は何か?
  • RQ5特に生命を脅かす診断システムにおいて、ViTの採用を前進させるために、今後の研究で最も有望な方向性は何か?

主な発見

  • ビジョントランスフォーマーは、すべての主要な医療画像処理タスクに急速に浸透しており、2021年のセグメンテーション論文の85%および分類論文の89%がViTベースである一方、2012–2015年のCNNの割合は73%および85%であった。
  • ImageNet-21kで事前学習し、分布内データで微調整したViTは、埋め込みのクラスタリングが優れており、OOD入力のマハラノビス距離スコアも高いことが示され、不確実性推定が優れているとされる。
  • ViTはCNNよりも人間のアノテーションと一貫性のある予測誤差を示しており、臨床意思決定とより良好に一致している可能性がある。
  • 強力な性能を発揮しているものの、特に限定的またはドメインシフトしたデータで学習した場合、複雑な医療画像のテクスチャやスケール変動におけるOOD検出では課題に直面している。
  • 現在のViTベースの医療システムでは、ドメイン適応のための標準化された評価プロトコルが欠如しており、医療画像分野におけるDOMAINBEDのようなフレームワークの導入が求められている。
  • 継続的学習およびドメイン適応技術は、ViTベースの医療画像処理においてまだ十分に検討されておらず、耐障害性の高い展開を実現するための有望な今後の方向性である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。