Skip to main content
QUICK REVIEW

[論文レビュー] Scopeformer: n-CNN-ViT Hybrid Model for Intracranial Hemorrhage Classification

Yassine Barhoumi, Ghulam Rasool|arXiv (Cornell University)|Jul 7, 2021
Intracerebral and Subarachnoid Hemorrhage Research参考文献 3被引用数 16
ひとこと要約

本稿では、スコープフォーマー(Scopeformer)と呼ばれる新しいn-CNN-ViTハイブリッドモデルを提案する。このモデルは、ImageNetおよびGAN生成画像による脳CTスキャンを用いて事前学習された複数のXception CNNから得られる特徴マップを統合し、それをVision Transformer(ViT)に供給することで、頭内出血分類の性能を向上させる。この手法は、98.04%のテスト精度と0.0708の重み付き対数損失を達成し、標準的なViTと比較して特徴の豊かさと注目メカニズムの効率性が向上していることが示された。

ABSTRACT

We propose a feature generator backbone composed of an ensemble of convolutional neuralnetworks (CNNs) to improve the recently emerging Vision Transformer (ViT) models. We tackled the RSNA intracranial hemorrhage classification problem, i.e., identifying various hemorrhage types from computed tomography (CT) slices. We show that by gradually stacking several feature maps extracted using multiple Xception CNNs, we can develop a feature-rich input for the ViT model. Our approach allowed the ViT model to pay attention to relevant features at multiple levels. Moreover, pretraining the n CNNs using various paradigms leads to a diverse feature set and further improves the performance of the proposed n-CNN-ViT. We achieved a test accuracy of 98.04% with a weighted logarithmic loss value of 0.0708. The proposed architecture is modular and scalable in both the number of CNNs used for feature extraction and the size of the ViT.

研究の動機と目的

  • 頭内出血分類におけるVision Transformerの性能を向上させるために、入力特徴表現を豊かにすること。
  • 自然画像(ImageNet)と医療CTスキャンの間のドメインギャップを、GAN増強事前学習によって是正すること。
  • 複数の多様なCNNバックボーンがViTの注目メカニズムと分類精度に与える影響を調査すること。
  • 医療画像解析のための特徴解像度と多様性を向上させる、モジュラーでスケーラブルなアーキテクチャの開発。
  • 低ショット医療画像分類タスクにおいて、CNNから抽出した特徴が、ViTに直接入力する生画像よりも優れていることを実証すること。

提案手法

  • モデルは、異なるデータパラダイム(ImageNetおよびGAN生成画像)で事前学習された複数のXception CNNを特徴抽出器として使用する。
  • 各CNNの特徴マップ(7×7×1024)を連結して、高次元入力(7×7×n×1024)を生成し、ViTエンコーダーに供給する。
  • 計算負荷を軽減しつつ性能を維持するため、1×1畳み込みを用いて特徴マップのチャネル数を1024から128に削減する小型バージョンも採用する。
  • ViTエンコーダーは、パッチ間の多頭部自己注意機構を用いて、連結された特徴マップを処理し、グローバルなコンテキストを捉える。
  • 事前学習戦略として、RSNAデータセットで微調整されたImageNet事前学習モデルに加え、GANで生成された脳CT画像を用いたさらなる事前学習を実施し、帰納的バイアスを向上させる。
  • アーキテクチャはモジュラーであり、CNNの数やViTのサイズを柔軟にスケーリング可能である。

実験結果

リサーチクエスチョン

  • RQ1複数の多様なCNNバックボーンを用いることで、医療画像分類のためのVision Transformerへの入力特徴の質が向上するか?
  • RQ2GAN増強医療画像で事前学習することで、自然画像事前学習と頭内CTスキャンの間のドメインシフトが軽減されるか?
  • RQ3特徴抽出バックボーンに含まれるCNNの数が、出血分類におけるViT性能に与える影響は何か?
  • RQ41×1畳み込みによる次元削減入力(7×7×256)は、計算コストを削減しつつも高い精度を維持できるか?
  • RQ5生CT画像に直接適用された標準的なViTと比較して、n-CNN-ViTハイブリッドアーキテクチャは性能が優れているか?

主な発見

  • 多様な事前学習(ImageNet/GAN)を用いた3-CNN-ViTモデルが、98.04%の最高テスト精度と0.07050の重み付き対数損失を達成した。
  • 異なる事前学習パラダイムを持つ複数のCNNを用いることで、単一または同一のバックボーンと比較して顕著な性能向上が得られた。
  • GAN増強事前学習を施した2-CNN-ViTモデルは、次元削減された入力(7×7×256)を用いても97.58%の精度を達成し、スケーラビリティと効率性を示した。
  • 生画像に直接適用された標準ViTモデルは94.33%の精度にとどまり、CNNベースの特徴強化の有効性が確認された。
  • CNNの数が増えるにつれて性能が単調に向上したため、特徴の多様性がViTの注目メカニズムと分類精度を向上させることを示した。
  • モジュラー設計により、CNNの数とViTサイズの両方を柔軟にスケーリング可能であり、ハードウェア制約に応じた効率的展開が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。