Skip to main content
QUICK REVIEW

[論文レビュー] An Effective Transformer-based Solution for RSNA Intracranial Hemorrhage Detection Competition

Fangxin Shang, Siqi Wang|arXiv (Cornell University)|May 16, 2022
Intracerebral and Subarachnoid Hemorrhage Research被引用数 4
ひとこと要約

本論文は、RSNA 2019 コンペティションの優勝解法よりもパラメータ数の1/4、FLOPsの10%で性能を上回る、1つのエンドツーエンドのTransformerベースのモデルを提示している。スライス内特徴抽出にSwin-Transformerを、スライス間モデリングに2層の逐次Transformerを用い、FixMatchによる半教師あり学習を組み合わせることで、3モデルアンサンブルではプライベートテストのlog-lossが0.04345、単一モデルでは0.04368を達成。これは優勝解法の0.04383を上回った。

ABSTRACT

We present an effective method for Intracranial Hemorrhage Detection (IHD) which exceeds the performance of the winner solution in RSNA-IHD competition (2019). Meanwhile, our model only takes quarter parameters and ten percent FLOPs compared to the winner's solution. The IHD task needs to predict the hemorrhage category of each slice for the input brain CT. We review the top-5 solutions for the IHD competition held by the Radiological Society of North America(RSNA) in 2019. Nearly all the top solutions rely on 2D convolutional networks and sequential models (Bidirectional GRU or LSTM) to extract intra-slice and inter-slice features, respectively. All the top solutions enhance the performance by leveraging the model ensemble, and the model number varies from 7 to 31. In the past years, since much progress has been made in the computer vision regime especially Transformer-based models, we introduce the Transformer-based techniques to extract the features in both intra-slice and inter-slice views for IHD tasks. Additionally, a semi-supervised method is embedded into our workflow to further improve the performance. The code is available in the manuscript.

研究の動機と目的

  • RSNA 2019 コンペティションで最高の性能を示した解法を上回る、より効率的かつ正確な脳内出血検出用モデルの開発。
  • 従来の2D CNN や RNN ベースのモデルが直面する、スライス内およびスライス間特徴抽出の分離化による誤差蓄積とエンドツーエンド最適化の欠如という課題の解決。
  • 半教師あり学習を統合することで、大規模なモデルアンサンブルへの依存を低減し、計算コストを抑えたまま臨床応用が可能なモデル実装の実現。
  • 多ラベル分類タスクにおける医用画像系列モデリングに、最新のTransformerアーキテクチャが果たす有効性の調査。

提案手法

  • スライス内特徴は、各CTスライス内での高メモリ効率とローカル・グローバルなアテンションを可能にするSwin-Transformerを用いて抽出される。
  • スライス間の依存関係は、スライス内特徴の順序処理を行う2層の逐次Transformerによってモデル化される。
  • Swin-Transformerに残差接続とポスト正規化(PN)を適用し、訓練の安定化と勾配の流れの改善を図る。
  • 訓練時の収束加速を目的に、補助分類器を用いたディープスーパービジョンスキーム(DS)が採用される。
  • FixMatchによる半教師あり学習では、未ラベルデータに対して偽ラベルを生成し、強力なデータオーグメンテーションを適用することで一般化性能を向上させる。
  • アンサンブル戦略として、プライベートリーダーボード順位に基づく重み付けを施した3モデルの組み合わせが行われ、過剰な計算コストを抑えつつ性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1RSNA 2019 優勝解法で用いられた複数の2D CNN および RNN モデルのアンサンブルを上回る、1つのエンドツーエンドのTransformerベースのモデルが可能か?
  • RQ2従来のCNN-RNNパイプラインに代えてTransformerベースのアーキテクチャを採用することで、誤差蓄積が軽減され、性能が向上するか?
  • RQ3FixMatchによる半教師あり学習は、医用画像分類タスクにおいて、大規模なモデルアンサンブルの必要性を低減しつつ、モデルの精度を向上させるのに有効か?
  • RQ4ポスト正規化、動的重み付け、データオーグメンテーションといったアーキテクチャ的選択が、本タスクにおける性能向上にどの程度寄与しているか?
  • RQ5出血種別間の論理的関係(例:'any' が他のすべてのクラスの最大値である)を明示的にモデル化することは、必要であるか、有益であるか?

主な発見

  • 提案された単一モデルは、プライベートテストのlog-lossが0.04368を達成し、RSNA 2019 コンペティションの優勝解法(log-loss 0.04383)を上回った。
  • FixMatchの偽ラベルを用いた3モデルアンサンブルでは、プライベートテストのlog-lossが0.04345にまで低下し、優勝解法をさらに上回った。
  • モデルは1回の推論あたり86Mパラメータ、15G FLOPsで実行され、優勝解法(330Mパラメータ、180G FLOPs)の25%のパラメータ数、10%のFLOPsにまで削減された。
  • アブレーションスタディにより、RBE、DS、PN、DW、SW、FMの各コンポonentが段階的に性能向上に寄与しており、全コンポーネントを組み合わせた場合のlog-lossは0.09495から0.04368にまで低下した。
  • 外部データ(CQ500)の利用や、'any'クラスの論理的再パラメータ化は、顕著な性能向上をもたらさなかったことから、モデルはすでに高い最適化状態にあると示唆された。
  • エンドツーエンドの訓練により、スライス内およびスライス間モジュールを貫いて完全な勾配逆伝播が可能となり、分離されたパイプラインで見られる誤差蓄積を回避できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。