Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Vision Transformer with Residual in Self-attention for Biomedical Image Classification

Arun Sharma, Nishchal K. Verma|arXiv (Cornell University)|Jun 2, 2023
Brain Tumor Detection and Classification被引用数 4
ひとこと要約

本論文は、マルチヘッド自己注意機構に残差接続を組み込んだ新規なビジョントランスフォーマー(ViT)アーキテクチャを提案する。最も重要な注意ヘッドは、注意スコアのL1ノルムに基づいて選択され、最終出力に残差として追加される。この手法は、生体医療画像分類における特徴表現を向上させ、血液球画像で93.38%の正確さ、脳MRI腫瘍検出で96.15%の正確さを達成し、標準的なViTや畳み込みニューラルネットワーク(CNN)の最先端モデルを上回る性能を示した。

ABSTRACT

Biomedical image classification requires capturing of bio-informatics based on specific feature distribution. In most of such applications, there are mainly challenges due to limited availability of samples for diseased cases and imbalanced nature of dataset. This article presents the novel framework of multi-head self-attention for vision transformer (ViT) which makes capable of capturing the specific image features for classification and analysis. The proposed method uses the concept of residual connection for accumulating the best attention output in each block of multi-head attention. The proposed framework has been evaluated on two small datasets: (i) blood cell classification dataset and (ii) brain tumor detection using brain MRI images. The results show the significant improvement over traditional ViT and other convolution based state-of-the-art classification models.

研究の動機と目的

  • 深層学習における限られたおよび不均衡な生体医療画像データセットの課題に対処すること。
  • 生体医療画像分類のためのビジョントランスフォーマーにおける特徴表現と一般化性能の向上。
  • 注意スコアのL1ノルムに基づいて最も情報量の多い注意ヘッドを選択する、マルチヘッド自己注意機構における残差メカニズムの導入。
  • 限られた生体医療画像データセットにおけるモデルのロバストネス向上と過学習の低減。
  • 2つの生体医療画像分類ベンチマークにおいて、標準的なViTおよび最先端のCNNベースモデルを上回る優れた性能を示すこと。

提案手法

  • 提案手法は、各マルチヘッド注意ヘッドの注意スコアのL1ノルム(マンハッタンノルム)を計算する。
  • L1ノルムが最大のヘッドが「最良の」ヘッドとして選択され、最も情報量の多い注意パターンを表す。
  • この最良ヘッドの出力を、線形変換層後の最終的な注意出力に残差接続として追加する。
  • この残差接続により、最も特徴的な注意特徴が最終表現に統合され、特徴学習が強化される。
  • 変更された注意ブロックは事前学習済みのViT-baseモデルに統合され、その後、生体医療画像データセットで微調整が行われる。
  • 計算効率を維持するため、低コストのソーティングおよびノルム計算により、標準的なViTとほぼ同等の計算複雑度を維持する。

実験結果

リサーチクエスチョン

  • RQ1注意スコアのL1ノルムに基づいて最も情報量の多い注意ヘッドを選択することで、限られた生体医療画像データセットにおけるViTの性能向上が図れるか?
  • RQ2最良の注意ヘッドを残差接続として統合することで、特徴表現および分類正確さが向上するか?
  • RQ3提案されたViTの変種は、不均衡な生体医療画像データにおける正確さと一般化性能の観点から、標準的なViTおよび最先端のCNNモデルと比較してどのように差をつけるか?
  • RQ4残差メカニズムにより、限られた学習データにおける過学習が低減され、一般化性能が向上するか?
  • RQ5提案された注意メカニズムは、血液球分類や脳腫瘍検出を含む多様な生体医療画像タスクに効果的に適用可能か?

主な発見

  • 提案されたViTは、血液球分類データセットで93.38%の正確さを達成し、次に優れたモデル(ViT:88.38%)を顕著に上回った。
  • 脳MRI腫瘍検出データセットでは、提案手法が96.15%の正確さを達成し、標準的なViT(92.15%)およびResNet18(92.16%)を上回った。
  • 血液球データセットにおけるF1スコアは0.94に達し、標準的なViTの0.89と比較して、精度と再現率のバランスが優れていた。
  • 訓練と検証の正確さ曲線の乖離が小さくなり、一般化性能の向上と過学習の低減が示された。
  • 混同行列の結果から、提案モデルは両方のデータセットにおいて、事前学習済みのViTベースラインよりも誤分類が少なかった。
  • 複雑度解析により、この手法は最小限の計算オーバーヘッドしか追加せず、標準的なViTと同様にO(n²d)の複雑度を維持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。