Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Human Selective Attention for Medical Image Analysis with Limited Training Data

Yifei Huang, Xiaoxiao Li|arXiv (Cornell University)|Dec 2, 2021
Advanced Neural Network Applications参考文献 50被引用数 4
ひとこと要約

本論文は、限られた訓練データ下で、選択的注意を模倣するための選択的注意ネットワーク(SAN)と補助的注意ブロック(AAB)を用いて、人間の注視データを活用する新しいフレームワークを提案する。AABは、変更を加えたマルチヘッドアテンション機構を用いて、バックボーンエンコーダーに注視から得られるアテンションマップを統合し、最小限のラベル付きデータで3D脳腫瘍セグメンテーションおよび2D胸部X線分類において最先端の性能を達成した。

ABSTRACT

The human gaze is a cost-efficient physiological data that reveals human underlying attentional patterns. The selective attention mechanism helps the cognition system focus on task-relevant visual clues by ignoring the presence of distractors. Thanks to this ability, human beings can efficiently learn from a very limited number of training samples. Inspired by this mechanism, we aim to leverage gaze for medical image analysis tasks with small training data. Our proposed framework includes a backbone encoder and a Selective Attention Network (SAN) that simulates the underlying attention. The SAN implicitly encodes information such as suspicious regions that is relevant to the medical diagnose tasks by estimating the actual human gaze. Then we design a novel Auxiliary Attention Block (AAB) to allow information from SAN to be utilized by the backbone encoder to focus on selective areas. Specifically, this block uses a modified version of a multi-head attention layer to simulate the human visual search procedure. Note that the SAN and AAB can be plugged into different backbones, and the framework can be used for multiple medical image analysis tasks when equipped with task-specific heads. Our method is demonstrated to achieve superior performance on both 3D tumor segmentation and 2D chest X-ray classification tasks. We also show that the estimated gaze probability map of the SAN is consistent with an actual gaze fixation map obtained by board-certified doctors.

研究の動機と目的

  • ラベル付きデータが限られる状況での医療画像解析の性能向上を図ること。これは、人間の選択的注意メカニズムにインspiredされたものである。
  • 放射線科医から収集した注視データを用いて、医療画像における人間の視覚的注意をモデル化すること。
  • セグメンテーションおよび分類の両タスクに適した、即挿し可能なモジュールを設計し、注視に基づく注意をバックボーンネットワークに転送すること。
  • 本フレームワークを、実際の専門家の注視データを用いて、3Dおよび2Dの医療画像処理タスクで検証すること。
  • 臨床現場における実際のヒトの注視パターンと一致する、注視推定アテンションマップの妥当性を示すこと。

提案手法

  • 実際のヒトの注視データ(認定放射線科医から得たもの)を用いて、タスクに適したアテンションマップを推定するための選択的注意ネットワーク(SAN)を学習する。
  • 補助的注意ブロック(AAB)は、変更を加えたマルチヘッドアテンション機構を用い、SANが予測した注視特徴量をクエリベクトルとしてバックボーンエンコーダーに統合する。
  • AABでは、バックボーン特徴量をキーおよびバリューとして用い、SANの出力をクエリとして用いることで、空間的に注意を配した特徴量の精錬を実現する。
  • 本フレームワークは、さまざまなバックボーンアーキテクチャ(例:EfficientNet、ResNet、MobileNet)およびセグメンテーション・分類用のタスク固有のヘッドと互換性を持つ。
  • 本手法は、主タスクのクロスエントロピー損失とSANの注視推定損失の両方を用いて、エンドツーエンドで学習される。
  • 注視データは、BraTS 2020およびMIMIC-CXR-gazeデータセットで診断スクリーニングタスクを実施中の眼動追跡を用いて収集された。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きデータが限られる状況で、ヒトの注視データを活用することで、医療画像解析の性能が向上するか?
  • RQ2学習された注視推定ネットワーク(SAN)は、実際の放射線科医の注視パターンと整合性のとれた注意パターンをどれほど正確に予測できるか?
  • RQ3AABモジュールを用いて注視から得たアテンションを統合することで、バックボーンネットワークにおける特徴量学習が向上するか?
  • RQ4本フレームワークは、異なる画像モodal(2D X線、3D MRI)およびバックボーンアーキテクチャに一般化可能か?
  • RQ5直接的なターゲットデータへのアクセスがなくても、注視データのみで、ゼロショットまたはフェイシュット設定におけるモデルの一般化性能が向上するか?

主な発見

  • 提案されたフレームワークは、完全な訓練データの0.3のみを用いてBraTS 2020における3D脳腫瘍セグメンテーションで最先端の性能を達成し、すべてのベースラインを上回った。
  • MIMIC-CXR-gazeデータセットでは、訓練データの0.7を用いて平均AUROCが59.26%を達成し、バックボーン(55.14%)および注視ベースライン(55.07%)を顕著に上回った。
  • SANが推定した注視確率マップは、認定放射線科医から収集した実際の注視マップと強い空間的一致性を示した。
  • AABモジュールは、複数のバックボーンで性能向上を実現し、特にデータが限られる状況でEfficientNet-b0がResNet-18やMobileNet-v2よりも優れた性能を示した。
  • MIMIC-CXR-gazeデータセットの全疾患クラスにおいて一貫した性能向上が確認され、特に心臓肥大(61.31% AUROC)および胸水(61.94% AUROC)の分類で顕著な向上が見られた(0.7のデータ比時)。
  • アブレーションスタディの結果、性能向上は単に注視データの追加によるものではなく、AABの設計によるものであることが確認され、+gaze*および注視損失ベースラインを上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。