Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Human Selective Attention for Medical Image Analysis with Limited Training Data

Yifei Huang, Xiaoxiao Li|arXiv (Cornell University)|2021. 12. 02.
Advanced Neural Network Applications참고 문헌 50인용 수 4
한 줄 요약

이 논문은 제한된 훈련 데이터 하에서 의료 영상 분석 성능을 햖스하기 위해 인간의 시선 데이터를 활용하는 새로운 프레임워크를 제안한다. 선택적 주의를 시뮬레이션하기 위해 선택적 주의망(SAN)과 보조 주의 블록(AAB)을 사용하며, AAB는 수정된 다중헤드 어텐션 메커니즘을 사용해 뼈대 인코더에 시선 유도 주의 맵을 통합한다. 이로 인해 최소한의 레이블 데이터로도 3D 뇌종양 세분화 및 2D 흉부 X-ray 분류 과제에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

The human gaze is a cost-efficient physiological data that reveals human underlying attentional patterns. The selective attention mechanism helps the cognition system focus on task-relevant visual clues by ignoring the presence of distractors. Thanks to this ability, human beings can efficiently learn from a very limited number of training samples. Inspired by this mechanism, we aim to leverage gaze for medical image analysis tasks with small training data. Our proposed framework includes a backbone encoder and a Selective Attention Network (SAN) that simulates the underlying attention. The SAN implicitly encodes information such as suspicious regions that is relevant to the medical diagnose tasks by estimating the actual human gaze. Then we design a novel Auxiliary Attention Block (AAB) to allow information from SAN to be utilized by the backbone encoder to focus on selective areas. Specifically, this block uses a modified version of a multi-head attention layer to simulate the human visual search procedure. Note that the SAN and AAB can be plugged into different backbones, and the framework can be used for multiple medical image analysis tasks when equipped with task-specific heads. Our method is demonstrated to achieve superior performance on both 3D tumor segmentation and 2D chest X-ray classification tasks. We also show that the estimated gaze probability map of the SAN is consistent with an actual gaze fixation map obtained by board-certified doctors.

연구 동기 및 목표

  • 레이블이 부족한 상황에서 의료 영상 분석 성능을 향상시키기 위해 인간의 선택적 주의 메커니즘을 영감으로 삼는 것.
  • 정밀의사가 수집한 시선 데이터를 사용해 의료 영상에서 인간의 시각적 주의를 모델링하는 것.
  • 세분화 및 분류 작업에 대해 뼈대 네트워크에 시선 기반 주의를 전이할 수 있는 즉시 사용 가능한 모듈을 설계하는 것.
  • 실제 전문가의 시선 데이터를 사용해 3D 및 2D 의료 영상 과제에서 프레임워크를 검증하는 것.
  • 시선 추정 주의 맵이 임상 환경에서 실제 인간의 정지 시선 패tern과 일치하는지 입증하는 것.

제안 방법

  • 실제 인간의 시선 데이터를 기반으로 한 선택적 주의망(SAN)을 보유한 정밀의사로부터 수집된 데이터로 훈련하여 임무 관련 주의 맵을 추정한다.
  • 보조 주의 블록(AAB)은 수정된 다중헤드 어텐션 메커니즘을 사용하여 SAN이 예측한 시선 특징을 뼈대 인코더에 쿼리 벡터로 통합한다.
  • AAB는 뼈대 특징을 키 및 값으로 사용하고, SAN 출력을 쿼리로 사용함으로써 공간적으로 인식 가능한 특징 정밀화를 가능하게 한다.
  • 이 프레임워크는 다양한 뼈대 아키텍처(예: EfficientNet, ResNet, MobileNet) 및 세분화 및 분류를 위한 작업별 헤드와 호환된다.
  • 주 작업에 대해 교차 엔트로피 손실을, SAN에 대해 시선 추정 손실을 사용해 엔드 투 엔드로 훈련된다.
  • 시선 데이터는 BraTS 2020 및 MIMIC-CXR-gaze 데이터셋에서 진단 스크리닝 작업 중 눈 추적 장치를 사용해 수집되었다.

실험 결과

연구 질문

  • RQ1레이블이 제한된 상황에서 인간의 시선 데이터가 의료 영상 분석 성능 향상에 기여할 수 있는가?
  • RQ2학습된 시선 추정 네트워크(SAN)가 실제 정밀의사의 정지 시선 패턴과 일치하는 주의 패턴을 얼마나 잘 예측할 수 있는가?
  • RQ3AAB 모듈을 통해 시선 기반 주의를 통합하면 뼈대 네트워크의 특징 학습이 의료 과제에서 향상되는가?
  • RQ4이 프레임워크는 2D X-ray 및 3D MRI와 같은 다양한 영상 모odalities와 뼈대 아키텍처에 대해 얼마나 일반화 가능한가?
  • RQ5목표 데이터에 직접 접근하지 않고도 시선 데이터만으로도 제로샷 또는 희소한 샘플 설정에서 모델 일반화 성능을 향상시킬 수 있는가?

주요 결과

  • 제안된 프레임워크는 전체 훈련 데이터의 0.3만을 사용해 BraTS 2020에서 3D 뇌종양 세분화 과제에서 최신 기술 수준의 성능을 달성하며, 모든 베이스라인을 능가한다.
  • MIMIC-CXR-gaze 데이터셋에서, 이 방법은 훈련 데이터의 0.7을 사용해 평균 AUROC 59.26%를 기록했으며, 뼈대 모델(55.14%)과 시선 기반 베이스라인(55.07%)보다 뚜렷이 뛰어난 성능을 보였다.
  • SAN에서 추정한 시선 확률 맵은 정밀의사가 수집한 실제 정지 시선 맵과 강한 공간 일치성을 보였다.
  • AAB 모듈은 다양한 뼈대 모델에서 성능 향상을 이끌었으며, ResNet-18과 MobileNet-v2에 비해 제한된 데이터에서 EfficientNet-b0가 뛰어난 성능을 보였다.
  • MIMIC-CXR-gaze 데이터셋의 모든 질환 유형에서 일관된 성능 향상이 관찰되었으며, 특히 심장비대(61.31% AUROC)와 폐강직(61.94% AUROC)에서 0.7 데이터 비율에서 높은 성능을 기록했다.
  • 제거 실험을 통해 성능 향상 요인이 AAB 설계에 기인하며, 단순히 시선 데이터를 포함하는 것만으로는 성능 향상이 이루어지지 않음을 확인했으며, +gaze* 및 시선 손실 기반 베이스라인보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.