Skip to main content
QUICK REVIEW

[논문 리뷰] Two-Stream CNN with Loose Pair Training for Multi-modal AMD Categorization

Weisen Wang, Zhiyan Xu|arXiv (Cornell University)|2019. 07. 28.
Retinal Imaging and Analysis참고 문헌 17인용 수 4
한 줄 요약

이 논문은 색채 안저도 및 광학 간섭 단층촬영(OCT) 영상을 사용한 엔드 투 엔드 다중모달 연령 관련 황반변성(AMD) 분류를 위한 이중 스트림 컨volution 신경망(CNN)과 루즈 페어 훈련을 제안한다. 양 모달리티의 특징을 융합하고 레이블 기반 루즈 페어링을 통해 훈련 데이터를 증가시킴으로써, 97.1%의 정확도를 달성하여 이전 최고 성능 기법보다 뚜렷이 뛰어나며, 다중모달 클래스 활성화 맵핑을 통해 시각적 해석도 가능하다.

ABSTRACT

This paper studies automated categorization of age-related macular degeneration (AMD) given a multi-modal input, which consists of a color fundus image and an optical coherence tomography (OCT) image from a specific eye. Previous work uses a traditional method, comprised of feature extraction and classifier training that cannot be optimized jointly. By contrast, we propose a two-stream convolutional neural network (CNN) that is end-to-end. The CNN's fusion layer is tailored to the need of fusing information from the fundus and OCT streams. For generating more multi-modal training instances, we introduce Loose Pair training, where a fundus image and an OCT image are paired based on class labels rather than eyes. Moreover, for a visual interpretation of how the individual modalities make contributions, we extend the class activation mapping technique to the multi-modal scenario. Experiments on a real-world dataset collected from an outpatient clinic justify the viability of our proposal for multi-modal AMD categorization.

연구 동기 및 목표

  • 안저도 및 OCT 영상을 사용한 엔드 투 엔드 훈련 가능한 다중모달 딥 러닝 모델이 부족한 문제를 해결하기 위해.
  • 임상적 다중모달 데이터셋에서 짝지어진 훈련 인스턴스 수가 제한되어 있는 문제를 해결하기 위해.
  • 단일모달 및 기존 다중모달 기준선을 뛰어넘는 분류 성능 향상을 위해.
  • 확장된 클래스 활성화 맵핑 기법을 통해 모달리티 기여도를 시각적으로 해석할 수 있도록 하기 위해.
  • 실제 외래 클리닉 데이터셋을 활용해 방법의 임상적 관련성을 검증하기 위해.

제안 방법

  • 안저도 및 OCT 영상을 각각 독립적으로 처리하기 위한 대칭적인 브랜치를 가진 이중 스트림 CNN을 설계한다.
  • 엔드 투 엔드 훈련과 해석 가능성 지원을 위해 두 스트림의 특징을 융합하는 맞춤형 융합 레이어를 도입한다.
  • 해부학적 눈 쌍이 아닌 레이블 기반으로 안저도 및 OCT 영상을 페어링하여 훈련 데이터의 다양성을 증가시키는 루즈 페어 훈련을 제안한다.
  • 예측에 기여하는 영상 영역을 시각화하기 위해 클래스 활성화 맵핑(CAM)을 다중모달 환경에 적응시킨다.
  • 세 클래스 분류(정상, 건성AMD, 습성AMD)를 위해 교차 엔트로피 손실을 사용한 엔드 투 엔드 역전파 프레임워크로 모델을 훈련시킨다.
  • 두 스트림 모두에 ResNet-18을 백본 네트워크로 사용하며, 다중모달 데이터셋에 대해 미세조정한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 이중 스트림 CNN이 다중모달 AMD 분류에서 단일모달 모델보다 우수한 성능을 낼 수 있는가?
  • RQ2짝지어진 데이터가 부족할 경우 루즈 페어 훈련이 유용한 훈련 인스턴스 수를 효과적으로 증가시키는가?
  • RQ3제안된 방법이 Yoo 등 [16]의 최고 성능 다중모달 접근법을 뛰어넘는 높은 정확도를 달성할 수 있는가?
  • RQ4안저도 및 OCT 모달리티가 최종 예측에 어떻게 기여하는가? 이 기여도는 시각적으로 해석 가능한가?
  • RQ5안저도 및 OCT 영상에서 상보적인 정보를 효과적으로 융합하는 융합 전략이 효과적인가?

주요 결과

  • 제안된 루즈 페어 훈련을 통한 다중모달 CNN(MM-CNN-L)은 총 정확도 97.1%를 달성하여 이전 최고 성능 기법(82.6% 정확도)을 뚜렷이 뛰어넘었다.
  • OCT-CNN 단일모달 모델은 94.2%의 F1 스코어를 기록하여 다중모달 모델이 이를 초월해야 할 강력한 기준선을 확립했다.
  • MM-CNN-L은 건성AMD의 F1 스코어를 Yoo 등 [16]의 방법에서 82.8%에서 95.8%로 향상시켜 중간 단계 AMD의 검출 능력 향상을 보여주었다.
  • 단일모달 모델에서 흔히 발생하는 건성AMD를 습성AMD로 잘못 분류하는 오류를 줄여 진단 정밀도 향상을 보여주었다.
  • 루즈 페어 훈련은 기준선 방법(Yoo 등 [16])의 전체 F1 스코어를 83.5%에서 89.0%로 향상시켜 그 일반적 유용성을 확인했다.
  • 확장된 CAM을 통한 시각적 해석은 안저도 및 OCT가 모두 예측에 의미 있는 기여를 하며, 각 모달리티 간에 다릅니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.