Skip to main content
QUICK REVIEW

[논문 리뷰] Comparing to Learn: Surpassing ImageNet Pretraining on Radiographs By Comparing Image Representations

Hong-Yu Zhou, Shuang Yu|arXiv (Cornell University)|2020. 07. 15.
COVID-19 diagnosis using AI참고 문헌 14인용 수 11
한 줄 요약

이 논문은 레이저 영상에서 애너테이션 없이 이미지 표현을 비교함으로써 강건한 특징을 학습하는 자기지도 학습 사전 훈련 방법인 Comparing to Learn (C2L)을 제안한다. 700만 개의 애너테이션 없는 레이저 영상에서 배치 믹스업과 모멘텀 기반의 학생-선생 대비 프레임워크를 활용하여, C2L는 여러 의료 영상 기준에서 ImageNet 사전 훈련과 최신 기준을 초월하며, DenseNet-121을 사용할 때 ChestX-ray14에서 최대 2.0% 높은 AUROC와 CheXpert에서 1.4% 높은 AUROC를 달성한다.

ABSTRACT

In deep learning era, pretrained models play an important role in medical image analysis, in which ImageNet pretraining has been widely adopted as the best way. However, it is undeniable that there exists an obvious domain gap between natural images and medical images. To bridge this gap, we propose a new pretraining method which learns from 700k radiographs given no manual annotations. We call our method as Comparing to Learn (C2L) because it learns robust features by comparing different image representations. To verify the effectiveness of C2L, we conduct comprehensive ablation studies and evaluate it on different tasks and datasets. The experimental results on radiographs show that C2L can outperform ImageNet pretraining and previous state-of-the-art approaches significantly. Code and models are available.

연구 동기 및 목표

  • ImageNet 사전 훈련에서 사용되는 자연 이미지와 의료 레이저 영상 간의 도메인 갭을 해소하기 위해, 레이저 영상에서 애너테이션 없이 직접 표현을 학습하는 것.
  • 비용이 많이 드는 의료 애너테이션에 의존하지 않으면서도 후행 작업 성능을 향상시키는 자기지도 사전 훈련 방법을 개발하는 것.
  • 의료 영상 표현을 비교함으로써 학습하는 것이 ImageNet 사전 훈련의 일반화 능력을 초월할 수 있는지 조사하는 것.
  • 특징 수준의 유사도를 기반으로 한 대비 학습이 레이저 영상 작업에 대해 우수한 표현을 제공할 수 있음을 입증하는 것.

제안 방법

  • C2L는 학생 네트워크가 역전파를 통해 업데이트되고, 선생 네트워크가 모멘텀 업데이트 규칙을 통해 업데이트되는 모멘텀 기반의 학생-선생 프레임워크를 사용한다.
  • 이 방법은 증강된 이미지 배치에서 동일한 유형과 이질적인 유형의 이미지 쌍을 생성하기 위해 배치 수준의 믹스업을 적용하여, 이미지 수준과 특징 수준에서 모두 대비 학습을 가능하게 한다.
  • 특징 믹스업은 선생 네트워크의 출력 특징에 적용되어 추가적인 양성 쌍을 생성하고 표현 학습을 향상시킨다.
  • 기억 큐는 선생 네트워크의 과거 특징을 저장하여 대비 손실 계산 시 음성 키로 사용한다.
  • 대비 손실은 예측된 유사도 점수와 일항 지도(true) 간의 교차 엔트로피를 사용하여 계산되며, 양성 쌍은 동일한 이미지의 매칭 특징이고, 음성 쌍은 기억 큐에서 온다.
  • 훈련 과정은 증강된 배치와 혼합된 배치에서의 순방향 전파를 번갈아 수행하며, 학생 네트워크는 대비 손실로 훈련되고, 선생 네트워크는 모멘텀으로 업데이트된다.

실험 결과

연구 질문

  • RQ1애너테이션 없는 레이저 영상에서 자기지도 표현 학습이 의료 영상 분석에서 ImageNet 사전 훈련을 초월할 수 있는가?
  • RQ2믹스업과 대비 손실을 통해 이미지 표현 비교를 통해 학습하는 것이 전통적인 이미지 복원 또는 재구성 사전 과제보다 더 강건한 특징을 제공하는가?
  • RQ3Model Genesis와 MoCo와 같은 최신 자기지도 방법과 비교해 C2L는 다양한 레이저 영상 작업과 데이터셋에서 어떻게 성능을 내는가?
  • RQ4제안된 믹스업 및 모멘텀 대비 학습 프레임워크가 자원이 제한된 의료 영상 환경에서 일반화 능력을 얼마나 향상시키는가?

주요 결과

  • ChestX-ray14 데이터셋에서 C2L는 DenseNet-121을 사용해 평균 AUROC 84.4%를 기록하여 ImageNet 사전 훈련보다 1.5%p 높게 달성했다.
  • CheXpert에서 C2L는 DenseNet-121을 사용해 평균 AUROC 89.3%를 기록하여 ImageNet 사전 훈련보다 1.4%p 높게 달성했다.
  • Kaggle 폐렴 검출 데이터셋에서 C2L는 0.6 신뢰도 기준 평균 평균 정밀도 23.9%를 기록하여 ImageNet 사전 훈련(22.2%)과 MoCo(22.4%)를 크게 앞서갔다.
  • C2L는 평가된 모든 데이터셋과 아키텍처에서 Model Genesis와 MoCo를 일관되게 뛰어넘어 도메인 특화 표현을 학습하는 데서의 우수성을 입증했다.
  • 절단 실험을 통해 배치 믹스업과 특징 믹스업이 성능 향상에 기여하며, 모멘텀 대비 학습 메커니즘이 특징 구분 능력을 향상시킨다는 것이 확인되었다.
  • 이 방법은 인간 애너테이션 데이터 없이도 최신 기술 수준의 성능을 달성하여, 쌍이 없는, 애너테이션 없는 레이저 영상에서 표현 비교가 ImageNet 사전 훈련보다 더 좋은 특징을 생성할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.