Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Mining External Imperfect Data for Chest X-ray Disease Screening

Luyang Luo, Lequan Yu|arXiv (Cornell University)|2020. 06. 06.
COVID-19 diagnosis using AI참고 문헌 54인용 수 7
한 줄 요약

이 논문은 여러 개의 열악한 외부 데이터셋을 공동으로 훈련시켜 흉부 X선 질병 분류 성능을 햖थ기 위한 새로운 프레임워크를 제안한다. 도메인 및 레이블 불일치 문제를 임계적인 적대적 훈련과 불확실성 인식 시간 평균화를 통해 해결하며, NIH 테스트 세트에서 0.8349 AUC를 기록하여 대규모이고 이질적인 의료 영상 데이터로부터 뛰어난 지식 채굴 능력을 입증한다.

ABSTRACT

Deep learning approaches have demonstrated remarkable progress in automatic Chest X-ray analysis. The data-driven feature of deep models requires training data to cover a large distribution. Therefore, it is substantial to integrate knowledge from multiple datasets, especially for medical images. However, learning a disease classification model with extra Chest X-ray (CXR) data is yet challenging. Recent researches have demonstrated that performance bottleneck exists in joint training on different CXR datasets, and few made efforts to address the obstacle. In this paper, we argue that incorporating an external CXR dataset leads to imperfect training data, which raises the challenges. Specifically, the imperfect data is in two folds: domain discrepancy, as the image appearances vary across datasets; and label discrepancy, as different datasets are partially labeled. To this end, we formulate the multi-label thoracic disease classification problem as weighted independent binary tasks according to the categories. For common categories shared across domains, we adopt task-specific adversarial training to alleviate the feature differences. For categories existing in a single dataset, we present uncertainty-aware temporal ensembling of model predictions to mine the information from the missing labels further. In this way, our framework simultaneously models and tackles the domain and label discrepancies, enabling superior knowledge mining ability. We conduct extensive experiments on three datasets with more than 360,000 Chest X-ray images. Our method outperforms other competing models and sets state-of-the-art performance on the official NIH test set with 0.8349 AUC, demonstrating its effectiveness of utilizing the external dataset to improve the internal classification.

연구 동기 및 목표

  • 다양한 출처에서 온 열악하고 이질적인 흉부 X선 데이터셋을 기반으로 딥 러닝 모델을 훈련시키는 과제를 해결하기 위해.
  • 데이터셋 간 영상 촬영 프로토콜, 시야, 사전 처리 방식의 차이로 인한 도메인 불일치 문제를 극복하기 위해.
  • 데이터셋 간 병리학적 카테고리의 다양성과 부분 레이블링으로 인한 레이블 불일치 문제를 다루기 위해.
  • 내부 데이터셋의 분류 성능을 향상시키기 위해 외부의 열악한 데이터로부터 지식을 효과적으로 채굴하기 위해.
  • 의료 영상 분석 분야에서 다중 기관, 다중 데이터셋 훈련을 위한 일반화 가능한 프레임워크를 개발하기 위해.

제안 방법

  • 클래스 불균형과 부분 레이블링을 다루기 위해 다중 레이블 흉부 질환 분류 문제를 가중치가 부여된 독립적 이진 작업으로 재정의한다.
  • 공통적으로 존재하는 카테고리에 대해 도메인 불변 특징을 학습하기 위해 작업별 적대적 훈련을 적용한다.
  • 단일 데이터셋 전용 결과에서 레이블이 없는 카테고리의 숨겨진 지식을 점진적으로 채굴하기 위해 불확실성 인식 시간 평균화를 도입한다.
  • 공동 최적화를 위해 작업별 가중치(TW), 작업별 적대적 훈련(TAT), 불확실성 인식 시간 평균화(UTE)로 구성된 세 모듈 프레임워크를 사용한다.
  • 불확실성 추정을 통한 시간에 따른 모델 예측을 활용하여 누락된 레이블에서의 학습을 안정화하고 향상시킨다.
  • 감독 손실, 적대적 손실, 일관성 손실의 조합을 통해 엔드 투 엔드로 훈련하여 강건성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1어떻게 상당한 도메인 및 레이블 불일치를 보이는 외부 흉부 X선 데이터셋을 효과적으로 통합하여 내부 모델의 성능을 향상시킬 수 있는가?
  • RQ2영상 촬영 프로토콜, 시야, 사전 처리의 차이로 인한 도메인 이동 문제를 완화할 수 있는 기법은 무엇인가?
  • RQ3일부 카테고리가 특정 데이터셋에 누락된 부분 레이블링 데이터에서 신뢰할 수 있는 지식을 어떻게 추출할 수 있는가?
  • RQ4불확실성 인식 시간 평균화는 외부 데이터셋에서 알려지지 않았거나 드물게 표기된 병리학적 소견에서의 학습을 향상시킬 수 있는가?
  • RQ5여러 개의 열악한 데이터셋을 결합할 경우, 다중 기관 의료 영상 분류에서 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 NIH 테스트 세트에서 기존 모델을 능가하는 최신 기술 수준의 AUC 0.8349를 달성한다.
  • NIH 정제된 서브셋에서, TenCrop 테스팅을 사용하여 기침성 기흉의 AUC가 0.925에 도달하여 더 큰 재레이블링된 데이터셋으로 훈련된 모델의 성능에 가까워진다.
  • 레이블 노이즈에 대해 강건성을 보이며, 여러 병리학적 카테고리에서 일관된 성능 향상을 유지한다.
  • CheXpert 및 MIMIC-CXR와 같은 외부 데이터셋과의 공동 훈련은 NIH에서 평균 AUC 0.8353을 기록하여 추가 데이터로의 성능 향상에 포화점에 도달할 가능성을 시사한다.
  • 작업별 적대적 훈련은 공통 카테고리에 대해 도메인 이동을 크게 감소시키며, 데이터셋 간 특징 정렬을 향상시킨다.
  • 불확실성 인식 시간 평균화는 희귀하거나 데이터셋 전용 병리학적 소견에 대해 레이블이 누락된 경우에 지식 채굴에 효과적으로 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.