Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Distillation with Adaptive Asymmetric Label Sharpening for Semi-supervised Fracture Detection in Chest X-rays

Yirui Wang, Kang Zheng|arXiv (Cornell University)|2020. 12. 30.
COVID-19 diagnosis using AI참고 문헌 15인용 수 6
한 줄 요약

이 논문은 흉부 X선에서 부족한 영역 수준의 레이블과 임상 진료에서 유도된 대규모 이미지 수준의 레이블을 활용하여 반감독 학습 기반의 갈비뼈 및 경추 골절 탐지 성능을 향상시키기 위해 적응형 비대칭 레이블 날카롭게 조절(AALS) 기반의 지식 증류 프레임워크를 제안한다. AALS를 통해 클래스 불균형 문제를 해결함으로써, 이 방법은 갈비뼈 골절 탐지에서 AUROC 0.9318과 FROC 0.8914의 최신 기술 수준(SOTA) 성능을 달성하였으며, 이는 이전 방법보다 AUROC 1.63%p, FROC 3.74%p 향상된 결과이다.

ABSTRACT

Exploiting available medical records to train high performance computer-aided diagnosis (CAD) models via the semi-supervised learning (SSL) setting is emerging to tackle the prohibitively high labor costs involved in large-scale medical image annotations. Despite the extensive attentions received on SSL, previous methods failed to 1) account for the low disease prevalence in medical records and 2) utilize the image-level diagnosis indicated from the medical records. Both issues are unique to SSL for CAD models. In this work, we propose a new knowledge distillation method that effectively exploits large-scale image-level labels extracted from the medical records, augmented with limited expert annotated region-level labels, to train a rib and clavicle fracture CAD model for chest X-ray (CXR). Our method leverages the teacher-student model paradigm and features a novel adaptive asymmetric label sharpening (AALS) algorithm to address the label imbalance problem that specially exists in medical domain. Our approach is extensively evaluated on all CXR (N = 65,845) from the trauma registry of anonymous hospital over a period of 9 years (2008-2016), on the most common rib and clavicle fractures. The experiment results demonstrate that our method achieves the state-of-the-art fracture detection performance, i.e., an area under receiver operating characteristic curve (AUROC) of 0.9318 and a free-response receiver operating characteristic (FROC) score of 0.8914 on the rib fractures, significantly outperforming previous approaches by an AUROC gap of 1.63% and an FROC improvement by 3.74%. Consistent performance gains are also observed for clavicle fracture detection.

연구 동기 및 목표

  • 임상 진료에서 자동으로 추출한 대규모 이미지 수준 레이블을 활용하여 의료 영상 레이블링의 전문가 레이블 비용을 줄이기 위해.
  • 낮은 유병률 골절 탐지에서 특유의 클래스 불균형 문제를 해결하기 위해, 이미지 수준의 음성 레이블이 영역 수준의 양성 레이블보다 훨씬 많다는 점을 고려하여.
  • 제한된 전문가 레이블이 제공되는 조건에서 임상 진료 정보를 신뢰할 수 있는 방식으로 통합하여 CAD의 반감독 학습을 향상시키기 위해.
  • 극도로 레이블이 부족한 상황에서도 이미지 수준 및 영역 수준 레이블을 효과적으로 활용할 수 있는 새로운 지식 증류 전략을 개발하기 위해.
  • 실제 대규모 CXR 데이터셋에서 갈비뼈 및 경추 골절 탐지에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 임상 진료에서 유도된 이미지 수준 레이블을 가짜 레이블로 사용하여, 미레이블된 데이터에 대해 교사-학생 지식 증류 프레임워크를 제안한다.
  • 모델의 불확실성과 클래스 불균형을 기반으로 레이블 신뢰도를 동적으로 조정하는 적응형 비대칭 레이블 날카롭게 조절(AALS) 방법을 도입한다.
  • AALS는 학습 가능한 매개변수인 중심(t)과 강도(a₀)를 갖는 시그모이드 기반의 날카롭게 조절 함수를 적용하여 가짜 레이블의 노이즈를 감소시키고 일반화 성능을 향상시킨다.
  • 교육 과정 학습 전략을 사용하여 훈련 중에 이미지 수준의 양성 레이블(P)의 영향력을 점진적으로 증가시켜 학습 안정성을 확보한다.
  • 학생 네트워크는 영역 수준 레이블에 대한 이진 교차 엔트로피 손실과, 가짜 레이블된 이미지에서 교사 모델로부터 유도된 증류 손실을 조합하여 훈련된다.
  • 교사 모델은 학생의 가중치에 대해 지수 이동 평균(EMA)을 적용하여 훈련의 안정성과 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1제한된 영역 수준 레이블과 함께 임상 진료에서 유도된 이미지 수준 레이블이 반감독 골절 탐지 성능을 크게 향상시킬 수 있는가?
  • RQ2특히 영역 수준의 양성 레이블과 이미지 수준의 음성 레이블 간 비율이 1:100인 경우, 의료 분야의 반감독 학습에서 레이블 불균형 문제를 효과적으로 완화할 수 있는가?
  • RQ3적응형 비대칭 레이블 날카롭게 조절(AALS)이 일반화 성능과 탐지 성능 향상에 있어 표준 레이블 스무딩 또는 날카롭게 조절보다 뛰어난가?
  • RQ4이미지 수준의 양성 레이블(P)을 포함시키는 것과 이들을 미레이블 데이터로 간주하는 것 사이에서 탐지 성능 향상 정도는 어느 정도인가?
  • RQ5AALS를 활용한 지식 증류가 실제 CXR 데이터에서 갈비뼈 및 경추 골절 탐지에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 갈비뼈 골절 탐지에서 AUROC 0.9318과 FROC 0.8914의 성능을 달성하였으며, 이는 이전 방법보다 AUROC 1.63%p, FROC 3.74%p 향상된 결과이다.
  • 경추 골절 탐지에서는 AUROC 0.9646과 FROC 0.9265를 기록하여 두 골절 유형 모두에서 일관된 성능 향상을 보였다.
  • 중심 t=0.4와 강도 a₀=4를 설정한 AALS가 최고의 성능을 보였으며, 이는 민감도와 특이도를 균형 있게 조절하는 최적의 레이블 날카롭게 조절이 필요함을 시사한다.
  • 이미지 수준의 양성 레이블(P)의 포함 비율이 증가할수록 성능이 단조롭게 향상되며, 임상 진료 데이터의 가치를 확인한다.
  • 이를 바탕으로, 이미지 수준 레이블을 사용하는 약한 감독 및 다중 인스턴스 학습 기반의 베이스라인(예: CheXNet, Li et al.)보다도 분류 및 국소화 성능에서 뛰어난 성능을 보였다.
  • 제거 실험 결과, 지나치게 과도한 날카롭게 조절(AALS의 a₀=16)이나 부족한 날카롭게 조절(AALS의 a₀=1)은 성능 저하를 유도함을 확인하였으며, 이는 적응형 조정의 필요성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.