Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task Learning for Chest X-ray Abnormality Classification on Noisy Labels

Sebastian Gündel, Florin C. Ghesu|arXiv (Cornell University)|2019. 05. 15.
COVID-19 diagnosis using AI참고 문헌 34인용 수 20
한 줄 요약

이 논문은 흉부 X-ray 이상 징후 분류를 위한 다중 작업 딥 러닝 프레임워크를 제안하며, 12개 이상의 이상 징후, 그 해부학적 위치, 그리고 폐 및 심장 세그멘테이션을 동시에 예측함으로써 분류 성능을 크게 향상시킨다. 공간적 및 해부학적 사전 지식을 활용하고 새로운 정규화 기법을 적용함으로써, 297,541장의 이미지에서 최신 기술 수준의 평균 AUC 0.883을 달성하였으며, 방사선의사 공감대 기반으로 불확실한 케이스를 제거한 후에는 0.945로 상승한다.

ABSTRACT

Chest X-ray (CXR) is the most common X-ray examination performed in daily clinical practice for the diagnosis of various heart and lung abnormalities. The large amount of data to be read and reported, with 100+ studies per day for a single radiologist, poses a challenge in maintaining consistently high interpretation accuracy. In this work, we propose a method for the classification of different abnormalities based on CXR scans of the human body. The system is based on a novel multi-task deep learning architecture that in addition to the abnormality classification, supports the segmentation of the lungs and heart and classification of regions where the abnormality is located. We demonstrate that by training these tasks concurrently, one can increase the classification performance of the model. Experiments were performed on an extensive collection of 297,541 chest X-ray images from 86,876 patients, leading to a state-of-the-art performance level of 0.883 AUC on average for 12 different abnormalities. We also conducted a detailed performance analysis and compared the accuracy of our system with 3 board-certified radiologists. In this context, we highlight the high level of label noise inherent to this problem. On a reduced subset containing only cases with high confidence reference labels based on the consensus of the 3 radiologists, our system reached an average AUC of 0.945.

연구 동기 및 목표

  • 흉부 X-ray(CXR) 이상 징후 분류에서 높은 방사선의사 간 변동성과 레이블 노이즈 문제를 해결한다.
  • 폐 및 심장 세그멘테이션과 이상 징후의 공간적 위치 파악과 같은 보조 작업을 통합하여 분류 성능을 향상시킨다.
  • 다양한 영상 장치 및 프로토콜에서 발생하는 영상 강도 변동을 처리하기 위해 강건한 정규화 기법을 개발한다.
  • 세 명의 자격을 갖춘 방사선의사가 참여한 다독자 관찰 연구를 통해 레이블 노이즈의 영향을 정량화하고 완화한다.
  • 모델이 예측한 신뢰도 점수가 방사선의사 간 일치도와 강하게 상관되며, 이는 불확실성 인식 분류가 가능하다는 것을 보여준다.

제안 방법

  • 분류, 세그멘테이션, 공간적 위치 파악 헤드 간에 특징을 공유하는 다중 작업 딥 신경망을 제안한다.
  • 12개 이상의 징후에 대한 분류 점수를 생성하기 위해 밀집 연결 블록을 사용하고, 전역 평균 풀링을 적용한다.
  • 폐 및 심장 세그멘테이션 마스크를 예측하기 위해 U-Net 유사 디코더 브랜치를 구현한다.
  • 이미지 획득 설정의 다양성으로 인한 도메인 이탈을 줄이기 위해 작업별로 특화된 정규화 기법을 도입한다.
  • 방사선의사 공감대 기반으로 유도된 불확실성 밴드 필터링 전략을 적용하여 저신뢰도 케이스를 식별하고 제외한다.
  • 분류 작업에는 교차 엔트로피 손실, 세그멘테이션 작업에는 이진 교차 엔트로피 손실을 사용하고, 공동 최적화를 통해 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1흉부 X-ray에서 세그멘테이션과 공간적 위치 파악을 함께 학습함으로써 이상 징후 분류 성능이 향상될 수 있는가?
  • RQ2대규모 CXR 데이터셋에서의 레이블 노이즈가 모델 성능에 미치는 영향은 무엇이며, 다독자 공감대를 통해 이를 완화할 수 있는가?
  • RQ3모델이 예측한 신뢰도 점수가 영상 해석에 있어 방사선의사 간 일치도와 어느 정도 상관되는가?
  • RQ4해부학적 사전 지식(폐/심장 세그멘테이션)을 통합할 경우 분류의 강건성과 정확도가 향상되는가?
  • RQ5새로운 정규화 전략이 다양한 영상 장비에서의 훈련 속도 향상과 모델 일반화 능력을 향상시킬 수 있는가?

주요 결과

  • 제안된 다중 작업 모델은 전체 297,541장의 CXR 영상 데이터셋에서 12개 이상 징후 클래스에 대해 최신 기술 수준의 평균 AUC 0.883을 달성하였다.
  • 방사선의사 공감대 기반으로 도출된 불확실성 밴드 내 케이스를 제거한 후, 평균 AUC는 크게 향상되어 0.945로 상승하였다.
  • 모델이 예측한 신뢰도 점수는 다독자 간 일치도와 강한 상관관계를 보이며, 신뢰도 추정이 신뢰할 수 있음을 시사한다.
  • 필터링 이후 높은 신뢰도의 음성 및 양성 케이스는 각각 76%와 73%의 유지율을 보였으며, 이는 효과적인 노이즈 감소를 의미한다.
  • 작업별로 특화된 정규화 기법을 사용함으로써 훈련 속도가 향상되었고, 다양한 영상 소스 간 강도 변화에 대한 강건성도 향상되었다.
  • 폐 및 심장 세그멘테이션 작업의 통합은 의미 있는 인덕티브 바이어스를 제공하여 대부분의 이상 징후에서 분류 성능 향상을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.