[논문 리뷰] Learning from Thresholds: Fully Automated Classification of Tumor Infiltrating Lymphocytes for Multiple Cancer Types
이 논문은 12개의 암 유형에서 종양 침윤 림프구(Tumor Infiltrating Lymphocytes, TILs)를 분류하기 위해 딥러닝 모델을 훈련시키기 위한 대규모 약한 애너테이션을 생성하기 위해 편향된 초기 분류기에서 인간이 조정한 임계값을 활용하는 반자동 애너테이션 방법을 제안한다. 이러한 임계값 처리된 TIL 지도와 수동 애너테이션을 결합하여, 인간의 개입 없이도 완전히 자동화된 TIL 분류 성능을 달성한 VGG-16 및 Inception-V4 모델을 훈련시켰으며, 이는 이전의 최고 성능 방법을 능가한다.
Deep learning classifiers for characterization of whole slide tissue morphology require large volumes of annotated data to learn variations across different tissue and cancer types. As is well known, manual generation of digital pathology training data is time consuming and expensive. In this paper, we propose a semi-automated method for annotating a group of similar instances at once, instead of collecting only per-instance manual annotations. This allows for a much larger training set, that reflects visual variability across multiple cancer types and thus training of a single network which can be automatically applied to each cancer type without human adjustment. We apply our method to the important task of classifying Tumor Infiltrating Lymphocytes (TILs) in H&E images. Prior approaches were trained for individual cancer types, with smaller training sets and human-in-the-loop threshold adjustment. We utilize these thresholded results as large scale "semi-automatic" annotations. Combined with existing manual annotations, our trained deep networks are able to automatically produce better TIL prediction results in 12 cancer types, compared to the human-in-the-loop approach.
연구 동기 및 목표
- 수동 애너테이션의 높은 비용과 제한된 확장성을 해결하기 위해, 초기 분류기에서 유도된 인간 조정 임계값을 약한 지도로 활용하는 것.
- 암 유형별로 인간의 조정이 필요 없이 다양한 암 유형에 일반화되는 단일 딥러닝 모델을 훈련시키는 것.
- 임계값 처리된 TIL 지도에서 유도된 대규모 반자동 애너테이션과 수동 애너테이션을 결합하여 TIL 분류 성능을 향상시키는 것.
- 완전히 자동화된 파이프라인, 훈련된 모델, 그리고 12개의 암 유형에서 5,000개의 전체 슬라이드 이미지에 대해 약 10,000개의 새로운 TIL 지도를 공개하는 것.
제안 방법
- 편향된 초기 분류기가 생성한 임계값 처리된 TIL 확률 지도—병리의사가 수동으로 조정한 것—를 약한 애너테이션으로 사용하여 훈련 데이터셋을 확장한다.
- 이러한 반자동 애너테이션은 더 작은 수의 수동으로 레이블링된 패치와 결합되어, 특히 VGG-16 및 Inception-V4 아키텍처의 딥 네트워크를 훈련시킨다.
- 훈련 과정은 혼합 데이터 전략을 활용한다: 강한(수동) 및 약한(임계값 처리된) 애너테이션을 모두 사용하여 다양한 조직 형태에 대한 일반화 능력을 향상시킨다.
- 기준 비교를 위해 유저의 개입이 없는 고정 임계값(0.26)을 사용하며, 비교를 위한 기준 방법에서는 인간의 개입이 있는 임계값을 사용한다.
- 최종 모델은 병리의사가 애너테이션한 큰 조직 패치의 진정값을 기반으로 패치 수준 분류 및 지역적 TIL 정량화(Low/Medium/High)에 대해 평가된다.
실험 결과
연구 질문
- RQ1편향된 초기 분류기에서 유도된 임계값 처리된 예측을 약한 지도로 효과적으로 활용하여 더 강력하고 일반화 능력이 뛰어난 TIL 분류 모델을 훈련시킬 수 있는가?
- RQ2반자동 애너테이션과 수동 애너테이션을 결합하면, 특히 수동 애너테이션이 없는 암 유형에서 여러 암 유형에 걸쳐 모델 성능이 향상되는가?
- RQ3다양한 암 유형의 데이터로 훈련된 단일 딥러닝 모델이, 케이스별 임계값 조정 없이도 인간의 개입이 있는 방법보다 더 나은 TIL 분류 성능을 달성할 수 있는가?
- RQ4제안된 방법으로 훈련된 모델은 상태의 최고 수준의 방법과 비교해, TIL 침윤 수준이 낮음, 중간, 높음인 조직 영역을 얼마나 잘 구분하는가?
주요 결과
- 수동 애너테이션과 반자동 애너테이션을 결합한 제안된 방법은 12개의 암 유형 전반에서 가장 높은 F1 점수(0.87)와 AUC(0.91)를 기록하여 기준 인간의 개입이 있는 방법을 능가한다.
- 반자동 애너테이션을 사용해 훈련된 모델은 수동 데이터가 없는 암 유형(예: CESC, LUSC, READ, STAD)에서 성능 향상이著명하며, 수동 데이터가 있는 유형에서는 성능 저하가 발생하지 않는다.
- 완전히 자동화된 VGG-mix 및 Incep-mix 모델은 고정 임계값 0.5를 사용한 기준 방법보다 더 높은 분류 정확도(78.22%)와 F1 점수(0.85)를 달성한다. 반면 기준 방법은 정확도가 70.22%로 떨어지고 F1 점수는 0.76으로 하락한다.
- 제안된 방법으로 훈련된 모델는 예측된 TIL 양성 패치 수의 바이올린 플롯을 통해 낮음, 중간, 높음 수준의 TIL 침윤 영역을 더 잘 구분한다.
- Youden의 지수 기반 임계값(0.42 for VGG-mix, 0.10 for Incep-mix)을 사용하면 기본 임계값보다 성능 향상이 뚜렷하며, 이는 약한 지도에서 최적화된 임계값 설정의 가치를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.