Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Learning for the Classification of Tumor Infiltrating Lymphocytes

Ujjwal Baid, Sarthak Pati|arXiv (Cornell University)|2022. 03. 30.
AI in cancer detection인용 수 11
한 줄 요약

이 연구는 전체 슬라이드 이미지(WSI)에서 종양 침윤 림프구(TILs)를 분류하기 위해 12개 종양 유형의 The Cancer Genome Atlas(TCGA)에서 유래한 패치를 사용하여 연합학습(FL)을 평가한다. FL은 중앙집중 학습과 유사한 성능을 달성하여, 데이터 공유 없이도 다기관 협업을 통해 강력하고 일반화 가능한 TIL 분류 모델을 구축할 수 있음을 보여주며, 데이터 프라이버시를 유지할 수 있다.

ABSTRACT

We evaluate the performance of federated learning (FL) in developing deep learning models for analysis of digitized tissue sections. A classification application was considered as the example use case, on quantifiying the distribution of tumor infiltrating lymphocytes within whole slide images (WSIs). A deep learning classification model was trained using 50*50 square micron patches extracted from the WSIs. We simulated a FL environment in which a dataset, generated from WSIs of cancer from numerous anatomical sites available by The Cancer Genome Atlas repository, is partitioned in 8 different nodes. Our results show that the model trained with the federated training approach achieves similar performance, both quantitatively and qualitatively, to that of a model trained with all the training data pooled at a centralized location. Our study shows that FL has tremendous potential for enabling development of more robust and accurate models for histopathology image analysis without having to collect large and diverse training data at a single location.

연구 동기 및 목표

  • 전체 슬라이드 이미지에서 TIL 분류를 위한 데이터 공유 없이도 프라이버시를 보장하는 연합학습의 잠재성을 평가하기 위해.
  • 원시 병리학 데이터를 공유하지 않고도 중앙집중 학습과 유사한 성능을 내는 모델을 개발할 수 있는지 평가하기 위해.
  • 다양한 종양 유형 간의 데이터 이질성이 연합학습 모델의 일반화 능력에 미치는 영향을 조사하기 위해.
  • 분산된 협업을 통해 강력하고 전 종양 범위의 TIL 탐지 모델을 훈련시킬 수 있는지의 가능성을 입증하기 위해.
  • 연합 환경에서 개별 기관 모델과 글로벌 공의 모델 간의 성능를 비교 평가하기 위해.

제안 방법

  • 연구는 TCGA의 한 종양 유형 또는 그 이상에서 데이터를 보유한 8개의 분산 노드로 구성된 연합학습 환경을 시뮬레이션하였다.
  • 각 노드는 전체 슬라이드 이미지에서 추출한 50×50 제곱 미크론 크기의 패치에서 VGG16 기반 딥러닝 모델을 훈련시켰다.
  • 모델 업데이트는 FedAvg( FedAvg 알고리즘)를 사용하여 중앙집중적으로 집계하여 원시 데이터를 공유하지 않고도 글로벌 공의 모델을 형성하였다.
  • 성능 평가는 보류된 로컬 검증 데이터와 미리 보지 않은 WSI에 대한 정성적 분석을 통해 평가되었다.
  • 원래의 중앙집중 학습 VGG16 모델은 모든 데이터를 사용해 훈련된 기준 모델로 기능하였다.
  • TIL 분류는 패치에 두 개 이상의 림프구가 존재하는지 여부(양성) 또는 존재하지 않는지 여부(음성)를 예측하는 것으로 정의되었다.

실험 결과

연구 질문

  • RQ1연합학습이 전체 슬라이드 이미지에서 TIL 탐지에 대해 중앙집중 학습과 유사한 성능을 달성할 수 있는가?
  • RQ2다양한 종양 유형 간의 데이터 이질성이 연합 환경에서 기관별 모델의 성능에 미치는 영향은 어떠한가?
  • RQ3연합학습을 통해 훈련된 글로벌 공의 모델이 개별 기관 모델보다 균형 잡힌 정확도에서 뛰어난 성능을 보일 수 있는가?
  • RQ4연합 모델이 생성한 TIL 히트맵은 중앙집중 모델의 결과와 정성적으로 어떻게 유사한가?
  • RQ5연합학습이 유비칼 메라놀로마(UVM)와 같이 데이터가 제한적이거나 불균형한 기관의 모델 성능 향상에 효과적으로 기여할 수 있는가?

주요 결과

  • 연합 공의 모델은 균형 잡힌 분류 정확도 89.4%를 기록하였으며, 이는 개별 기관 모델의 평균 정확도(85.7%)를 초월하였다.
  • 유비칼 메라놀로마(UVM) 전용으로만 훈련된 사이트 6는 로컬 검증 세트에서 완벽한 정확도를 달성하여, 모델이 음성 케이스에 대해 특이도를 잘 유지하고 있음을 확인하였다.
  • 연합 모델이 생성한 TIL 히트맵은 중앙집중 모델의 결과와 매우 유사하여 강력한 정성적 일치를 보였다.
  • 사이트 7의 모델은 TIL 예측에 더 보수적인 경향을 보였으며, 이는 현지 데이터 분포가 모델 행동에 영향을 미칠 수 있음을 시사한다.
  • 사이트 4와 8은 WSI의 왼쪽 영역에서 TIL 수가 증가한 유사한 TIL 맵을 생성하여, 해당 기관에서의 도메인 이동 또는 데이터 편향이 존재할 가능성을 시사한다.
  • 연합 접근법은 UVM와 같이 데이터가 제한된 기관들이 글로벌 지식을 공유함으로써 지역적 능력 이상의 모델 강건성을 확보할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.