Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Semi-Supervised Learning for COVID Region Segmentation in Chest CT using Multi-National Data from China, Italy, Japan

Dong Yang, Ziyue Xu|arXiv (Cornell University)|2020. 11. 23.
COVID-19 diagnosis using AI참고 문헌 61인용 수 11
한 줄 요약

이 논문은 중국, 이탈리아, 일본의 다국적 데이터를 활용하여 3D 콩팥 CT 영상에서 코로나19에 영향을 받은 영역을 분할하기 위한 연합 준지도 학습 프레임워크를 제안한다. 기관 간에 원시 데이터를 공유하지 않고도 라벨이 붙은 스캔과 라벨이 없는 스캔을 모두 활용하여 공동 모델 학습을 가능하게 함으로써 일반화 능력 향상과 개인정보 보호를 달성하였으며, 중앙집중식 데이터 공유 방식의 전통적 지도 학습 방법보다 성능이 뛰어나다.

ABSTRACT

The recent outbreak of COVID-19 has led to urgent needs for reliable diagnosis and management of SARS-CoV-2 infection. As a complimentary tool, chest CT has been shown to be able to reveal visual patterns characteristic for COVID-19, which has definite value at several stages during the disease course. To facilitate CT analysis, recent efforts have focused on computer-aided characterization and diagnosis, which has shown promising results. However, domain shift of data across clinical data centers poses a serious challenge when deploying learning-based models. In this work, we attempt to find a solution for this challenge via federated and semi-supervised learning. A multi-national database consisting of 1704 scans from three countries is adopted to study the performance gap, when training a model with one dataset and applying it to another. Expert radiologists manually delineated 945 scans for COVID-19 findings. In handling the variability in both the data and annotations, a novel federated semi-supervised learning technique is proposed to fully utilize all available data (with or without annotations). Federated learning avoids the need for sensitive data-sharing, which makes it favorable for institutions and nations with strict regulatory policy on data privacy. Moreover, semi-supervision potentially reduces the annotation burden under a distributed setting. The proposed framework is shown to be effective compared to fully supervised scenarios with conventional data sharing instead of model weight sharing.

연구 동기 및 목표

  • 기관 간 데이터 이질성으로 인한 도메인 이탈 문제를 해결하기 위해 코로나19 CT 영상 분석을 위한 딥 러닝 모델의 성능을 향상시키기 위해 노력한다.
  • 민감한 환자 데이터를 이전하지 않고도 데이터 공유의 제한성과 애너테이션 부족 문제를 해결하기 위해 협업 학습을 가능하게 한다.
  • 다양한 국가에서 수집한 라벨이 붙은 스캔과 라벨이 없는 스캔을 활용하는 준지도 학습을 통해 애너테이션 부담을 줄인다.
  • 다국적 데이터를 활용한 연합 학습을 통해 다양한 인구 집단, 영상 촬영 프로토콜, 장비 간의 모델 강건성과 일반화 능력을 향상시킨다.
  • 도메인 인식 표현 학습을 통해 비코로나19 데이터셋이 모델 학습에 기여할 수 있음을 보여주며, 잘못된 양성 결과를 거부하는 데 기여한다.

제안 방법

  • 원시 CT 스캔을 공유하지 않고도 중국, 이탈리아, 일본의 세 기관 간에 딥 네ural 네트워크를 훈련하기 위해 연합 학습(FL)을 활용한다.
  • 동일한 다국적 코hort에서 유래한 라벨이 붙은 스캔(전문 영상의사가 945건 애너테이션)과 라벨이 없는 스캔(총 759건)을 함께 훈련하여 준지도 학습을 통합한다.
  • 라벨이 없는 데이터에 대해 대비 학습(self-supervised learning) 목적함수를 적용하여 특징 표현과 모델 일반화 능력을 향상시킨다.
  • 모델 가중치와 기울기만 교환하는 클라이언트-서버 FL 통신 프로토콜을 구현하여 데이터 프라이버시를 유지한다.
  • 공유 인코더와 작업별 특화 헤드를 갖춘 다중 브랜치 네트워크 아키텍처를 적용하여 분할 및 자기지도 학습 목적을 동시에 처리한다.
  • 성능과 대역폭 제약 조건의 균형을 맞추기 위해 수렴 주기(5, 10, 20, 40 에포크 단위)를 조정하여 통신 효율성을 최적화한다.

실험 결과

연구 질문

  • RQ1다양한 데이터 품질과 애너테이션 가용성으로 인해 여러 국가에 분산된 데이터에서 코로나19 영향 영역 분할 성능을 향상시키기 위해 연합 준지도 학습이 효과적으로 기여할 수 있는가?
  • RQ2비코로나19 기관에서 유래한 라벨이 없는 데이터(예: 일본의 비코로나19 데이터셋)가 모델의 일반화 능력 향상과 잘못된 양성 결과 감소에 미치는 영향은 어떠한가?
  • RQ3성능과 자원 소비의 균형을 고려할 때, 연합 학습에서 최적의 수렴 주기는 무엇인가?
  • RQ4한 국가에서의 제한된 라벨 데이터로 훈련된 모델이 다른 국가의 영상 촬영 프로토콜과 환자 인구 통계가 다른 상황에서도 얼마나 잘 일반화되는가?
  • RQ5개인정보 보호 기능을 갖춘 연합 프레임워크가 데이터 공유를 전제로 한 전통적 중앙집중식 훈련 방식보다 도메인 간 모델 강건성과 일반화 능력 측면에서 뛰어나게 성능을 발휘할 수 있는가?

주요 결과

  • 제안된 연합 준지도 학습 프레임워크는 중앙집중식 데이터 공유 방식으로 훈련된 완전 지도 학습 모델에 비해 뛰어난 일반화 성능을 달성하였으며, 데이터의 55%만 라벨이 붙어 있어도 성능이 뛰어났다.
  • 애너테이션이 없는 비지도 학습 클라이언트에서 매 5 에포크마다 모델 수렴 주기를 늘릴수록 성능 향상이 두드러지게 나타나, 자기지도 학습이 빈번한 가중치 동기화에서 유의미한 이점을 얻음을 확인하였다.
  • 모델는 도메인 이탈에 강건함을 보였으며, 한 국가의 데이터로 훈련된 모델도 다른 국가의 스캔, 특히 다른 영상 촬영 프로토콜과 환자 인구 통계를 가진 데이터에 잘 일반화되었다.
  • 일본의 비코로나19 데이터셋을 포함시킴으로써 모델의 잘못된 양성 결과 거부 능력이 향상되어, 도메인 인식 표현 학습이 특이도를 향상시킨다는 점을 입증하였다.
  • 제거 분석(ablation study) 결과, 수렴 주기를 높일수록 자기지도 학습 클라이언트의 훈련 안정성과 성능이 향상되었으며, 이는 약간의 성능 손실을 감수하는 것으로 보상되었다.
  • 3D 시각화 결과, 모델은 임상상의 코로나19 영상 소견과 일치하는 양측 다엽성 패턴의 기저막 투명도 감소 및 실질화 영역을 정확하게 분할하는 데 성공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.