Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Channel-Based Federated Learning for Medical Data Privacy Preserving

Rulin Shao, Hongyu He|arXiv (Cornell University)|2019. 10. 23.
Privacy-Preserving Technologies in Data참고 문헌 31인용 수 9
한 줄 요약

이 논문은 전체 모델 가중치 대신 노름 크기 기반으로 가장 활성도가 높은 기울기 채널만 선택적으로 업로드하는 프라이버시 보장형 피어드 페더레이티드 러닝 방법인 Stochastic Channel-Based Federated Learning (SCBF)를 제안한다. 이는 데이터 노출을 크게 줄인다. Pruning를 통합한 SCBFwP는 최소한의 성능 손실로 학습 시간을 57% 감소시키며, AUC-ROC와 AUCPR 모두에서 Federated Averaging를 능가한다. 또한 환자 데이터의 프라이버시를 유지한다.

ABSTRACT

Artificial neural network has achieved unprecedented success in the medical domain. This success depends on the availability of massive and representative datasets. However, data collection is often prevented by privacy concerns and people want to take control over their sensitive information during both training and using processes. To address this problem, we propose a privacy-preserving method for the distributed system, Stochastic Channel-Based Federated Learning (SCBF), which enables the participants to train a high-performance model cooperatively without sharing their inputs. Specifically, we design, implement and evaluate a channel-based update algorithm for the central server in a distributed system, which selects the channels with regard to the most active features in a training loop and uploads them as learned information from local datasets. A pruning process is applied to the algorithm based on the validation set, which serves as a model accelerator. In the experiment, our model presents better performances and higher saturating speed than the Federated Averaging method which reveals all the parameters of local models to the server when updating. We also demonstrate that the saturating rate of performance could be promoted by introducing a pruning process. And further improvement could be achieved by tuning the pruning rate. Our experiment shows that 57% of the time is saved by the pruning process with only a reduction of 0.0047 in AUCROC performance and a reduction of 0.0068 in AUCPR.

연구 동기 및 목표

  • 학습 및 추론 과정에서 원시 데이터와 모델 파라미터의 노출를 최소화하여 의료 분야의 페더레이티드 러닝에서의 프라이버시 유출 문제를 해결한다.
  • 업로드된 모델 업데이트로부터 민감한 데이터를 재구성할 수 있는 역모델링 공격의 위험을 완화한다.
  • 모델 성능을 희생시키지 않은 채 페더레이티드 시스템의 학습 효율성을 향상시킨다.
  • 채널 기반 기울기 선택과 통합된 새로운 프루닝 과정을 통해 수렴 속도를 가속화하고 계산 오버헤드를 감소시킨다.
  • 선택적이고 확률적인 채널 업로드 방식이 페더레이티드 러닝에서 전체 파라미터 평균화보다 높은 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 학습 중 모든 레이어를 통해 기울기 채널의 L2 노름 크기를 기반으로 업로드할 채널을 선별하며, 특히 가중치 업데이트가 가장 큰 채널을 우선순위로 한다.
  • α-분위수 기반 임계값을 사용해 무작위 채널 선택 전략을 적용함으로써, 가장 활성도가 높은 기능만 공유되도록 보장한다.
  • 기울기 처리 전략을 두 가지 적용: 음성 선택(낮은 노름 채널 제거) 및 양성 선택(선택되지 않은 채널 0으로 설정).
  • 검증 세트 성능을 기반으로 구조 감소를 유도하는 APoZ(Activation-based Pruning of Zeros) 기반 프루닝 과정을 도입하여 각 학습 루프당 10%의 뉴런을 제거한다.
  • 서버 측 집계 메커니즘을 사용하여 모든 클라이언트의 처리된 기울기를 합산해 글로벌 모델을 업데이트함으로써 라운드 간 모델 일관성을 유지한다.
  • 모델 효율성과 성능의 균형을 맞추기 위해 총 프루닝 비율을 47%로, 루프당 프루닝 비율을 10%로 설정한다.

실험 결과

연구 질문

  • RQ1의료 페더레이티드 러닝에서 높은 영향력을 미치는 기울기 채널만 선택적으로 업로드하는 방식이 모델 성능을 유지하면서도 프라이버시 위험을 줄일 수 있는가?
  • RQ2전체 파라미터 평균화(예: Federated Averaging)와 비교할 때, 무작위 채널 기반 업데이트 메커니즘은 수렴 속도와 최종 성능 면에서 어떻게 다른가?
  • RQ3신경망 프루닝이 프라이버시 보장형 페더레이티드 러닝 프레임워크에서 학습 가속화와 통신 오버헤드 감소에 얼마나 기여할 수 있는가?
  • RQ4SCBF 프레임워크에 프루닝을 적용할 경우, 학습 시간 단축과 성능 저하 사이의 상충 관계는 어느 정도인가?
  • RQ5모델 파라미터 노출를 제한함으로써 제안된 방법이 역모델링 공격에 효과적으로 저항할 수 있는가?

주요 결과

  • SCBF는 채널의 10%만 업로드함으로써 AUC-ROC 0.9776, AUCPR 0.9695를 달성하여, 모든 파라미터를 업로드하는 Federated Averaging를 능가했다.
  • 프루닝을 통합한 SCBFwP는 AUC-ROC 0.9825, AUCPR 0.9763로 가장 높은 최종 성능을 기록하여, SCBF 및 FA 모두를 능가하는 모델 품질을 확보했다.
  • 프루닝 과정으로 인해 SCBF의 학습 시간은 57% 감소했고, FA의 경우 48% 감소하여 계산 효율성이 크게 향상되었다.
  • 소량의 성능 저하가 있었음에도 불구하고, AUCROC 감소는 0.0047, AUCPR 감소는 0.0068에 그쳐 속도와 정확도 사이의 유리한 트레이드오���잉을 보였다.
  • SCBF는 Federated Averaging보다 더 빨리 포화 상태에 도달하여 첫 5개 학습 루프 내에 더 높은 성능을 달성함으로써 수렴 속도 향상을 입증했다.
  • Federated Averaging 대비 정보 교환을 85% 감소시켰으며, AUC-ROC 및 AUCPR 지표에서 최신 기술 수준의 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.