Skip to main content
QUICK REVIEW

[논문 리뷰] Constrained Differentially Private Federated Learning for Low-bandwidth Devices

Raouf Kerkouche, Gergely Ács|arXiv (Cornell University)|2021. 02. 27.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 모델 업데이트를 상위-K 가중치로만 제한함으로써 통신 대역폭을 최대 99.9% 감소시키면서도 모델 정확도를 유지하는, 차별적 개인정보보호를 갖춘 분산 학습 기법인 FL-TOP-DP를 제안한다. 이 방법은 클라이언트 수준의 차별적 개인정보보호를 통해 이론적 개인정보 보호 보장을 제공하며, 저대역폭 모바일 장치에 최적화되어 있다.

ABSTRACT

Federated learning becomes a prominent approach when different entities want to learn collaboratively a common model without sharing their training data. However, Federated learning has two main drawbacks. First, it is quite bandwidth inefficient as it involves a lot of message exchanges between the aggregating server and the participating entities. This bandwidth and corresponding processing costs could be prohibitive if the participating entities are, for example, mobile devices. Furthermore, although federated learning improves privacy by not sharing data, recent attacks have shown that it still leaks information about the training data. This paper presents a novel privacy-preserving federated learning scheme. The proposed scheme provides theoretical privacy guarantees, as it is based on Differential Privacy. Furthermore, it optimizes the model accuracy by constraining the model learning phase on few selected weights. Finally, as shown experimentally, it reduces the upstream and downstream bandwidth by up to 99.9% compared to standard federated learning, making it practical for mobile systems.

연구 동기 및 목표

  • 저대역폭 환경에서 표준 분산 학습의 높은 통신 비용 문제를 해결하기 위해, 특히 모바일 및 자원 제한된 장치를 대상으로 한다.
  • 모든 파라미터가 아닌 고정된 소수의 모델 가중치 하위 집합에 집중하여 학습함으로써, 차별적 개인정보보호 하에서 모델 정확도를 향상시키기 위해 노력한다.
  • 모든 파라미터에 노이즈를 적용하는 것과는 달리, 가장 중요한 가중치 업데이트에만 노이즈를 적용함으로써, DP-FL에서 흔히 발생하는 정확도 저하를 최소화하면서 강력한 이론적 개인정보 보호 보장을 제공한다.
  • 모든 라운드에서 일관되고 최소한의 데이터 전송을 보장함으로써, 안정적인 보안 집계 프로토콜과의 효율적 통합을 가능하게 한다.
  • 업스트림 및 다운스트림의 통신 오버헤드를 모두 줄여, 실세계의 모바일 및 엣지 환경에 적합한 분산 학습을 실현한다.

제안 방법

  • 각 학습 라운드에서 크기 또는 기울기 기여도 기반으로 고정된 상위-K 모델 가중치를 선택하여 업데이트하고, 나머지 가중치는 일정하게 유지한다.
  • 클라이언트에서 서버로 전송되는 것은 오직 이 상위-K 가중치 업데이트에 한정되며, 이로 인해 통신 볼륨이 극적으로 감소한다.
  • 서버는 클라이언트의 데이터 크기 기반 가중 평균을 사용하여 이러한 선택적 업데이트를 집계함으로써 모델 수렴을 유지한다.
  • 차별적 개인정보보호는 오직 상위-K 가중치 업데이트에만 보정된 노이즈를 추가함으로써 구현되며, 이로 인해 모델 정확도에 미치는 영향을 최소화한다.
  • 지역적 DP 접근 방식에 비해 필요한 노이즈 예산을 줄일 수 있도록, 보안 집계와 원활하게 통합된다.
  • 상위 가중치의 희소성과 안정성을 활용하여, 통신이 감소한 상황에서도 모델 성능을 유지한다.

실험 결과

연구 질문

  • RQ1모델 업데이트를 상위-K 가중치로만 제한함으로써, 분산 학습에서 통신 대역폭을 크게 줄일 수 있을까? 이 과정에서 모델 정확도가 떨어지지 않는가?
  • RQ2모든 파라미터에 노이즈를 적용하는 것과는 달리, 가장 중요한 가중치 업데이트에만 노이즈를 적용함으로써, 전체 파라미터에 노이즈를 적용하는 것보다 정확도가 향상되는가?
  • RQ3선택적 가중치 업데이트와의 조합을 통해 보안 집계를 얼마나 효과적으로 통합할 수 있을까? 이로 인해 개인 정보 보호 오버헤드가 얼마나 감소하는가?
  • RQ4실제 데이터셋에서, 제안된 방법이 대역폭 감소 및 개인 정보 보호-정확도 트레이드오프 측면에서 얼마나 잘 스케일링되는가?
  • RQ5저대역폭 모바일 및 엣지 장치에 실질적으로 구현 가능할까? 이 과정에서 강력한 개인정보 보호 보장을 유지할 수 있는가?

주요 결과

  • 제안된 FL-TOP-DP 기법은 표준 분산 학습 대비 업스트림 및 다운스트림 통신 대역폭을 최대 99.9%까지 감소시켰다.
  • 상위-K 가중치에만 업데이트를 제한함으로써, 차별적 개인정보보호 노이즈가 추가된 상황에서도 높은 모델 정확도를 유지할 수 있었다.
  • 보안 집계와의 통합을 통해 지역적 DP 접근 방식보다 낮은 노이즈 예산과 더 강력한 개인정보 보호 보장을 달성할 수 있었다.
  • 120만 명의 미국 환자를 포함한 실생활 의료 데이터셋과 Fashion-MNIST 데이터셋에서의 실험을 통해, 이 방법이 대역폭 감소 및 개인정보 보존 측면에서 효과적임을 확인하였다.
  • 특히 저대역폭 환경에서 매우 효과적이었으며, 통신 및 전력 자원이 제한된 모바일 및 엣지 장치에 적합하다.
  • 특히 다운스트림 트래픽까지 압축되는 경우, 이전의 압축 기반 DP-FL 기법보다 확장성과 통신 효율성 측면에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.