[논문 리뷰] Understanding Unintended Memorization in Federated Learning
이 논문은 민감한 데이터의 뜻하지 않은 기억화 현상에 대해 연합 학습(FL) 구성요소가 이를 얼마나 줄이는지 분석하기 위해 비밀 공유자 프레임워크를 적응하여 측정한다. 사용자 수준의 데이터 클러스터링, 연합 평균화(FedAvg), 사용자 수준의 차별적 프라이버시(DP)가 함께 기억화를 감소시키며, 특히 DP가 모델 유틸리티를 유지하면서도 가장 강력한 보호를 제공하는 것으로 나타났다.
Recent works have shown that generative sequence models (e.g., language models) have a tendency to memorize rare or unique sequences in the training data. Since useful models are often trained on sensitive data, to ensure the privacy of the training data it is critical to identify and mitigate such unintended memorization. Federated Learning (FL) has emerged as a novel framework for large-scale distributed learning tasks. However, it differs in many aspects from the well-studied central learning setting where all the data is stored at the central server. In this paper, we initiate a formal study to understand the effect of different components of canonical FL on unintended memorization in trained models, comparing with the central learning setting. Our results show that several differing components of FL play an important role in reducing unintended memorization. Specifically, we observe that the clustering of data according to users---which happens by design in FL---has a significant effect in reducing such memorization, and using the method of Federated Averaging for training causes a further reduction. We also show that training with a strong user-level differential privacy guarantee results in models that exhibit the least amount of unintended memorization.
연구 동기 및 목표
- 중앙 학습과 비교해 연합 학습(FL) 구성요소가 민감한 데이터의 뜻하지 않은 기억화를 어떻게 줄이는지 이해하기.
- 데이터 이질성, 최적화 방법, 차별적 프라이버시(DP)가 FL에서 기억화에 미치는 영향 평가하기.
- 수정된 비밀 공유자 프레임워크를 사용해 FL 모델의 기억화 공격에 대한 내성적 저항성 측정하기.
- DP 유무에 따라 다른 FL 구성 설정에서 모델 유틸리티와 프라이버시 간의 트레이드오프 비교하기.
- FL 설계 선택의 상호보완적 작용이 기억화 위험을 완화하는 데 어떻게 기여하는지 경험적 증거 제공하기.
제안 방법
- 비밀 공유자 프레임워크를 FL에 적응시키기 위해 사용자 선택 확률 $p_u$와 예제 교체 확률 $p_e$ 두 개의 파라미터를 도입해 캐니를 사용자 데이터에 삽입한다.
- 기록 수준 및 배치 수준 분류를 사용한 두 가지 평가 방법을 통해 모델 출력에서 기억된 캐니를 탐지한다.
- FedAvg와 확률적 경사 하강법(SGD)을 사용해 모델을 훈련하고, IID 및 Non-IID 데이터 분할에서 기억화 정도를 비교한다.
- 모델 집계 중 노이즈 주입을 통해 사용자 수준의 차별적 프라이버시(DP)를 적용해 공식적인 프라이버시 보장을 확보한다.
- 퍼플렉서티를 통해 모델 유틸리티를 측정하고, 삽입된 캐니의 탐지 비율을 통해 기억화 정도를 평가한다.
- 최소 배치 크기, 사용자 데이터 분포, DP 파라미터의 변화를 고려해 실험하여 각 요소의 영향을 분리 분석한다.
실험 결과
연구 질문
- RQ1FL에서 사용자 기반 데이터 클러스터링은 중심 학습과 비교해 뜻하지 않은 기억화에 어떤 영향을 미치는가?
- RQ2SGD 대비 FedAvg를 사용할 경우 FL에서 기억화에 어떤 영향을 미치는가?
- RQ3사용자 수준의 차별적 프라이버시를 적용할 경우 기억화가 어느 정도 감소하는가?
- RQ4다양한 훈련 설정에서 FL의 모델 유틸리티와 기억화 간 트레이드오프는 어떻게 변화하는가?
- RQ5명시적인 DP 없이도 FL의 본질적 설계 특성이 기억화를 상호보완적으로 줄일 수 있는가?
주요 결과
- FL에서 사용자 기반 데이터 클러스터링은 추가적인 프라이버시 메커니즘이 없더라도 뜻하지 않은 기억화를 상당히 감소시킨다.
- SGD에서 FedAvg로 전환하면 기억화가 더욱 감소하며, 특히 더 큰 유효 배치 크기에서 두드러진다.
- 사용자 수준의 DP로 훈련된 모델은 기억화가 가장 적으며, 100 에포크 후 캐니의 탐지 가능성이 없고 $(18.8, 10^{-7})$-DP를 달성한다.
- Non-IID 환경에서도 DP-FedAvg 모델은 10 에포크 훈련 동안 캐니의 기억화가 없었으며, 비-DP 기준 모델보다 뛰어난 성능을 보였다.
- 가장 낮은 캐니 구성 조건에서도 비밀 공유자 방법은 DP-FedAvg 모델에서 캐니를 탐지하지 못했으며, 이는 강력한 내성적 저항성을 시사한다.
- 모델 유틸리티는 모든 구성 설정에서 유사하게 유지되었으며, DP-FedAvg 모델까지 포함해 프라이버시와 성능가 서로 배타적이지 않음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.