[논문 리뷰] Fishing for User Data in Large-Batch Federated Learning via Gradient Magnification
이 논문은 대용량 배치에서의 연합 학습에서 개인 정보 유출을 가능하게 하는 모델에 종속되지 않는 기울기 확대 공격을 제안한다. 서버 업데이트를 조작하여 개별 사용자 데이터 포인트를 고립하고 추출할 수 있도록 한다. 이 방법은 아키텍처 변경 없이, 사용자에게 전송되는 모델 파라미터만 수정함으로써 작동하며, 배치 크기가 256에 이르는 상황에서도 높은 정밀도의 데이터 복원을 달성하여 크로스디바이스 및 크로스실 환경에서의 중요한 개인 정보 보안 취약성을 드러낸다.
Federated learning (FL) has rapidly risen in popularity due to its promise of privacy and efficiency. Previous works have exposed privacy vulnerabilities in the FL pipeline by recovering user data from gradient updates. However, existing attacks fail to address realistic settings because they either 1) require toy settings with very small batch sizes, or 2) require unrealistic and conspicuous architecture modifications. We introduce a new strategy that dramatically elevates existing attacks to operate on batches of arbitrarily large size, and without architectural modifications. Our model-agnostic strategy only requires modifications to the model parameters sent to the user, which is a realistic threat model in many scenarios. We demonstrate the strategy in challenging large-scale settings, obtaining high-fidelity data extraction in both cross-device and cross-silo federated learning.
연구 동기 및 목표
- 기존 연합 학습 개인 정보 보호 공격이 대용량 배치에서 실패하거나 비현실적인 아키텍처 수정을 요구하는 격차를 해결하기 위해.
- 신뢰할 수 없는 서버 업데이트의 위협 모델을 조사하기 위해, 서버가 사용자에게 악성으로 설계된 모델 파라미터를 전송하는 경우를 대비하기 위해.
- 클라이언트 모델의 수정 없이도 임의의 큰 배치에서 고정밀도의 데이터 추출을 가능하게 하는 실용적인, 모델에 종속되지 않는 공격을 개발하기 위해.
- 크로스디바이스 및 크로스실 연합 학습 환경에서 공격의 타당성과 효과성을 입증하기 위해.
- 개별 공격이 비대칭적인 영향을 미치는 방식을 드러내어, 이질적 또는 소수자 그룹에 속한 데이터 포인트가 더 취약함을 보여주기 위해.
제안 방법
- 공격은 대상 데이터 포인트의 기울기 기여도를 증폭시키고, 배치 내 다른 데이터 포인트의 기여도를 억제함으로써 서버의 모델 업데이트를 조작한다.
- 대상 예제가 기울기 업데이트에서 지배적으로 작용하도록 정교하게 설계된 파라미터 벡터를 사용하여, 복원 과정에서 고립될 수 있도록 한다.
- 이 방법은 모델에 종속되지 않으며, 클라이언트 모델의 아키텍처나 학습 프로세스를 수정하지 않고도 서버에서 전송하는 모델 파라미터만 수정하면 된다.
- 이미 존재하는 최적화 기반 및 분석적 복원 기법(예: APRIL)을 활용하여, 기울기 확대를 통해 대용량 배치 기울기에서 작동하도록 한다.
- 크로스디바이스 및 크로스실 환경 모두에 적용되며, ViT와 CNN을 사용한 이미지 분류 실험을 수행한다.
- 기존 방법이 기울기 혼합으로 인해 실패하는 바탕 크기 256의 배치에서 개별 데이터 포인트를 복원할 수 있도록 한다.
실험 결과
연구 질문
- RQ1모델 아키텍처 수정 없이도 대용량 배치 크기에서 기울기 복원 공격을 임의의 큰 배치 크기로 확장할 수 있는가?
- RQ2서버의 모델 업데이트에 대한 수정만으로도 대용량 배치 기울기에서 개별 데이터 포인트를 추출할 수 있는가?
- RQ3제안된 기울기 확대 전략은 크로스디바이스 및 크로스실 연합 학습 환경 모두에서 얼마나 효과적인가?
- RQ4극단적인 특징 값을 가진 데이터 포인트에 대한 공격의 영향은 어떠한가? 그리고 소수자 집단에 대해 비대칭적인 영향을 미치는가?
- RQ5표준 집계 방어 기법(예: 중앙값 집계)이 이 공격을 효과적으로 완화할 수 있는가?
주요 결과
- 제안된 피싱 공격은 배치 크기가 최대 256까지도 고해상도 이미지를 성공적으로 복원하며, ViT-Small를 사용한 ImageNet에서 Max-RPSNR 21.481을 달성한다.
- 반면 기존 APRIL 공격는 배치 크기 2에서 실패하여 Max-RPSNR 8.422로 급격히 하락함으로써 이전 방법의 근본적인 한계를 입증한다.
- 공격는 크로스디바이스 및 크로스실 환경 모두에서 효과적이며, 실제 연합 학습 환경에서 넓은 적용 가능성을 보여준다.
- 극단적인 특징 값을 가진 이질적 데이터 포인트는 중간 특징 값보다 훨씬 적은 쿼리 수(log(n))로 복원되며, 이는 개인 정보 보호에 대해 비대칭적인 영향을 미침을 시사한다.
- 표준 집계 방어 기법(예: 평균 또는 중앙값 집계)은 이 공격을 효과적으로 방지하지 못하며, 악성 파라미터 설계가 여전히 기울기 업데이트를 지배할 수 있기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.