Skip to main content
QUICK REVIEW

[논문 리뷰] Split Learning without Local Weight Sharing to Enhance Client-side Data Privacy

Ngoc Duy Pham, Tran Khoa Phan|arXiv (Cornell University)|2022. 12. 01.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 다중 클라이언트 분할 학습에서 클라이언트 간 국소 가중치 공유를 제거함으로써 클라이언트 측 데이터 泄露를 줄이는 프라이버시 강화 분할 학습(P-SL)이라는 새로운 프레임워크를 제안한다. 클라이언트가 국소 모델 가중치를 공유하지 않도록 하여 모델 역공학 공격를 완화함으로써, 정상적인 분할 학습과 유사한 정확도를 유지하면서도 데이터 泄露를 최대 50% 감소시킨다. 서버 측 캐싱 메커니즘을 통해 비정상적인 데이터 분포와 동적 클라이언트 도착 조건에서도 안정적인 학습을 가능하게 한다.

ABSTRACT

Split learning (SL) aims to protect user data privacy by distributing deep models between client-server and keeping private data locally. In SL training with multiple clients, the local model weights are shared among the clients for local model update. This paper first reveals data privacy leakage exacerbated from local weight sharing among the clients in SL through model inversion attacks. Then, to reduce the data privacy leakage issue, we propose and analyze privacy-enhanced SL (P-SL) (or SL without local weight sharing). We further propose parallelized P-SL to expedite the training process by duplicating multiple server-side model instances without compromising accuracy. Finally, we explore P-SL with late participating clients and devise a server-side cache-based training method to address the forgetting phenomenon in SL when late clients join. Experimental results demonstrate that P-SL helps reduce up to 50% of client-side data leakage, which essentially achieves a better privacy-accuracy trade-off than the current trend by using differential privacy mechanisms. Moreover, P-SL and its cache-based version achieve comparable accuracy to baseline SL under various data distributions, while cost less computation and communication. Additionally, caching-based training in P-SL mitigates the negative effect of forgetting, stabilizes the learning, and enables practical and low-complexity training in a dynamic environment with late-arriving clients.

연구 동기 및 목표

  • 국소 가중치 공유로 인해 발생하는 다중 클라이언트 분할 학습의 심각한 프라이버시 취약점을 해결하기 위해.
  • 모델 정확도를 훼손하거나 통신 오버헤드를 증가시키지 않으면서도 클라이언트 측 데이터 프라이버시를 향상시키기 위해.
  • 특히 늦게 도착하는 클라이언트를 고려하여 분할 학습에서의 동적 클라이언트 참여를 지원하기 위해, 기록 상실 현상을 완화하기 위해.
  • 이질적이고 비독립적 동일분포(non-IID) 데이터를 가진 실세계 IoT 및 모바일 환경에 적합한 저복잡도이자 확장 가능한 학습 프레임워크를 개발하기 위해.
  • 분할 학습 환경에서 기존의 차별적 프라이버시 기법보다 뛰어난 프라이버시-정확도 트레이드오프를 제공하기 위해.

제안 방법

  • 학습 중 클라이언트 간 국소 모델 가중치 교환을 제거함으로써 데이터 泄露의 주요 원인을 제거하는 P-SL의 변종을 제안한다.
  • 공통 캐시 풀을 공유하는 다수의 서버 측 모델 인스턴스를 사용하는 병렬화된 P-SL 아키텍처를 도입하여 정확도 손실 없이 학습 속도를 향상시킨다.
  • 이전에 훈련된 클라이언트로부터의 지식을 저장하고 재사용할 수 있도록 서버 측 캐싱 메커니즘을 도입하여, 새로운 클라이언트가 참여할 경우 학습 안정성을 확보한다.
  • 지식 보존을 유지하면서도 늦게 도착한 클라이언트에 대해서만 재학습이 가능하도록 캐시 기반의 훈련 전략을 적용하여 클라이언트 측 계산 및 통신 비용을 감소시킨다.
  • 표준 SL에서 국소 가중치 공유로 인한 프라이버시 위험을 실증적으로 검증하기 위해 화이트박스 환경에서 모델 역공학 공격을 적용한다.
  • 다양한 클라이언트 참여 패턴 하에서의 강건성을 평가하기 위해 실험에서 클라이언트 순서를 무작위화하는 전략을 사용한다.

실험 결과

연구 질문

  • RQ1분할 학습에서 클라이언트 간 국소 가중치 공유가 모델 역공학 공격 상황에서 데이터 프라이버시 泄露를 어떻게 악화시키는가?
  • RQ2국소 가중치 공유 없이 설계된 분할 학습 프레임워크는 모델 정확도를 유지하면서도 클라이언트 측 데이터 泄露를 크게 줄일 수 있는가?
  • RQ3P-SL는 성능 저하 없이 학습 속도를 높이기 위해 어떻게 효율적으로 병렬화될 수 있는가?
  • RQ4초기 훈련 이후 새로운 클라이언트가 참여할 경우, 학습 안정성과 기록 상실 현상을 완화하기 위해 어떤 메커니즘이 필요한가?
  • RQ5P-SL는 비독립 동일분포(non-IID) 데이터 분포 하에서 표준 분할 학습 및 분산 학습과 비교해 어떻게 성능을 발휘하는가?

주요 결과

  • P-SL는 표준 분할 학습 대비 클라이언트 측 데이터 泄露를 최대 50% 감소시켜, 차별적 프라이버시 기법에 의존하지 않더라도 프라이버시를 크게 향상시킨다.
  • P-SL는 표준 분할 학습(SL) 및 확률적 분산 학습(SFL)과 유사한 정확도를 달성하며, 캐싱 없이 비독립 동일분포 데이터 하에서 Fashion-MNIST에서 56.1%, CIFAR-10에서 47.2%의 테스트 정확도를 기록한다.
  • 캐시 기반 P-SL 변종은 Fashion-MNIST에서 56.1%, CIFAR-10에서 47.2%의 정확도를 달성하여 학습 안정성 향상과 기록 상실 현상 완화를 입증한다.
  • 캐싱을 적용한 경우 SL과 SFL는 각각 CIFAR-10에서 92.8%와 83.2%의 높은 정확도를 기록하여, 캐싱이 비독립 동일분포 환경에서 더 나은 성능을 가능하게 한다는 것을 보여준다.
  • 캐싱 메커니즘은 저장된 지식을 재사용함으로써 늦게 도착한 클라이언트에 대한 저오버헤드 학습을 가능하게 하여 클라이언트 측 계산 및 통신 비용을 감소시킨다.
  • 병렬화된 P-SL는 공통 캐시 풀을 공유하는 다수의 서버 측 모델 인스턴스를 통해 정확도 손실 없이 학습 속도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.