[논문 리뷰] Learning Privately over Distributed Features: An ADMM Sharing Approach
수직으로 분할된(분산된) 특징들에 대해 경험적 위험 최소화를 위한 ADMM 공유 프레임워크를 제안하여 샘플당 하나의 값만 전송함으로써 프라이버시를 가능하게 하고 차등 프라이버시 변형을 제공한다.
Distributed machine learning has been widely studied in order to handle exploding amount of data. In this paper, we study an important yet less visited distributed learning problem where features are inherently distributed or vertically partitioned among multiple parties, and sharing of raw data or model parameters among parties is prohibited due to privacy concerns. We propose an ADMM sharing framework to approach risk minimization over distributed features, where each party only needs to share a single value for each sample in the training process, thus minimizing the data leakage risk. We establish convergence and iteration complexity results for the proposed parallel ADMM algorithm under non-convex loss. We further introduce a novel differentially private ADMM sharing algorithm and bound the privacy guarantee with carefully designed noise perturbation. The experiments based on a prototype system shows that the proposed ADMM algorithms converge efficiently in a robust fashion, demonstrating advantage over gradient based methods especially for data set with high dimensional feature spaces.
연구 동기 및 목표
- 특성들이 본질적으로 다당사자에 걸쳐 분산되어 있어 원시 데이터를 공유할 수 없는 상황에서의 학습 필요성 동기화.
- 수직으로 분할된 데이터에서 경험적 위험을 최소화하되 공유 정보는 최소화하는 ADMM 기반 알고리즘 개발.
- 비합성 손실 아래에서도 병렬 ADMM 공유의 수렴 보장을 확립하고 차등 프라이버시 버전을 제공.
- 고차원 특징 데이터셋에서 제시된 접근법이 그래디언트 기반 방법을 능가한다는 실증적 근거 제시.
제안 방법
- 분산 특징으로 경험적 위험 최소화를 z라는 보조 변수로 제약 문제로 재구성.
- 각 당사자는 로컬 변수 x_m을, 중앙 노드는 z와 이중 변수 y를 업데이트하는 병렬 ADMM 체계 사용.
- 각 당사자는 매 이터레이션마다 단일 값만 공유하여 데이터 누출 위험 감소.
- 비볼록 손실 하에서의 병렬 ADMM의 수렴성과 이터레이션 복잡도를 증명하고 기존 Gauss-Seidel 결과를 확장.
- 공유 메시지에 Gaussian 노이즈를 추가하여 (ε,δ)-DP를 달성하는 차등 프라이버시 ADMM 변형 도입.
- 수렴 분석을 위한 Lyapunov 기반 접근법 제시 및 DP를 보장하기 위한 민감도 기반 노이즈 스케일 도출.
실험 결과
연구 질문
- RQ1ADMM 기반 접근법이 원시 특징이나 로컬 모델을 공유하지 않고도 수직으로 분할된 데이터로 ERM을 해결할 수 있는가?
- RQ2비볼록 손실 설정에서 병렬 ADMM의 수렴 및 이터레이션 복잡도 보장은 무엇인가?
- RQ3중간 통신을 보호하면서도 성능 저하를 최소화하는 방식으로 ADMM 공유에 차등 프라이버시를 어떻게 통합할 수 있는가?
- RQ4고차원 특징 공간에서 ADMM 공유 방법이 그래디언트 기반 방법과 비교하여 어떤 차이를 보이는가?
주요 결과
- 병렬 ADMM 공유 알고리즘은 비볼록 손실에 대해 완만한 가정 아래 정지 해에 수렴한다.
- Lyapunov 함수를 통해 이터레이션 복잡도가 특징지어지며 ϵ-정확한 해에 도달하기까지 유한한 수의 이터레이션이 필요하다.
- Gaussian 노이즈를 사용한 차등 프라이버시 버전의 ADMM 공유는 매 이터레이션 및 T 에포크 전반에 대해 ε,δ-프라이버시를 보장한다.
- 실험은 ADMM 공유 알고리즘이 수렴하고 특히 큰 특징 공간을 가진 데이터셋에서 강건하며 고차원 설정에서 그래디언트 기반 방법을 능가하는 경우가 많음을 시사한다.
- 적당한 노이즈 섭동으로도 프라이버시를 유지하면서 수렴을 해치지 않으며 예측 정확도를 크게 희생하지 않고 프라이버시를 향상시킬 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.