[논문 리뷰] Distributed Privacy-Preserving Prediction.
이 논문은 분산 차등 보장 및 동형 암호화를 사용하여 원시 데이터나 모델 파라미터에 접근하지 않고도 신뢰할 수 없는 집계자가 여러 모델의 예측을 결합할 수 있도록 하는 분산 개인정보 보호 예측(DPPP) 프레임워크를 제안한다. 이 프레임워크는 성능이 비공개 기준과 유사한 수준을 유지하면서도 강력한 개인정보 보호 보장을 달성한다.
In privacy-preserving machine learning, individual parties are reluctant to share their sensitive training data due to privacy concerns. Even the trained model parameters or prediction can pose serious privacy leakage. To address these problems, we demonstrate a generally applicable Distributed Privacy-Preserving Prediction (DPPP) framework, in which instead of sharing more sensitive data or model parameters, an untrusted aggregator combines only multiple models' predictions under provable privacy guarantee. Our framework integrates two main techniques to guarantee individual privacy. First, we improve the previous analysis of the Binomial mechanism to achieve distributed differential privacy. Second, we utilize homomorphic encryption to ensure that the aggregator learns nothing but the noisy aggregated prediction. We empirically evaluate the effectiveness of our framework on various datasets, and compare it with other baselines. The experimental results demonstrate that our framework has comparable performance to the non-private frameworks and delivers better results than the local differentially private framework and standalone framework.
연구 동기 및 목표
- 원시 데이터나 모델 파라미터를 공유할 경우 민감한 정보가 泄露되는 협업 기계학습 환경에서의 개인정보 유출 문제를 해결하기 위해.
- 개별 모델 출력물이나 파라미터를 드러내지 않고도 여러 당사자로부터의 예측을 안전하게 집계할 수 있도록 하기 위해.
- 신뢰할 수 없는 집계자가 존재하는 분산 환경에서도 증명 가능한 개인정보 보호 보장을 제공하기 위해.
- 비공개 학습 프레임워크와 유사한 높은 예측 성능을 유지하기 위해.
- 엔드 투 엔드 개인정보 보호를 위해 분산 차등 보장과 동형 암호화를 통합하기 위해.
제안 방법
- 다양한 당사자 간에 분산 차등 보장을 달성하기 위해 이항 기법의 개선된 분석을 적용한다.
- 동형 암호화를 사용하여 집계자가 개별 기여도를 알 수 없도록 하면서도 예측의 노이즈가 섞인 합계를 계산할 수 있도록 한다.
- 각 당사자는 이항 기법을 사용하여 국소적으로 개인정보 보장된 예측을 계산함으로써 개인의 개인정보를 보호한다.
- 집계자는 이러한 노이즈가 섞인 예측을 동형 방식으로 집계하여 전체 과정에서 개인정보를 유지한다.
- 시스템은 중간 단계나 개별 데이터의 泄露 없이 오직 최종 집계된 예측 결과만 공개하도록 보장한다.
- 이 프레임워크는 다양한 기계학습 모델과 데이터셋에 일반적으로 적용 가능하도록 설계되어 있다.
실험 결과
연구 질문
- RQ1어떻게 분산 환경에서 안전하고 개인정보 보호된 예측 집계를 실현할 수 있는가?
- RQ2원시 데이터나 모델 파라미터를 공유하지 않으면서도 증명 가능한 개인정보 보장 보장을 달성할 수 있는가?
- RQ3분산 차등 보장과 동형 암호화의 통합이 예측 정확도와 시스템 성능에 어떤 영향을 미치는가?
- RQ4분산 예측 환경에서 개인정보 보장과 유용성 사이의 상호 교환 관계는 어떠한가?
- RQ5정확도와 개인정보 보장 측면에서 제안된 프레임워크는 국소 차등 보장 및 비공개 기준 대비 어떻게 비교되는가?
주요 결과
- DPPP 프레임워크는 다양한 데이터셋에서 비공개 학습 프레임워크와 유사한 예측 성능을 달성한다.
- 정확도와 개인정보 보장 측면에서 국소 차등 보장 프레임워크와 단독 모델보다 더 우수한 성능을 제공한다.
- 분산 차등 보장과 동형 암호화의 통합을 통해 집계자는 오직 최종 노이즈가 섞인 집계된 예측 결과만을 알게 된다.
- 분산 환경에서 이항 기법의 철저한 분석을 통해 엄밀한 분석 기반으로 증명 가능한 개인정보 보장 보장을 제공한다.
- 실증적 평가를 통해 시스템이 개인의 개인정보를 보호하면서도 높은 유용성을 유지함을 확인하였다.
- 이 방법은 일반적으로 적용 가능하며 집계자에 대한 신뢰나 민감한 모델 파라미터의 공유가 필요로 하지 않는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.