Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy Preserving PCA for Multiparty Modeling

Yingting Liu, Chaochao Chen|arXiv (Cornell University)|2020. 02. 06.
Cryptography and Data Security참고 문헌 13인용 수 13
한 줄 요약

이 논문은 여러 당사자 간에 수평적으로 분할된 데이터에 대해 프라이버시를 보장하는 주성분 분석(PPPCA)을 제안하며, 동형 암호화와 비밀 분할 기법을 사용해 보안적이고 손실 없는 차원 축소를 가능하게 한다. 이 방법은 기존의 중심화된 PCA와 동일한 모델 정확도를 달성하면서도, 각 모델 유형에 맞는 재암호화 없이도 어떤 후속 기계학습 모델에도 적용 가능하다.

ABSTRACT

In this paper, we present a general multiparty modeling paradigm with Privacy Preserving Principal Component Analysis (PPPCA) for horizontally partitioned data. PPPCA can accomplish multiparty cooperative execution of PCA under the premise of keeping plaintext data locally. We also propose implementations using two techniques, i.e., homomorphic encryption and secret sharing. The output of PPPCA can be sent directly to data consumer to build any machine learning models. We conduct experiments on three UCI benchmark datasets and a real-world fraud detection dataset. Results show that the accuracy of the model built upon PPPCA is the same as the model with PCA that is built based on centralized plaintext data.

연구 동기 및 목표

  • 암호화된 데이터를 공유하지 않고도 여러 기관 간에 수평적으로 분할된 데이터에 대해 PCA를 수행하는 데 도전하는 것.
  • 각 후속 기계학습 모델에 대해 별도의 암호화 처리 비용 없이도 일반 목적의 프라이버시 보장 모델링 프레임워크를 설계하는 것.
  • PPCA의 출력 결과가 중심화된 PCA와 비교해 프라이버시 보장 및 손실 없이 유지되는지 확보하는 것.
  • PPPCA 프레임워크 내에서 두 가지 암호화 기법—동형 암호화와 비밀 분할—의 효율성과 정확도를 평가하는 것.

제안 방법

  • PPPCA는 각 당사자가 로컬에 평문 데이터를 보유하고 협업적으로 PCA를 계산하지만, 원시 데이터를 폭 lộ하지 않는 서버 지원 다자간 계산 모델을 사용한다.
  • 두 가지 암호화 기법이 사용된다: 동형 암호화(Paillier)는 암호화된 값의 안전한 덧셈을 위해, 비밀 분할은 분산 행렬 연산을 위해 사용된다.
  • 부동소수점 수는 (암호화된 지수부, 암호화되지 않은 지수부) 쌍으로 표현되어 동형 연산에서 수치 정밀도를 지원한다.
  • 이 방법은 공분산 행렬과 고유벡터를 분산 방식으로 계산하여, 어느 한 당사자도 전체 데이터나 중간 결과를 완전히 파악하지 못하도록 보장한다.
  • 최종적으로 차원 축소된 데이터는 데이터 소비자에게 공유되며, 이는 추가적인 암호화 처리 없이도 어떤 기계학습 모델이라도 직접 훈련할 수 있도록 한다.
  • 이 프로토콜은 솔직하지만 호기심 있는 공격자 모델을 기반으로 하여, 수동 공격자에 대한 프라이버시를 보장한다.

실험 결과

연구 질문

  • RQ1PPPCA를 사용해 구축한 모델의 정확도가 평문 데이터에 대한 중심화된 PCA와 동일한가?
  • RQ2당사자 수가 증가함에 따라 동형 암호화 기반 PPPCA와 비밀 분할 기반 PPPCA의 계산 효율성은 어떻게 비교되는가?
  • RQ3PPPCA의 출력 결과는 성능 손실 없이 다양한 기계학습 모델(예: 로지스틱 회귀, GBDT, DNN)에 직접 사용될 수 있는가?
  • RQ4두 가지 암호화 방법(HE 및 SS)은 데이터 크기와 당사자 수 증가에 따라 어떻게 스케일링되는가?

주요 결과

  • PPPCA 출력을 기반으로 한 모델 정확도는 중심화된 PCA와 구분할 수 없다: 사기 탐지의 AUC는 중심화된 경우 0.9663, PPPCA-HE는 0.9692, PPPCA-SS는 0.9613이었다.
  • APS 데이터셋에서 PPPCA는 AUC 0.9915(중심화), 0.9918(HE), 0.9906(SS)를 기록하여 성능 손실가 최소한이었다.
  • 와인 데이터셋(회귀)에서 RMSE는 중심화된 경우 0.7122, HE 기반은 0.7103, SS 기반은 0.7126이었으며, 이는 손실 없는 변환을 확인한다.
  • 당사자 수 증가에 따라 HE 기반 방법이 더 효율적으로 스케일링되었다: 2명일 때 3.16초에서 4명일 때 3.36초로 증가한 반면, SS 기반 방법은 2.91초에서 3.42초로 증가했다.
  • PPPCA는 다양한 모델에 대한 결과를 직접 사용할 수 있게 해주었다: GBDT는 중심화된 경우 AUC 0.9941, HE 기반은 0.9943, SS 기반은 0.9948이었으며, 높은 호환성을 보였다.
  • 비밀 분할 방법은 당사자 수가 적을 때는 초기에 더 빠르지만, 당사자 수 증가에 따라 매트릭스 재배치 과정에서의 통신 오버헤드로 인해 상당히 느려졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.