[논문 리뷰] Practical Privacy-Preserving Gaussian Process Regression via Secret Sharing
이 논문은 수평적 및 수직적 데이터 공유 시나리오를 모두 지원하는, 비밀 분할(SS) 기반의 개인정보 보호 기반 가우시안 프로세스 회귀(PP-GPR) 프레임워크를 제안한다. '혼란 보정' 및 콜레스키 분해를 사용하는 새로운 SS 기반의 거듭제곱 및 행렬 역행렬 계산 프로토콜을 도입함으로써, 이론적 보안 보장과 실용적인 성능을 동시에 확보한 안전하고 정확하며 효율적인 GPR를 실현한다. 중규모 데이터셋에서의 실용적 성능을 입증한다.
Gaussian process regression (GPR) is a non-parametric model that has been used in many real-world applications that involve sensitive personal data (e.g., healthcare, finance, etc.) from multiple data owners. To fully and securely exploit the value of different data sources, this paper proposes a privacy-preserving GPR method based on secret sharing (SS), a secure multi-party computation (SMPC) technique. In contrast to existing studies that protect the data privacy of GPR via homomorphic encryption, differential privacy, or federated learning, our proposed method is more practical and can be used to preserve the data privacy of both the model inputs and outputs for various data-sharing scenarios (e.g., horizontally/vertically-partitioned data). However, it is non-trivial to directly apply SS on the conventional GPR algorithm, as it includes some operations whose accuracy and/or efficiency have not been well-enhanced in the current SMPC protocol. To address this issue, we derive a new SS-based exponentiation operation through the idea of 'confusion-correction' and construct an SS-based matrix inversion algorithm based on Cholesky decomposition. More importantly, we theoretically analyze the communication cost and the security of the proposed SS-based operations. Empirical results show that our proposed method can achieve reasonable accuracy and efficiency under the premise of preserving data privacy.
연구 동기 및 목표
- 다양한 데이터 공유 시나리오(수평, 수직, 예측)를 위한 통합적이고 실용적인 개인정보 보호 기반 GPR 솔루션의 부재를 해결하기 위해.
- 동형 암호, 피어드 학습, 또는 차별적 프라이버시 기반의 기존 PP-GPR 방법들이 효율성이 떨어지거나 특정 시나리오에 국한되거나 강력한 보안 보장이 부족한 점을 극복하기 위해.
- 현재의 SMPC 프레임워크에서 잘 지원되지 않는 GPR의 핵심 연산인 행렬 역행렬과 거듭제곱을 위한 비밀 분할 기반의 효율적이고 정확한 프로토콜을 설계하기 위해.
- 예측 시에 신뢰할 수 없는 클라이언트가 참여하는 상황을 포함하여, 모든 세 가지 데이터 공유 시나리오에서 모델 입력 및 출력에 대한 종단 간 개인정보 보호를 보장하기 위해.
제안 방법
- 보안 다자간 계산(SMPC)에서 정확성과 효율성을 향상시키기 위해 '혼란 보정' 전략을 활용한 새로운 SS 기반 거듭제곱 프로토콜을 제안한다.
- 콜레스키 분해 기반의 SS 기반 행렬 역행렬 알고리즘을 개발하여, GPR에서 공분산 행렬의 역행렬을 안전하고 효율적으로 계산할 수 있도록 한다.
- 기존의 SMPC 원자 요소(예: 보안 덧셈, 곱셈)와 신규로 도입한 연산을 통합하여, 모델 훈련 및 추론을 위한 완전한 개인정보 보호 기반 GPR 파이프라인을 구축한다.
- 정보 이론적 보안을 확보하고 비밀 분할을 통한 누출 최소화를 위해 두 서버 모델을 사용한다.
- 이론적 분석을 통해 표준 가정 하에 제안된 프로토콜의 보안성을 확인하고, 통신 및 계산 복잡도의 상한을 유도한다.
- 온라인 단계의 통신 및 계산을 줄이기 위해 사전 처리 기법을 적용하여 실용성을 향상시킨다.
실험 결과
연구 질문
- RQ1비밀 분할 기반 기술이 수평, 수직, 예측 공유 시나리오 전반에서 입력 및 출력 데이터의 개인정보를 보호하면서 가우시안 프로세스 회귀에 효과적으로 적용될 수 있는가?
- RQ2SMPC 환경에서 비밀 분할을 활용해 안전하고 정확하게 구현할 수 있는 GPR의 핵심 연산인 행렬 역행렬과 거듭제곱은 어떻게 설계할 수 있는가?
- RQ3제안된 PP-GPR 프레임워크의 통신 및 계산 오버헤드는 얼마나 되며, 중규모 데이터셋에서 실용적인 효율성을 확보할 수 있는가?
- RQ4기존의 FHE, FL, DP 기반 GPR와 비교했을 때, 제안된 방법은 정확도와 개인정보 보호 보장 측면에서 어떤가?
주요 결과
- 제안된 PP-GPR 프레임워크는 수평, 수직, 예측 공유를 포함한 세 가지 데이터 공유 시나리오를 모두 지원하며, 종단 간 개인정보 보호를 보장한다.
- 비밀 분할 기반 거듭제곱 프로토콜은 근사 기반 방법(예: 뉴턴-라프슨)보다 더 높은 정확도를 달성하고, 이전 연구에서 25%의 실패율을 보였던 것에 비해 오류 확률을 감소시킨다.
- 콜레스키 분해 기반의 행렬 역행렬 프로토콜은 수치적 안정성과 효율성을 확보하여 안전한 GPR 계산을 가능하게 한다.
- 실증 평가 결과, 중규모 표본 수를 가진 데이터셋에서 비공개 GPR와 비교해 합리적인 정확도와 수용 가능한 효율성을 확보하였다.
- 이론적 분석을 통해 표준 가정 하에 프로토콜의 보안성이 확인되었으며, 통신 및 계산 비용이 상한선을 갖는다.
- 특히 다양한 데이터 소유자가 서로 다른 데이터 파artition을 가진 시나리오에서, 보안 보장 및 유연성 측면에서 기존 방법들을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.