[논문 리뷰] PCKV: Locally Differentially Private Correlated Key-Value Data Collection with Optimized Utility
본 논문은 최적화된 유틸리티를 갖춘 상관된 키-값 데이터를 수집하기 위한 로컬 디퍼런셜 프라이버시 프레임워크인 PCKV를 소개한다. 여기에는 PCKV-UE와 PCKV-GRR 메커니즘 및 Padding-and-Sampling 샘플링 전략이 포함된다.
Data collection under local differential privacy (LDP) has been mostly studied for homogeneous data. Real-world applications often involve a mixture of different data types such as key-value pairs, where the frequency of keys and mean of values under each key must be estimated simultaneously. For key-value data collection with LDP, it is challenging to achieve a good utility-privacy tradeoff since the data contains two dimensions and a user may possess multiple key-value pairs. There is also an inherent correlation between key and values which if not harnessed, will lead to poor utility. In this paper, we propose a locally differentially private key-value data collection framework that utilizes correlated perturbations to enhance utility. We instantiate our framework by two protocols PCKV-UE (based on Unary Encoding) and PCKV-GRR (based on Generalized Randomized Response), where we design an advanced Padding-and-Sampling mechanism and an improved mean estimator which is non-interactive. Due to our correlated key and value perturbation mechanisms, the composed privacy budget is shown to be less than that of independent perturbation of key and value, which enables us to further optimize the perturbation parameters via budget allocation. Experimental results on both synthetic and real-world datasets show that our proposed protocols achieve better utility for both frequency and mean estimations under the same LDP guarantees than state-of-the-art mechanisms.
연구 동기 및 목표
- 로컬 PRIVACY(LDP)에서 이질적인 키-값 데이터(키에 대응하는 수치 값)를 수집할 때 유틸리티-프라이버시 트레이드오프를 해결한다.
- 키와 값 간의 상관성을 활용해 프라이버시 예산 구성을 개선하고 노이즈를 줄인다.
- 대형 키 도메인을 다루는 단일 라운드 평균 추정과 개선된 샘플링을 갖춘 비인터랙티브 메커니즘을 제공한다.
- LDP 보장 하에서 평균 제곱 오차를 최소화하기 위한 거의 최적의 프라이버시 예산 배분을 가능하게 한다.
제안 방법
- 두 가지 메커니즘 PCKV-UE(Unary Encoding 기반)와 PCKV-GRR(Generalized Randomized Response 기반)를 갖춘 통합 PCKV 프레임워크를 제안한다.
- Padding-and-Sampling 전략을 사용해 보유한 쌍에서 사용자당 하나의 키-값 쌍을 샘플링하고, 큰 키 도메인을 처리한다.
- 키와 값의 perturbation이 독립적이지 않은 상관 perturbation 스킴을 구현해 더 촘촘한 프라이버시 예산 구성을 가능하게 한다.
- 보정된 합계에서 보정된 빈도수를 통해 평균을 계산하는 비인터랙티브 평균 추정기를 도출하고, 낮은 에psilon에서의 이상치 보정 방식을 적용한다.
- 추정기의 기댓값, MSE, 점근적 편향 없는 성능에 대한 이론적 분석을 제공한다.
- 엄격한 예산 구성 하에서 MSE를 최소화하기 위한 거의 최적의 예산 배분 공식을 제시하고 닫힌 형태 해를 제공한다.
실험 결과
연구 질문
- RQ1사용자가 여러 키-값 쌍을 보유하고 있을 때 LDP 하에서 높은 유틸리티를 갖는 키-값 데이터 수집은 어떻게 가능한가?
- RQ2키와 값의 상관 perturbation이 독립 perturbation보다 더 촘촘한 프라이버시 예산 구성을 가능하게 하는가?
- RQ3단일 라운드 비인터랙티브 평균 추정기가 LDP 하에서 키-값 데이터의 점근적 편향 없는 추정을 달성할 수 있는가?
- RQ4키와 값 perturbation 간의 최적 예산 배분이 빈도 및 평균 추정의 MSE를 최소화하는가?
- RQ5Padding-and-Sampling이 대형 키 도메인과 실제 데이터셋에서 유틸리티를 개선하는가?
주요 결과
- PCKV 프레임워크의 PCKV-UE 및 PCKV-GRR은 동일한 LDP 보장 하에서 빈도 및 평균 추정 모두에서 최첨단 메커니즘보다 더 나은 유틸리티를 달성한다.
- 상관 perturbation은 독립 perturbation보다 더 촘촘한 프라이버시 예산 구성을 가능하게 하여 프라이버시-유틸리티 트레이드오프를 개선한다.
- 단일 라운드 평균 추정기가 제시되었고, 보정된 평균을 보정된 빈도로 계산하고, 낮은 에psilon에서의 이상치 보정을 포함하여 점근적 편향이 없음을 보였다.
- Padding-and-Sampling은 보유한 쌍에서 하나의 키-값 쌍을 샘플링하여 대형 키 도메인에서 유틸리티를 향상시킨다.
- 닫힌 형태의 거의 최적 예산 배분은 나열된 naive 동일 분할 배분보다 우수하며 주어진 프라이버시 제약 하에서 MSE를 개선한다.
- 합성 데이터 및 실제 데이터에 대한 실험 결과는 이론적 분석과 PrivKVM 및 관련 연구 대비 유틸리티 개선을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.