Skip to main content
QUICK REVIEW

[논문 리뷰] Castell: Scalable Joint Probability Estimation of Multi-dimensional Data Randomized with Local Differential Privacy

Hiroaki Kikuchi|arXiv (Cornell University)|2022. 12. 03.
Survey Sampling and Estimation Techniques인용 수 4
한 줄 요약

이 논문은 다차원 공동 확률 분포 추정을 위해 각 속성을 독립적으로 랜덤화하고 결과 랜덤화 행렬을 집계하는 방식으로 확장 가능한 국소 differential privacy (LDP) 기법인 Castell을 제안한다. 이 방법은 선형 계산 비용과 관리 가능한 저장 비용으로 집계된 행렬을 효율적으로 역행렬화할 수 있으며, 기존 최고 수준의 방법들인 LoPub보다 유의미하게 높은 정확도를 달성한다. 평균 추정 오차는 절단형일 경우 0.0099, 하이브리드일 경우 0.0155이며, 각각 LoPub의 0.03과 0.04에 비해 떨어진다.

ABSTRACT

Performing randomized response (RR) over multi-dimensional data is subject to the curse of dimensionality. As the number of attributes increases, the exponential growth in the number of attribute-value combinations greatly impacts the computational cost and the accuracy of the RR estimates. In this paper, we propose a new multi-dimensional RR scheme that randomizes all attributes independently, and then aggregates these randomization matrices into a single aggregated matrix. The multi-dimensional joint probability distributions are then estimated. The inverse matrix of the aggregated randomization matrix can be computed efficiently at a lightweight computation cost (i.e., linear with respect to dimensionality) and with manageable storage requirements. To overcome the limitation of accuracy, we propose two extensions to the baseline protocol, called {\em hybrid} and {\em truncated} schemes. Finally, we have conducted experiments using synthetic and major open-source datasets for various numbers of attributes, domain sizes, and numbers of respondents. The results using UCI Adult dataset give average distances between the estimated and the real (2 through 6-way) joint probability are $0.0099$ for {\em truncated} and $0.0155$ for {\em hybrid} schemes, whereas they are $0.03$ and $0.04$ for LoPub, which is the state-of-the-art multi-dimensional LDP scheme.

연구 동기 및 목표

  • 다차원 국소 differential privacy (LDP)에서 차원의 고통의 문제를 해결하기 위해 도메인 크기와 계산 비용의 지수적 증가를 극복한다.
  • 확장성과 낮은 계산 오버헤드를 유지하면서 고차원 데이터의 상호 속성 간 의존성을 유지한다.
  • 독립적 랜덤화(RR-Independent)의 정확도 한계와 고차원에서의 불가능성에 기인한 공동 랜덤화(RR-Joint) 문제를 해결한다.
  • LDP 보장을 갖는 다차원 공동 확률 분포 추정을 위한 실용적이고 효율적이며 정확한 방법을 개발한다.
  • 사용자 정의 가능한 하이브리드 및 절단형 기반으로 비밀유지 예산, 차원 수, 추정 정확도 간의 균형을 이루는 프레임워크를 제공한다.

제안 방법

  • 각 속성을 독립적으로 랜덤화하고 결과 랜덤화 행렬을 하나의 집계 행렬로 통합하는 새로운 RR 기법인 RR-Ind-Joint를 제안한다.
  • 차원 수에 비례하는 선형 계산 비용과 저장 비용 d^w를 갖는 Castell 알고리즘을 도입하여 집계된 랜덤화 행렬을 효율적으로 역행렬화한다. 이는 교차표 요구사항과 일치한다.
  • 비밀유지 예산, 차원 수, 응답자 수에 따라 RR-Independent와 RR-Ind-Joint 간에 동적으로 전환하는 하이브리드 RR 기법을 제안한다.
  • 랜덤화 행렬의 비영 요소 수를 제한하여 노이즈를 줄이고 정확도를 향상시키는 절단형 기법을 설계한다.
  • RR-Ind-Joint 및 RR-Independent 기법의 추정 오차에 대한 이론적 상한을 유도하여 파rameter 선택을 안내한다.
  • 합성 데이터와 실제 데이터셋(UCI Adult 포함)을 사용하여 다양한 차원 수, 도메인 크기, 응답자 수에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1다차원 데이터에서 속성의 독립적 랜덤화를 집계된 행렬과 결합하여 LDP 하에서 정확한 공동 확률 추정이 가능한가?
  • RQ2Castell 알고리즘이 선형 시간 복잡도와 관리 가능한 저장 비용으로 집계된 랜덤화 행렬을 효율적으로 역행렬화할 수 있는가?
  • RQ3하이브리드 기법은 비밀유지 예산, 차원 수 등 입력 파rameter에 따라 독립적 및 공동 랜덤화 전략을 적절히 전환함으로써 추정 정확도를 어떻게 향상시키는가?
  • RQ4기본 기반인 RR-Ind-Joint 및 RR-Independent에 비해 절단형 기법이 추정 오차를 얼마나 줄이는가?
  • RQ5다양한 속성 수와 비밀유지 예산에서, LoPub 및 LoCop과 같은 최고 수준의 LDP 기법과 비교해 Castell의 정확도는 어떠한가?

주요 결과

  • Castell 알고리즘은 차원 수에 비례하는 선형 계산 비용과 저장 비용 d^w를 갖는다. 이는 고차원 데이터에 대한 확장성을 보장한다.
  • UCI Adult 데이터셋에서 절단형 기법은 2~6차원 공동 확률에 대해 평균 추정 오차 0.0099를 기록했으며, 이는 LoPub의 0.03보다 뛰어나다.
  • 하이브리드 기법은 평균 오차 0.0155를 기록했으며, 이는 LoPub의 0.04보다 유의미하게 낮아 동일 조건에서 정확도 향상을 입증한다.
  • 제안된 하이브리드 기법은 비밀유지 예산과 차원 수 등의 입력 파rameter에 따라 RR-Independent와 RR-Ind-Joint 간 전환을 통해 확장성과 정확도를 효과적으로 균형 잡는다.
  • RR-Ind-Joint 및 RR-Independent 기법의 추정 오차에 대한 이론적 상한을 도출하여, 적응형 파rameter 선택의 기초를 마련했다.
  • 실험 결과 Castell은 합성 및 오픈소스 실제 데이터를 포함한 다양한 데이터셋과 구성에서 높은 정확도를 유지함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.