Skip to main content
QUICK REVIEW

[논문 리뷰] The Price of Differential Privacy under Continual Observation

Palak Jain, Sofya Raskhodnikova|arXiv (Cornell University)|2021. 12. 01.
Privacy-Preserving Technologies in Data참고 문헌 26인용 수 4
한 줄 요약

이 논문은 두 가지 기본 문제인 MaxSum 및 SumSelect에 대해, 연속적 배포 메커니즘의 오차에 대한 처음으로 강력한 하한을 확립한다. 이는 배치 모델 대비 worst-case 오차가 Ω̃(T^{1/3}) 배 더 크며, 이는 이전에 알려진 다항로그 상한을 훨씬 넘는 큰 격차를 의미한다. 또한 저자들은 적응형 연속적 배포 모델에서 상응하는 상한을 제시하여, 이 오차 상호보상 관계가 더 강력한 프라이버시 요구 조건 하에서도 피할 수 없다는 것을 보여준다.

ABSTRACT

We study the accuracy of differentially private mechanisms in the continual release model. A continual release mechanism receives a sensitive dataset as a stream of $T$ inputs and produces, after receiving each input, an accurate output on the obtained inputs. In contrast, a batch algorithm receives the data as one batch and produces a single output. We provide the first strong lower bounds on the error of continual release mechanisms. In particular, for two fundamental problems that are widely studied and used in the batch model, we show that the worst case error of every continual release algorithm is $ ilde Ω(T^{1/3})$ times larger than that of the best batch algorithm. Previous work shows only a polylogarithimic (in $T$) gap between the worst case error achievable in these two models; further, for many problems, including the summation of binary attributes, the polylogarithmic gap is tight (Dwork et al., 2010; Chan et al., 2010). Our results show that problems closely related to summation -- specifically, those that require selecting the largest of a set of sums -- are fundamentally harder in the continual release model than in the batch model. Our lower bounds assume only that privacy holds for streams fixed in advance (the "nonadaptive" setting). However, we provide matching upper bounds that hold in a model where privacy is required even for adaptively selected streams. This model may be of independent interest.

연구 동기 및 목표

  • 연속적 배포 모델에서의 차별적 프라이버시 정확도 비용을 배치 모델과 비교하여 이해하는 것.
  • 특히 최대 합을 선택해야 하는 문제들에 관해 합계 관련 오차 상한의 근본적 한계를 규명하는 것.
  • 비적응형 및 적응형 입력 설정 하에서 연속적 배포 메커니즘의 알려진 상한과 하한 사이의 격차를 메우는 것.
  • 더 강력한 위협 모델에서도 하한이 날카로운지 보여주기 위해 적응형 프라이버시 요구 조건을 만족하는 상한을 개발하는 것.
  • 실시간 데이터 분석에서 차별적 프라이버시 하의 프라이버시와 정확도 간의 상호보상 관계를 체계화하고 분석하는 것.

제안 방법

  • 배치 모델에서의 1-way marginal query 문제를 연속 모델의 MaxSum 및 SumSelect 문제로의 감소를 통해 하한을 증명한다.
  • 적대적 입력을 포함한 철저히 구성된 입력 스트림을 사용하여, 고정된(비적응형) 스트림에서도 프라이버시가 유지되더라도 연속 메커니즘에서 높은 오차를 유도한다.
  • 이진 트리 메커니즘과 주기적 재계산을 이용한 지수적 메커니즘을 활용해 적응형 연속적 배포 메커니즘을 설계한다. 이는 상위-k 선택에 사용된다.
  • 농도 불확실성 부등식(예: 정규분포 및 라플라스 랜덤 변수에 대해)을 적용하여 프라이버시 제약 조건 하에서 메커니즘의 오차를 근사한다.
  • zCDP 및 순수 DP에 대한 프라이버시 조합 정리(privacy composition theorems)를 적용하여, 입력이 적응적으로 선택되더라도 메커니즘이 여전히 차별적 프라이버시를 만족함을 증명한다.
  • 재계산 횟수와 노이즈 수준의 균형을 조정하여 점점 더 날카로운 점근적 오차율을 도출한다.

실험 결과

연구 질문

  • RQ1MaxSum 및 SumSelect 문제에 대해 연속적 배포 모델에서의 차별적 프라이버시 정확도 비용은 배치 모델 대비 얼마나 되는가?
  • RQ2합계 관련 문제에 대해 연속적 모델과 배치 모델 간의 격차가 T에 대해 다항로그를 초월하여 더 클 수 있는가?
  • RQ3MaxSum 및 SumSelect 문제에 대해 Ω̃(T^{1/3}) 오차 하한이 적응형 입력 선택 조건 하에서도 날카로운가?
  • RQ4하한 오차를 충족시키는 동시에 적응형 입력 스트림 하에서도 프라이버시를 유지하는 상한을 구성할 수 있는가?
  • RQ5적응형 연속적 배포 모델에서 오차는 프라이버시 파라미터(예: ρ, ε)와 문제 파라미터(예: d, T)에 따라 어떻게 척도화되는가?

주요 결과

  • MaxSum에 대해 어떤 차별적 프라이버시 연속적 배포 메커니즘도 최악의 경우 오차가 최적의 배치 알고리즘 대비 Ω̃(T^{1/3}) 배 더 크다.
  • SumSelect에 대해서도 오차는 여전히 배치 모델 대비 Ω̃(T^{1/3}) 배 더 크며, 최대 합을 선택하는 데서의 근본적 난이도를 보여준다.
  • 비적응형 설정에서도 하한이 유지되며, 이는 문제 자체의 본질적 난이도를 시사한다.
  • 적응형 연속적 배포 모델에서 상응하는 상한이 달성되어, Ω̃(T^{1/3}) 오차 격차가 날카로운 것으로 밝혀진다.
  • zCDP 모델에서는 오차가 O(min{T, T^{1/3} log^{2/3}(dT)/ρ^{1/3}})이며, 순수 DP 모델에서는 O(√(T log T)/ε)이다. 이는 하한과 로그 인자 외에는 정확히 일치한다.
  • 결과적으로, 실시간 공중 보건 데이터 스트림에서 가장 흔한 질병을 식별하는 것과 같은 합계 중에서 최대값을 선택해야 하는 문제들은 연속적 환경에서 프라이버시를 보호하는 데 근본적으로 더 어려운 문제임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.