Skip to main content
QUICK REVIEW

[논문 리뷰] Faster Algorithms for Privately Releasing Marginals

Justin Thaler, Jonathan Ullman|arXiv (Cornell University)|2012. 05. 08.
Privacy-Preserving Technologies in Data참고 문헌 4인용 수 19
한 줄 요약

이 논문은 실행 시간과 최소 데이터베이스 크기가 모두 d^k보다 훨씬 작고, worst-case 오차가 O(1)인 최초의 비차별적(private) 알고리즘을 제안한다. 이 알고리즘은 시간 d^{O(√k)} 내에서 작동한다. 이 방법은 저차수 다항식 근사법을 사용하여 다항식 기저의 계수에 노이즈를 추가함으로써 효율적으로 표현하고 비차별적으로 마진 쿼리를 공개한다. 이는 큰 k에 대해서도 지수적 시간보다 빠른 실행 시간을 가능하게 한다.

ABSTRACT

We study the problem of releasing $k$-way marginals of a database $D \in (\{0,1\}^d)^n$, while preserving differential privacy. The answer to a $k$-way marginal query is the fraction of $D$'s records $x \in \{0,1\}^d$ with a given value in each of a given set of up to $k$ columns. Marginal queries enable a rich class of statistical analyses of a dataset, and designing efficient algorithms for privately releasing marginal queries has been identified as an important open problem in private data analysis (cf. Barak et. al., PODS '07). We give an algorithm that runs in time $d^{O(\sqrt{k})}$ and releases a private summary capable of answering any $k$-way marginal query with at most $\pm .01$ error on every query as long as $n \geq d^{O(\sqrt{k})}$. To our knowledge, ours is the first algorithm capable of privately releasing marginal queries with non-trivial worst-case accuracy guarantees in time substantially smaller than the number of $k$-way marginal queries, which is $d^{Θ(k)}$ (for $k \ll d$).

연구 동기 및 목표

  • 비차별적 알고리즘을 설계하여 k-way 마진을 효율적으로 공개하고, 비현실적인 worst-case 정확도 보장을 제공한다.
  • 이전 방법들이 d^{Θ(k)} 또는 2^d의 비율로 실행 시간이 증가하는 지수적 실행 시간 장벽을 극복한다.
  • 비차별적 마진 공개를 위한 낮은 실행 시간과 낮은 표본 복잡도(n ≥ d^{O(√k)}隆)를 동시에 달성한다.
  • n ≪ d^k인 환경, 예를 들어 중간 크기의 k를 가진 대규모 데이터셋에 비차별적 데이터 공개의 적용 범위를 확장한다.
  • 다양한 쿼리 유형에 적용 가능한 일반적인 프레임워크를 제공하기 위해 다항식 근사를 사용한 비차별적 쿼리 공개 방법을 개발한다.

제안 방법

  • 알고리즘은 부울 입자 {0,1}^d 상의 k-way 마진 쿼리 가족을 균일하게 근사하기 위해 저차수 실수 다항식을 사용한다.
  • 쿼리 공간을 효율적으로 표현하기 위해 총 차수 O(√k log(1/α))인 단항식 기저를 구성한다.
  • 통계 쿼리 오라클을 통해 진짜 마진 카운트를 계산하고, 다항식 근사의 계수에 캘리브레이션된 라플라스 노이즈를 추가한다.
  • 계수 벡터의 ℓ1 노름을 사용하여 계수의 민감도를 제한함으로써 (ε, δ)-비차별적 보장을 확보한다.
  • 변수 수 m에서 차수 t의 단항식 수가 O(m^t)임을 활용하며, 이는 t = O(√k)일 때 k에 대해 지수적보다 작은 값을 가진다.
  • 최종 비차별적 요약은 쿼리 패턴에서 노이즈가 추가된 다항식을 평가함으로써 ±α 이내의 애드디티브 오차로 어떤 k-way 마진 쿼리라도 답변할 수 있다.

실험 결과

연구 질문

  • RQ1d^k보다 훨씬 낮은 실행 시간을 가지는 비차별적 알고리즘을 설계할 수 있는가?
  • RQ2n이 오직 d^{O(√k)}일 때, 하위지수 시간 내에 일정한 worst-case 오차(예: ±0.01)를 달성할 수 있는가?
  • RQ3다항식 근사를 사용하여 마진 쿼리의 비차별적 쿼리 공개 복잡도를 줄일 수 있는가?
  • RQ4비차별적 마진 공개에서 실행 시간, 표본 복잡도, 오차 사이의 상호 교환 관계는 무엇인가?
  • RQ5통계 쿼리 모델을 사용하여 마진 쿼리에 대해 하위지수 쿼리 복잡도를 가진 비차별적 알고리즘을 구현할 수 있는가?

주요 결과

  • 알고리즘이 실행 시간 d^{O(√k)} 내에서 작동하며, n ≥ d^{O(√k)}/ε일 경우 모든 k-way 마진 쿼리를 ±α 애드디티브 오차 내에서 답변할 수 있는 비차별적 요약을 공개한다.
  • k = d일 경우 알고리즘은 시간 2^{Õ(√d)} 내에서 작동하여, 모든 마진을 하위지수 시간 내에 공개하는 데 있어 알려진 최초의 알고리즘이다.
  • n ≥ d^{O(√k)}이고 ε가 상수일 경우, worst-case 오차가 ±0.01인 결과가 높은 확률로 달성된다.
  • 필요한 통계 쿼리 수는 d와 √k에 대해 다항식이며, k가 상수일 경우 통계 쿼리 모델에서 다항식 쿼리 복잡도로 알고리즘을 구현할 수 있다.
  • 이 방법은 단조 증가 논리합 이외의 쿼리 유형으로 일반화되며, 계수의 크기가 유한한 저차수 다항식으로 균일하게 근사 가능한 모든 쿼리 유형에 적용 가능하다.
  • Klivans와 Sherstov의 하한은 일반적인 함수 유형을 사용할 경우 더 이상의 개선이 불가능하다는 것을 시사하며, k-way 논리합에 대해 최소한 2^{Ω(√k)}의 크기를 가져야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.