Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Utility Analysis of Private CountSketch

Rasmus Pagh, Mikkel Thorup|arXiv (Cornell University)|2022. 05. 17.
Privacy-Preserving Technologies in Data참고 문헌 26인용 수 7
한 줄 요약

이 논문은 미분적 비밀유지 CountSketch의 유틸리티 분석을 향상시켜, 중앙값 추정기법을 사용할 경우 스케치 반복 횟수에 관계없이 노이즈가 독립적임을 보이며, 거의 최적에 가까운 비밀유지-유틸리티 트레이드오프를 달성한다. 오차는 원래 고차원 공간에서 비밀유지를 위해 필요한 노이즈를 더한 비공개 CountSketch와 거의 동일하여, 비밀유지 분석 및 피어 투 피어 학습에 매우 효율적이다.

ABSTRACT

Sketching is an important tool for dealing with high-dimensional vectors that are sparse (or well-approximated by a sparse vector), especially useful in distributed, parallel, and streaming settings. It is known that sketches can be made differentially private by adding noise according to the sensitivity of the sketch, and this has been used in private analytics and federated learning settings. The post-processing property of differential privacy implies that all estimates computed from the sketch can be released within the given privacy budget. In this paper we consider the classical CountSketch, made differentially private with the Gaussian mechanism, and give an improved analysis of its estimation error. Perhaps surprisingly, the privacy-utility trade-off is essentially the best one could hope for, independent of the number of repetitions in CountSketch: The error is almost identical to the error from non-private CountSketch plus the noise needed to make the vector private in the original, high-dimensional domain.

연구 동기 및 목표

  • 중앙값 추정기법을 사용할 경우, 평균 대비 비밀유지 CountSketch의 추정 오차를 분석하기 위해.
  • 기존 비밀유지 스케칭 방법에서 스케치 신뢰성(반복 횟수 증가)과 노이즈 증가 사이의 트레이드오프를 해결하기 위해.
  • 중앙값 추정기법이 반복 횟수에 관계없이 노이즈 수준을 유지함으로써 유틸리티를 향상시킬 수 있음을 보여주기 위해.
  • 비밀유지-유틸리티 트레이드오프가 거의 최적이며, 비공개 CountSketch 오차와 고차원 비밀유지에 필요한 최소 노이즈의 합과 유사한 오차를 보임을 보여주기 위해.
  • 희소 벡터 추정을 위한 비밀유지 스케칭에서 중앙값 기반 추정의 이론적 근거를 제공하기 위해.

제안 방법

  • 스케치의 L2 감도에 비례하여 스케치 출력의 각 좌표에 i.i.d. 가우시안 노이즈를 추가하기 위해 가우시안 메커니즘을 적용한다.
  • 각 좌표에 대해 평균 대신 k개의 독립적 추정기의 중앙값을 사용하여, 그 강건성과 낮은 분산을 활용한다.
  • 중앙값 추정기의 추정 오차를 스케칭 오차와 비밀유지에 기인한 노이즈 양쪽 모두로 분석한다.
  • 중앙값 추정기의 노이즈가 반복 횟수 k에 따라 증가하지 않음을 입증하며, 평균 기반 추정기와는 달리 이는 반복 횟수에 따라 다항식적으로 증가한다.
  • 총 오차가 비공개 CountSketch 오차와 원래 벡터를 비밀유지적으로 공개하기 위해 필요한 노이즈의 합과 거의 동일하다는 것을 입증한다.
  • 집중 부등식과 대칭 분포의 성질을 사용하여 실패 확률과 추정 오차를 근사한다.

실험 결과

연구 질문

  • RQ1CountSketch에서 중앙값 추정기법을 사용할 경우, 많은 반복 횟수에도 불구하고 높은 신뢰성과 함께 추정 노이즈를 줄일 수 있는가?
  • RQ2중앙값 추정기법을 사용할 경우, 비밀유지에 기인한 노이즈가 스케치 반복 횟수에 따라 증가하는가?
  • RQ3비밀유지 CountSketch의 비밀유지-유틸리티 트레이드오프는 거의 최적이며, 이론적 하한선에 가까운가?
  • RQ4중앙값 추정기법이 노이즈 수준을 k에 관계없이 유지함으로써, 신뢰성과 노이즈 사이의 트레이드오프를 제거할 수 있는가?
  • RQ5Private CountSketch의 오차는 비공개 CountSketch와 고차원 비밀유지에 필요한 노이즈와 비교해 어떻게 되는가?

주요 결과

  • 중앙값 기반 Private CountSketch의 추정 오차는 비공개 CountSketch 오차와 원래 고차원 벡터를 비밀유지적으로 공개하기 위해 필요한 노이즈의 합과 거의 동일하다.
  • 중앙값 추정기의 노이즈는 반복 횟수 k에 관계없이 독립적이다. 반면 평균 기반 추정기의 경우 노이즈는 k에 따라 다항식적으로 증가한다.
  • k = 3일 때 오차는 스케치 크기 D에 대해 제곱적으로 감소함을 확인하여, 중앙값의 분산 감소 효과를 입증한다.
  • CountSketch의 실패 확률은 k에 따라 지수적으로 감소하므로, 비밀유지 노이즈를 증가시키지 않더라도 높은 신뢰성을 확보할 수 있다.
  • 세계 도시 및 마켓 바스킷 데이터셋에 대한 실증 결과는, ε = 1 및 δ = 10⁻⁶ 조건에서 Private CountSketch의 오차가 비공개 CountSketch만큼 잘 농도를 유지함을 보여준다.
  • 이 방법은 O(t log d) 공간을 사용하여 t-희소 벡터의 비밀유지 표현을 가능하게 하며, 희소가 아닌 설정에서 이론적 최소값에 가까운 노이즈를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.