Skip to main content
QUICK REVIEW

[論文レビュー] Improved Utility Analysis of Private CountSketch

Rasmus Pagh, Mikkel Thorup|arXiv (Cornell University)|May 17, 2022
Privacy-Preserving Technologies in Data参考文献 26被引用数 7
ひとこと要約

この論文は、中央値推定法を用いることで、スケッチ繰り返し回数に依存しないノイズを実現し、プライバシーと効用のトレードオフをほぼ最適化することを示すことによって、プライベートなCountSketchの効用解析を改善した。誤差は、元の高次元空間でプライバシーを確保するために必要なノイズを加えた非プライベートなCountSketchとほぼ同一であり、プライベート分析やフェデレーテッドラーニングにおいて非常に効率的である。

ABSTRACT

Sketching is an important tool for dealing with high-dimensional vectors that are sparse (or well-approximated by a sparse vector), especially useful in distributed, parallel, and streaming settings. It is known that sketches can be made differentially private by adding noise according to the sensitivity of the sketch, and this has been used in private analytics and federated learning settings. The post-processing property of differential privacy implies that all estimates computed from the sketch can be released within the given privacy budget. In this paper we consider the classical CountSketch, made differentially private with the Gaussian mechanism, and give an improved analysis of its estimation error. Perhaps surprisingly, the privacy-utility trade-off is essentially the best one could hope for, independent of the number of repetitions in CountSketch: The error is almost identical to the error from non-private CountSketch plus the noise needed to make the vector private in the original, high-dimensional domain.

研究の動機と目的

  • 中央値推定法を用いる際のプライベートなCountSketchの推定誤差を分析すること。
  • 従来のプライベートスケッチ手法におけるスケッチの信頼性(繰り返し回数の増加による向上)とノイズ増加のトレードオフを解消すること。
  • 中央値推定法が繰り返し回数kに依存しないノイズレベルを実現できることを示し、効用を向上させること。
  • プライバシーと効用のトレードオフがほぼ最適であり、誤差が非プライベートなCountSketchの誤差と、高次元空間におけるプライバシーを確保するための最小限のノイズの和に近いことを示すこと。
  • スパースベクトル推定における中央値ベース推定の理論的裏付けを提供すること。

提案手法

  • スケッチのL2感度に比例してスケーリングされた、独立同一なガウスノイズを、CountSketch出力の各座標に追加するガウスメカニズムを適用する。
  • 平均ではなく、各座標に対してk個の独立な推定器の中央値を用いることで、その頑健性と低分散性を活用する。
  • 中央値推定法の推定誤差を、スケッチ誤差とプライバシーに起因するノイズの両面から分析する。
  • 平均ベースの推定法とは異なり、中央値推定法のノイズは繰り返し回数kに依存しないことを示す。
  • 総誤差が、非プライベートなCountSketchの誤差と、元のベクトルを微分的プライバシーで公開するために必要なノイズの和にほぼ等しいことを確立する。
  • 集中不等式と対称分布の性質を用いて、誤作動確率と推定誤差を上限で評価する。

実験結果

リサーチクエスチョン

  • RQ1中央値推定法を用いることで、多くの繰り返し回数があっても推定ノイズを低減しつつ高い信頼性を維持できるか?
  • RQ2中央値推定法を用いる場合、微分的プライバシーに起因するノイズはスケッチの繰り返し回数に応じて増加するか?
  • RQ3プライベートなCountSketchのプライバシーと効用のトレードオフは、理論的下限に近いか?
  • RQ4中央値推定法はkに依存しないノイズレベルを達成でき、信頼性とノイズのトレードオフを解消できるか?
  • RQ5Private CountSketchの誤差は、非プライベートなCountSketchと、高次元プライバシーを確保するためのノイズと比べてどうか?

主な発見

  • 中央値ベースのPrivate CountSketchの推定誤差は、非プライベートなCountSketchの誤差と、元の高次元ベクトルを微分的プライバシーで公開するために必要なノイズの和にほぼ等しい。
  • 中央値推定法のノイズは、繰り返し回数kに依存せず、平均ベースの推定法とは異なり、kに多項式的に依存するノイズとは対照的である。
  • k = 3の場合、誤差はスケッチサイズDの2乗に反比例して減少し、中央値による分散低減の優位性が裏付けられる。
  • CountSketchの誤作動確率はkに伴い指数関数的に減少し、プライバシーのノイズを増加させることなく高い信頼性を達成できる。
  • World Citiesおよびマーケットバスケットデータセットを用いた実験結果から、ε = 1およびδ = 10⁻⁶の条件下でも、Private CountSketchの誤差は非プライベートなCountSketchとほぼ同程度に集中していることが示された。
  • この手法により、t-スパースなベクトルをO(t log d)の空間量で微分的プライバシーを満たす形で表現可能であり、非スパース設定における理論的最小ノイズに近いノイズレベルが達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。