Skip to main content
QUICK REVIEW

[論文レビュー] Lossless Compression of Efficient Private Local Randomizers

Vitaly Feldman, Kunal Talwar|arXiv (Cornell University)|Feb 24, 2021
Privacy-Preserving Technologies in Data参考文献 45被引用数 4
ひとこと要約

本稿では、標準的な暗号的仮定の下で、擬似乱数生成機(PRG)を用いて局所的微分プライバシー(LDP)ランダムライザーを損失なしに圧縮する一般化された手法を提示する。これにより、プライバシーと有効性を維持したまま通信コストをPRGのシード長にまで削減できる。特にε > 1の高プライバシー領域では、先行する圧縮LDPアルゴリズムと比較して最大5倍低い誤差を達成する。

ABSTRACT

Locally Differentially Private (LDP) Reports are commonly used for collection of statistics and machine learning in the federated setting. In many cases the best known LDP algorithms require sending prohibitively large messages from the client device to the server (such as when constructing histograms over large domain or learning a high-dimensional model). This has led to significant efforts on reducing the communication cost of LDP algorithms. At the same time LDP reports are known to have relatively little information about the user's data due to randomization. Several schemes are known that exploit this fact to design low-communication versions of LDP algorithm but all of them do so at the expense of a significant loss in utility. Here we demonstrate a general approach that, under standard cryptographic assumptions, compresses every efficient LDP algorithm with negligible loss in privacy and utility guarantees. The practical implication of our result is that in typical applications the message can be compressed to the size of the server's pseudo-random generator seed. More generally, we relate the properties of an LDP randomizer to the power of a pseudo-random generator that suffices for compressing the LDP randomizer. From this general approach we derive low-communication algorithms for the problems of frequency estimation and high-dimensional mean estimation. Our algorithms are simpler and more accurate than existing low-communication LDP algorithms for these well-studied problems.

研究の動機と目的

  • 大域的または高次元データにおける効率的なLDPアルゴリズムの高い通信コストに対処すること。
  • 特にε > 1の領域で、有効性を低下させたりεを増加させたりする、先行する圧縮技術の限界を克服すること。
  • 任意の効率的なLDPランダムライザーに対して、プライバシーと有効性の保証を維持したまま一般化可能な損失なし圧縮フレームワークを構築すること。
  • 通信制約のあるクライアント環境における、高有効性LDPメカニズムの実用的導入を可能にすること。
  • 頻度推定および高次元平均推定の両問題において、本手法の有効性を実証し、既存の低通信量アプローチを上回ること。

提案手法

  • 任意の入力に対するLDPランダムライザーRの出力分布にε近傍にある、データに依存しない基準分布ρを用意する。
  • R内の真の乱数ビットを、シードから生成された擬似乱数ビットに置き換える。
  • R(x)を模倣するために、ρからの擬似乱数サンプルに基づく棄却サンプリングを実行する。
  • R(x)とρの密度比を比較する計算的に制限されたテストを欺くために、PRGが満たすべき条件を満たすことでプライバシーを保証する。
  • 標準的な暗号的仮定(例えば、指数的強度の高いPRGの存在)を活用し、真の乱数と計算的に区別不能であることを保証する。
  • PrivUnitやPrivHSなどの具体的なLDPメカニズムに本手法を適用し、分散の代理を最小化するようにパラメータを最適化する。

実験結果

リサーチクエスチョン

  • RQ1任意の効率的なLDPランダムライザーの出力を、プライバシーも有効性も損なわず圧縮可能か?
  • RQ2擬似乱数による圧縮がε-微分プライバシーを保持するのに十分な暗号的仮定は何か?
  • RQ3本圧縮技術は、頻度推定や高次元平均推定といった代表的なLDP問題において実際の性能を示せるか?
  • RQ4特にε > 1の領域において、既存の低通信量LDPアルゴリズムよりも優れた有効性を達成できるか?
  • RQ5プライバシー予算εを複数回の実行に分割した場合、圧縮メカニズムの誤差と計算コストにどのような影響があるか?

主な発見

  • 標準的な暗号的仮定の下で、提案手法はプライバシーと有効性をほとんど損なわず保持する。
  • d=2000およびε=8の場合、代理分散が真の誤差と3.5%以内で一致しており、ノルム代理を真の誤差の正確な代理として使用できることを検証した。
  • PrivUnitOptimizedは、SQKRと比較して最大5倍、標準的なPrivUnitと比較して2.5倍低い期待二乗誤差を達成し、先行する圧縮LDPアルゴリズムを著しく上回る。
  • ε=8を二つのε=4の実行に分割すると、期待二乗誤差が約2倍に増加し、計算コストと精度のトレードオフが生じることを示した。
  • 本手法は一般性を有し、将来的に登場する効率的なLDPランダムライザーに対しても再導出を必要とせず適用可能であり、将来的な有効性および通信効率の向上を可能にする。
  • 圧縮によりメッセージサイズがPRGシードの長さにまで削減され、帯域制限のあるフェデレーテッドラーニングやデータ収集システムにおける実用的導入を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。