Skip to main content
QUICK REVIEW

[論文レビュー] Private Counting from Anonymous Messages: Near-Optimal Accuracy with Vanishing Communication Overhead

Badih Ghazi, Ravi Kumar|arXiv (Cornell University)|Jun 8, 2021
Privacy-Preserving Technologies in Data被引用数 19
ひとこと要約

本稿では、シャッフルモデルにおける二値合計およびヒストグラム集約のための通信効率が良く、微分プライバシーを満たすアルゴリズムを提示している。近似的に最適な精度—中央モデルの性能に限りなく近い—を達成しながら、非プライベートなベースラインと同等のユーザー単位の通信量を維持している。本手法は、新たな符号化戦略とホッキースティック発散解析を用い、厳密なプライバシー制約下で誤差を最小限に抑える。

ABSTRACT

Differential privacy (DP) is a formal notion for quantifying the privacy loss of algorithms. Algorithms in the central model of DP achieve high accuracy but make the strongest trust assumptions whereas those in the local DP model make the weakest trust assumptions but incur substantial accuracy loss. The shuffled DP model (Bittau et al., 2017; Erlingsson et al., 2019; Cheu et al., 2019) has recently emerged as a feasible middle ground between the central and local models, providing stronger trust assumptions than the former while promising higher accuracies than the latter. In this paper, we obtain practical communication-efficient algorithms in the shuffled DP model for two basic aggregation primitives used in machine learning: 1) binary summation, and 2) histograms over a moderate number of buckets. Our algorithms achieve accuracy that is arbitrarily close to that of central DP algorithms with an expected communication per user essentially matching what is needed without any privacy constraints! We demonstrate the practicality of our algorithms by experimentally comparing their performance to several widely-used protocols such as Randomized Response (Warner, 1965) and RAPPOR (Erlingsson et al., 2014).

研究の動機と目的

  • 分散データ集約における通信効率、精度、プライバシーのトレードオフを扱う。
  • シャッフル微分プライバシー・モデル下での実用的プロトコルを、二値合計およびヒストグラム集約の両方のために開発する。
  • 中央モデルに近い精度を達成しながら、ローカルモデルとは異なり最小限の信頼を要する。
  • 非プライベートシステムと同等の通信量を維持するユーザー単位の通信オーバーヘッドを最小限に抑える。
  • シャッフルモデルにおけるプライバシー・精度・通信のトレードオフを理論的および実験的に検証する。

提案手法

  • ユーザー入力を制御されたノイズを含むメッセージにマッピングする新しい符号化方式を導入し、シャッフルDP下での正確な集約を可能にする。
  • ホッキースティック発散を用いて、プロトコルのプライバシー損失(ε, δ)を形式的に境界付け、(ε, δ)-微分プライバシーを保証する。
  • 非ターゲットメッセージを1つの結果に統合することで、プライバシー境界の計算の複雑さを低減するグループ化メッセージ解析を活用する。
  • O(n·polylog(n/δ)) 時間で、i.i.d. 確率変数の和の期待値の正の部分を効率的に計算するためのプルーニング技術を適用する。
  • 同じコアフレームワークを用いて、二値合計(カウント)およびマルチバケットヒストグラムの両方のプロトコルを設計する。
  • 既存のプロトコル(ランダム化応答およびRAPPOR)と比較する実験的評価により、手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1シャッフルモデルにおける二値合計のための微分プライベートプロトコルを設計できるか? その際、通信量を最小限に抑えつつ、中央モデルに近い精度を達成できるか?
  • RQ2シャッフルモデルにおいて、強いプライバシー保証を維持しながら、ユーザー単位の通信コストを最小限に抑える方法は何か?
  • RQ3通信量が制限されたシャッフルモデルにおけるヒストグラム集約の理論的限界は何か?
  • RQ4ローカルモデルおよび中央モデルを凌駆する、プライバシー・精度・通信のトレードオフを達成できるか?
  • RQ5シャッフルモデルにおける複雑なグループ化メッセージ分布のプライバシーパラメータ(ε, δ)を効率的に計算する方法は何か?

主な発見

  • 提案されたプロトコルは、中央モデルのアルゴリズムの推定誤差に限りなく近い値を達成しており、ローカルモデルのベースラインを著しく上回っている。
  • ユーザー単位の期待通信量は、漸近的に最適である—非プライベートプロトコルの通信コストと一致する。
  • 二値合計の文脈では、中央DP下での離散ラプラス機構の誤差の定数倍の範囲内で二乗誤差を達成している。
  • 最小限の通信オーバーヘッドで、中程度のバケット数のヒストグラム集約において近似的に最適な精度を実現できる。
  • 実験的評価により、精度および通信効率の両面でランダム化応答およびRAPPORを上回る優れた性能を示している。
  • グループ化メッセージ解析と期待値の正の部分の効率的計算の活用により、大規模な展開が実用的に行える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。