Skip to main content
QUICK REVIEW

[論文レビュー] Locally Differentially Private Data Collection and Analysis

Teng Wang, Jun Zhao|arXiv (Cornell University)|Jun 5, 2019
Privacy-Preserving Technologies in Data参考文献 56被引用数 8
ひとこと要約

本稿は、$(\epsilon,\delta)$-LDPモデル下での多次元数値およびカテゴリカルデータに対して、従来のガウスメカニズムに基づく手法よりも高いデータユーティリティを達成する、新しい局所的微分プライバシー(LDP)メカニズムを提案する。提案手法は、統計推定および機械学習タスクの両方において、最適ガウスメカニズムを上回る精度を示し、強いプライバシー保証のもとで平均/頻度推定およびモデル精度に顕著な向上を示している。

ABSTRACT

Local differential privacy (LDP) can provide each user with strong privacy guarantees under untrusted data curators while ensuring accurate statistics derived from privatized data. Due to its powerfulness, LDP has been widely adopted to protect privacy in various tasks (e.g., heavy hitters discovery, probability estimation) and systems (e.g., Google Chrome, Apple iOS). Although $ε$-LDP has been proposed for many years, the more general notion of $(ε, δ)$-LDP has only been studied in very few papers, which mainly consider mean estimation for numeric data. Besides, prior solutions achieve $(ε, δ)$-LDP by leveraging Gaussian mechanism, which leads to low accuracy of the aggregated results. In this paper, we propose novel mechanisms that achieve $(ε, δ)$-LDP with high utility in data analytics and machine learning. Specifically, we first design $(ε, δ)$-LDP algorithms for collecting multi-dimensional numeric data, which can ensure higher accuracy than the optimal Gaussian mechanism while guaranteeing strong privacy for each user. Then, we investigate different local protocols for categorical attributes under $(ε, δ)$-LDP. Furthermore, we conduct theoretical analysis on the error bound and variance of the proposed algorithms. Experimental results on real and synthetic datasets demonstrate the high data utility of our proposed algorithms on both simple data statistics and complex machine learning models.

研究の動機と目的

  • 信頼できないデータコーディネータ環境下における多次元データに対する効果的でない$(\epsilon,\delta)$-LDPメカニズムの欠如に対処すること。
  • 数値およびカテゴリカル属性の両方において、ガウスメカニズムを上回る性能を達成するメカニズムの設計を通じて、局所的微分プライバシーにおけるデータユーティリティを向上させること。
  • 理論的誤差および分散の境界を伴い、$(\epsilon,\delta)$-LDPのもとで正確な統計推定および機械学習を可能にすること。
  • 実データおよび合成データ上で、多様な分析および機械学習ワークロードをカバーする、提案手法の実用的優位性を示すこと。

提案手法

  • $(\epsilon,\delta)$-LDP下での多次元数値データに対して、分散を最小化するための特化したノイズ注入戦略を用いたMechanism-1およびMechanism-2を提案。
  • $(\epsilon,\delta)$-LDP下でのカテゴリカル属性のためのローカルプロトコルを設計し、複数値カテゴリを効率的なプライバシー保護のためのバイナリベクトルに変換。
  • カテゴリカルデータに対してランダム・リスポンスに基づくアプローチを採用し、強力なプライバシーを確保しながらデータユーティリティを維持。
  • 局所プライバシー下での機械学習モデル訓練のため、提案メカニズムを確率的勾配降下法(SGD)に統合。
  • 理論的分析を通じて、提案メカニズムの漸近的誤差境界および最小分散特性を導出。
  • ドメイン固有のノイズキャリブレーションを用い、ガウスメカニズムに依存せずにプライバシーとユーティリティのバランスを図る。

実験結果

リサーチクエスチョン

  • RQ1多次元数値データに対して、最適ガウスメカニズムを上回るユーティリティを達成する$(\epsilon,\delta)$-LDPメカニズムを設計可能か?
  • RQ2$(\epsilon,\delta)$-LDP下で、カテゴリカル属性を効率的かつプライバシーに配慮した方法で符号化し、データユーティリティを保持できるか?
  • RQ3提案メカニズムは、従来の手法と比較して、平均および頻度推定の精度をどの程度向上させるか?
  • RQ4提案メカニズムは、線形回帰、ロジスティック回帰、SVMといった複雑な機械学習モデルを、局所プライバシー下で高ユーティリティでサポートできるか?
  • RQ5$(\epsilon,\delta)$-LDP下で、提案メカニズムの理論的誤差および分散の挙動はいかなるものか?

主な発見

  • 線形回帰において、Mechanism-1およびMechanism-2は、最適ガウスメカニズム(Opt-GM)よりも顕著に低い平均二乗誤差(MSE)を達成しており、特に$\epsilon$が増加する際の改善が顕著である。
  • ロジスティック回帰およびSVM分類において、提案メカニズムは$\epsilon \geq 5$のとき、Opt-GMよりも非プライベートベースラインにはるかに近い誤分類率を達成している。
  • 合成データ上では、ドメインサイズ$k$が変化する状況下でも、提案メカニズムはOpt-GMよりも優れた頻度推定精度を示しており、誤差が低かった。
  • 理論的分析により、提案メカニズムが低い漸近的誤差境界および最小分散を達成しており、理論的にもガウスメカニズムを上回ることが確認された。
  • 実データセット(MXおよびBR)における実験結果は、あらゆる3つの学習タスクにおいて、さまざまなプライバシー予算下で一貫したモデル精度の向上を示した。
  • 提案メカニズムは、低$\epsilon$値でも高いデータユーティリティを維持しており、$\epsilon$が大きい場合には非プライベートベースラインに近い性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。