Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Distributed Data Summarization under Covariate Shift

Kanthi Sarpatwar, Karthikeyan Shanmugam|arXiv (Cornell University)|Oct 28, 2019
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本稿では、共変量シフト下での分散データ要約のためのプライバシー保護プロトコルを提案する。信頼できるキュレーターが、プライベートなデータへのアクセスを最小限に抑えつつ、ターゲットの検証セットに近い要約データセットを構築できる。この手法は、Rahimi-Rechtのランダム特徴量と高度なDPメカニズムを用い、$(\epsilon,\delta)$-微分プライバシーを達成し、$O(K^{1/3}|D_s| + |D_v|)$ のデータアクセスで実現する。MNISTにおけるMMDと精度の面で、均等サンプリングを10–15%上回る性能を示す。

ABSTRACT

We envision AI marketplaces to be platforms where consumers, with very less data for a target task, can obtain a relevant model by accessing many private data sources with vast number of data samples. One of the key challenges is to construct a training dataset that matches a target task without compromising on privacy of the data sources. To this end, we consider the following distributed data summarizataion problem. Given K private source datasets denoted by $[D_i]_{i\in [K]}$ and a small target validation set $D_v$, which may involve a considerable covariate shift with respect to the sources, compute a summary dataset $D_s\subseteq \bigcup_{i\in [K]} D_i$ such that its statistical distance from the validation dataset $D_v$ is minimized. We use the popular Maximum Mean Discrepancy as the measure of statistical distance. The non-private problem has received considerable attention in prior art, for example in prototype selection (Kim et al., NIPS 2016). Our work is the first to obtain strong differential privacy guarantees while ensuring the quality guarantees of the non-private version. We study this problem in a Parsimonious Curator Privacy Model, where a trusted curator coordinates the summarization process while minimizing the amount of private information accessed. Our central result is a novel protocol that (a) ensures the curator accesses at most $O(K^{\frac{1}{3}}|D_s| + |D_v|)$ points (b) has formal privacy guarantees on the leakage of information between the data owners and (c) closely matches the best known non-private greedy algorithm. Our protocol uses two hash functions, one inspired by the Rahimi-Recht random features method and the second leverages state of the art differential privacy mechanisms. We introduce a novel "noiseless" differentially private auctioning protocol for winner notification and demonstrate the efficacy of our protocol using real-world datasets.

研究の動機と目的

  • 複数の分散的でプライベートなデータソースから、共変量シフトを伴うターゲットの検証セットに一致する、プライベートで高品質な学習データセットを構築する課題に対処すること。
  • データ所有者間の強い微分プライバシー保証を確保するとともに、キュレーターのデータアクセスを必要な最小限に抑えること。
  • 要約データセットと検証データセットの間の最大平均差異(MMD)を最小化する非プライベートなグリーディアルゴリズムの性能に匹敵するプロトコルを開発すること。
  • 最終選定にノイズを追加しない「ノイズレス」の微分プライベートオークションメカニズムを導入し、その独自の価値を示すこと。

提案手法

  • プロトコルは二段階のハッシュ機構を用いる:第一に、Rahimi-Rechtのランダム特徴量に基づくハッシュ関数により、データを低次元空間にマップし、効率的な比較を可能にする。
  • 第二に、最新の微分プライベートメカニズムを活用したハッシュ関数により、キュレーターとのやり取りにおけるデータのプライバシーを保証する。
  • キュレーターは、データ所有者と繰り返しハッシュ交換を行い、検証セットとのMMDを最小化する代表的なデータポイントを同定・選択する。
  • 新たな「ノイズレス」の微分プライベートオークションプロトコルを導入し、最終選定にノイズを追加せずに、勝者をプライベートに通知する。
  • アルゴリズムは、ハッシュ空間内でMMD最小化をガイドにグリーディ選択戦略を用い、要約データセット $D_s$ を構築する。
  • 理論的分析により、キュレーターがアクセスするデータポイント数が $O(K^{1/3}|D_s| + |D_v|)$ に制限され、露出リスクが顕著に低減することが示された。

実験結果

リサーチクエスチョン

  • RQ1共変量シフト下で分散データを要約するための微分プライベートプロトコルを設計可能か? また、データ所有者間の強いプライバシー保証を維持できるか?
  • RQ2信頼できるキュレーターがアクセスするデータポイント数を、要約データセットの品質を損なわず最小限に抑える方法は何か?
  • RQ3微分プライベートプロトコルは、非プライベートなグリーディアルゴリズムがMMDを最小化する性能に、どの程度まで近づけるか?
  • RQ4ノイズを追加しない微分プライベートオークションメカニズムを構築可能か? また、選定品質の低下を防ぎながらプライバシーを確保できるか?

主な発見

  • 提案されたプロトコルは、MNISTデータセットにおいて、均等サンプリングに比べてMMD性能で10–15%の向上を達成し、強力な実験的有効性を示した。
  • プロトコルはすべてのデータ所有者とのやり取りに対して $(\epsilon,\delta)$-微分プライバシーを保証し、個人情報の漏洩に対する防御を可能にした。
  • キュレーターがアクセスするデータポイント数は $O(K^{1/3}|D_s| + |D_v|)$ に限定され、全データアクセスに比べて攻撃表面が顕著に縮小された。
  • 非プライベートなグリーディアルゴリズムに匹敵する性能を、分類精度の面でも一貫して達成した。32ユニットのニューラルネットワークを用いたMNIST上では、相対性能で10–13%の向上を示した。
  • ノイズレスの微分プライベートオークションメカニズムにより、最終選定にノイズを追加せず、プライベートに勝者を通知できる。選定の忠実性が保たれた。
  • 理論的分析により、非プライベートなグリーディアルゴリズムと同程度のMMD最小化性能を達成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。