Skip to main content
QUICK REVIEW

[論文レビュー] Distributed generation of privacy preserving data with user customization

Xiao Dong Chen, Thomas Navidi|arXiv (Cornell University)|Apr 20, 2019
Privacy-Preserving Technologies in Data被引用数 9
ひとこと要約

本稿では、潜在表現学習とプライバシー化を分離することで、プライバシーを守るデータ生成の分散型でユーザーカスタマイズ可能なフレームワークを提案する。固定された変分オートエンコーダー(VAE)と、GAN風のロバスト最適化により訓練された軽量な生成フィルタを用いることで、モバイルデバイスが局所的にデータを摂動させ、ユーザー定義のプライベート属性を隠蔽しつつも、MNIST、UCI-Adult、CelebAの各データセットでガウスノイズよりもプライバシーと有用性のトレードオフを優れて達成する。

ABSTRACT

Distributed devices such as mobile phones can produce and store large amounts of data that can enhance machine learning models; however, this data may contain private information specific to the data owner that prevents the release of the data. We wish to reduce the correlation between user-specific private information and data while maintaining the useful information. Rather than learning a large model to achieve privatization from end to end, we introduce a decoupling of the creation of a latent representation and the privatization of data that allows user-specific privatization to occur in a distributed setting with limited computation and minimal disturbance on the utility of the data. We leverage a Variational Autoencoder (VAE) to create a compact latent representation of the data; however, the VAE remains fixed for all devices and all possible private labels. We then train a small generative filter to perturb the latent representation based on individual preferences regarding the private and utility information. The small filter is trained by utilizing a GAN-type robust optimization that can take place on a distributed device. We conduct experiments on three popular datasets: MNIST, UCI-Adult, and CelebA, and give a thorough evaluation including visualizing the geometry of the latent embeddings and estimating the empirical mutual information to show the effectiveness of our approach.

研究の動機と目的

  • 高次元のデータ(画像や個人記録など)を機械学習に適した形でプライバシーを守って共有する課題に対処すること。
  • 各ラベル組み合わせごとに中央集権的な再訓練を必要とせず、個々のユーザーがどの属性をプライバシー化するか(例:年齢、性別、人種)をカスタマイズできること。
  • モバイルデバイスに適した計算効率が高く、分散型の解決策を設計し、データ送信前に局所的にプライバシー保護変換を適用できること。
  • 非プライベート属性の有用性を維持しつつ、潜在表現とプライベートラベルの相関を低減すること。
  • 各プライベートラベルの組み合わせごとに別々のオートエンコーダーを訓練する必要がある既存手法のスケーラビリティの制限を克服すること。

提案手法

  • すべてのユーザーとプライベートラベルの組み合わせに共通して使用可能なコンactな共有潜在表現を生成するために、固定された変分オートエンコーダー(VAE)が用いられる。
  • 個々のユーザーのプライバシーの好みに応じて、潜在表現を摂動する軽量なユーザー固有の生成フィルタが、GAN風のロバスト最適化により訓練される。
  • 生成フィルタは局所的なデバイス上で分散的に訓練され、通信量と計算負荷を最小限に抑える。
  • フィルタはノイズ注入を制限する歪み予算(distortion budget)を用い、非ターゲット属性でさえも過剰に摂動させない。
  • プライベートラベル分類器の精度を低下させるためにミニマックス最適化を活用し、同時に有用性ラベルの精度を高い水準に維持する。
  • 実験的相互情報量(empirical mutual information)が計算され、潜在表現とプライベートラベルの相関の低減が定量化される。

実験結果

リサーチクエスチョン

  • RQ1固定VAEを用いて、多様なプライベートラベルの組み合わせにわたって効率的かつユーザーでカスタマイズ可能なプライバシー化を可能にする普遍的な潜在表現を構築できるか?
  • RQ2GAN風最適化により訓練された小さなユーザー固有の生成フィルタは、プライベート属性の推定精度をどれほど効果的に低下させられるか?
  • RQ3生成フィルタに組み込まれた歪み予算は、非ターゲット属性への過剰な摂動を防ぎ、意図しない有用な情報を保持するのに有効か?
  • RQ4本手法は、標準的なガウスノイズ注入と比較して、プライバシーと有用性のトレードオフにおいて優れているか?
  • RQ5本手法は、潜在表現とプライベートラベルの間の実験的相互情報量をどの程度低減させるか?

主な発見

  • 歪み予算がKLD(KLダイバージェンス)で3に設定された状態で、生成フィルタによりプライベートラベル分類精度が95%から約65%に低下したが、有用性ラベルの精度は90%前後を維持した。
  • 生成フィルタはガウス機構よりもプライバシーと有用性のトレードオフにおいて優れており、プライベートラベルの分類精度をより効果的に低下させつつ、有用性ラベルの精度をよりよく維持した。
  • MNISTのケース1における「円」などの非ターゲット属性は、歪み予算のおかげで保護され、ノイズ注入がターゲット属性に限定された。
  • 歪み予算が増加するにつれて、潜在表現とプライベートラベルの間の実験的相互情報量は顕著に低下し、相関の低減が確認された。
  • 可視化結果から、潜在空間の幾何構造が変化しており、0と6の数字が類似するようになり、'≥5'のようなプライベート属性の区別が難しくなった。
  • CelebAでは、'魅力的'、'眼鏡'、'うねった髪'といったラベルを効果的にプライバシー化しながらも、リアルな画像品質と笑顔の有用性ラベルを維持できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。