[論文レビュー] Application-driven Privacy-preserving Data Publishing with Correlated Attributes
本稿では、生成的対抗ネットワークを用いてセンサデータを自動的に摂動させることで、個人識別情報などの機微な属性を隠蔽しつつ、目的の応用に必要な有用性を保持する、プライバシー保護型データ公開フレームワークであるPR-GANを提案する。本手法は、Pufferfishフレームワークに従い、目的属性と機微属性の相関関係をモデル化することで、従来手法に比べて優れたプライバシー保証を達成し、未知のグループに移行した場合の性能低下を最小限に抑える。
Recent advances in computing have allowed for the possibility to collect large amounts of data on personal activities and private living spaces. To address the privacy concerns of users in this environment, we propose a novel framework called PR-GAN that offers privacy-preserving mechanism using generative adversarial networks. Given a target application, PR-GAN automatically modifies the data to hide sensitive attributes -- which may be hidden and can be inferred by machine learning algorithms -- while preserving the data utility in the target application. Unlike prior works, the public's possible knowledge of the correlation between the target application and sensitive attributes is built into our modeling. We formulate our problem as an optimization problem, show that an optimal solution exists and use generative adversarial networks (GAN) to create perturbations. We further show that our method provides privacy guarantees under the Pufferfish framework, an elegant generalization of the differential privacy that allows for the modeling of prior knowledge on data and correlations. Through experiments, we show that our method outperforms conventional methods in effectively hiding the sensitive attributes while guaranteeing high performance in the target application, for both property inference and training purposes. Finally, we demonstrate through further experiments that once our model learns a privacy-preserving task, such as hiding subjects' identity, on a group of individuals, it can perform the same task on a separate group with minimal performance drops.
研究の動機と目的
- 機械学習を用いて推定可能な機微な属性(例:個人識別情報、位置情報)を含む非構造的センサデータにおけるプライバシー漏洩を解消すること。
- 目的の応用に必要なデータ有用性を維持しつつ、それらと相関する機微な属性を効果的に隠蔽するフレームワークの開発。
- 目的属性と機微属性の間の相関関係を事前に把握した攻撃者に対する防御をモデル化すること。
- 信頼できる第三者に依存せずに、IoTおよび分散型センシング環境におけるプライベートなデータ公開を可能にすること。
- プライバシー保護型摂動が、異なるユーザーグループに一般化されることを保証し、中央集権的な学習からデプロイ可能なモデルを実現すること。
提案手法
- 目的関数の有用性と機微属性のプライバシーの両立を最適化する問題として、プライバシー保護型データ公開を定式化する。
- 生成的対抗ネットワーク(GAN)を用いて、目的応用の有用性損失を最小限に抑えつつ、機微属性のプライバシーを最大化するデータ摂動を学習する。
- Pufferfishプライバシーフレームワークを組み込み、機微属性と目的属性の相関関係および事前知識をモデル化することで、形式的なプライバシー保証を実現する。
- 生成器を訓練して、目的タスク(例:階層検出、個人識別分類)の高精度を維持しつつ、機微属性の推定精度を低下させる摂動を生成する。
- 訓練中に目的応用のラベルを活用し、応用に適した摂動を生成するようGANをガイドする。
- あるグループで訓練した摂動モデルを、新しい未確認のグループに適用しても性能低下を最小限に抑えることで、汎用性を実現する。
実験結果
リサーチクエスチョン
- RQ1GANベースのフレームワークは、センサ信号における機微な属性を効果的に隠蔽しつつ、目的応用に高い有用性を維持できるか?
- RQ2目的属性と機微属性の相関関係をモデル化することで、それらを無視する手法に比べて、プライバシー保護がどの程度向上するか?
- RQ3あるグループで訓練したプライバシー保護型摂動モデルが、全く異なるグループに適用された場合、どの程度成功するか?
- RQ4従来手法(例:DP、AP)と比較して、本手法のプライバシー-有用性トレードオフはどの程度優れているか?
- RQ5摂動を加えたデータは、クリーンデータに対して一般化性能が良好な新しいモデルの学習に効果的に利用できるか?
主な発見
- PR-GANは、新しいグループにおいて機微属性(個人識別情報)の推定精度を3.71%にまで低下させ、強固なプライバシー保護を実現した。
- 新しいグループで摂動済みデータを用いた推論においても、目的応用の精度は86.9%を維持し、有用性の損失は最小限に抑えられた。
- WiFiデータセットでは、PR-GANはDP、AP、ベースラインGAN手法を常に上回り、特に高い有用性予算下でのプライバシー-有用性トレードオフが優れていた。
- 学習に使用した場合、摂動済みデータはMNISTで96.72%、PubFigで98.84%、WiFiで72.06%、OccuThermで99.73%の精度を達成し、クリーンデータの性能に近く、優れた一般化性能を示した。
- 摂動モデルを訓練グループから全く異なる未確認のグループに移行させても、高い有用性と強固なプライバシー保護を維持した。
- 本フレームワークはPufferfishモデルに従い、事前知識と属性間の相関関係を考慮した形式的プライバシー保証を提供しており、情報に基づいた攻撃者に対する防御を強化した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。