[論文レビュー] A Novel Microdata Privacy Disclosure Risk Measure
本稿では、準識別子と感受性属性の間の硬直的な区別を仮定せず、個体識別リスクと属性識別リスクを統合的な枠組みで同時に定量化する、新しいマイクロデータのプライバシー漏洩リスク評価手法を提案する。従来の手法がこれらのリスクを別々に扱うという限界を克服する。アドバーサリーの知識を柔軟にモデル化するアプローチと、実社会福祉データセットを用いた実証的評価を通じて、実用性と性能が示された。
A tremendous amount of individual-level data is generated each day, of use to marketing, decision makers, and machine learning applications. This data often contain private and sensitive information about individuals, which can be disclosed by adversaries. An adversary can recognize the underlying individual's identity for a data record by looking at the values of quasi-identifier attributes, known as identity disclosure, or can uncover sensitive information about an individual through attribute disclosure. In Statistical Disclosure Control, multiple disclosure risk measures have been proposed. These share two drawbacks: they do not consider identity and attribute disclosure concurrently in the risk measure, and they make restrictive assumptions on an adversary's knowledge by assuming certain attributes are quasi-identifiers and there is a clear boundary between quasi-identifiers and sensitive information. In this paper, we present a novel disclosure risk measure that addresses these limitations, by presenting a single combined metric of identity and attribute disclosure risk, and providing flexibility in modeling adversary's knowledge. We have developed an efficient algorithm for computing the proposed risk measure and evaluated the feasibility and performance of our approach on a real-world data set from the domain of social work.
研究の動機と目的
- 既存の漏洩リスク評価手法が個体識別リスクと属性識別リスクを別々に扱うという限界を是正すること。
- どの属性が準識別子か、または感受性情報かを事前に明確に定義する必要を排除すること。
- アドバーサリーの知識をより現実的にモデル化できる、統合的で柔軟なリスク指標を開発すること。
- 提案されたリスク指標を計算するための効率的なアルゴリズムの設計および実装。
- 社会福祉分野の実際のマイクロデータセットを用いた、本手法の実用性と性能の評価。
提案手法
- 個体識別リスクと属性識別リスクを統合した、統合的漏洩リスク指標を提案する。
- 任意の属性が識別リスクに寄与できるように、事前に準識別子として定義しない柔軟なアドバーサリー知識モデルを採用する。
- 再識別可能性と感受性情報の漏洩確率を推定するための確率的フレームワークを用いる。
- 実世界のデータセットにスケーラブルな計算効率の高いアルゴリズムを採用する。
- 実社会福祉分野のマイクロデータセットにリスク指標を適用し、実用的妥当性を実証する。
- 閾値ベースのアプローチを用いて漏洩リスクのレベルを評価し、実行可能なプライバシー意思決定を可能にする。
実験結果
リサーチクエスチョン
- RQ1個体識別リスクと属性識別リスクを、一貫性のある単一のリスク指標に統合する方法は何か?
- RQ2柔軟なアドバーサリー知識モデルは、プライバシーリスク評価の現実性をどの程度向上できるか?
- RQ3提案されたリスク指標は、実世界のマイクロデータセットに対しても効率的に計算可能か?
- RQ4従来の漏洩リスク評価手法と比較して、本手法の正確性と柔軟性はいかがなものか?
- RQ5本手法は、実際の社会福祉分野のデータ環境において、実際に導入可能か?
主な発見
- 提案されたリスク指標は、個体識別リスクと属性識別リスクを単一で整合性のある指標に統合することに成功した。
- 本手法は、事前に準識別子の境界を定義する必要がなくなるため、アドバーサリー知識のモデル化をより現実的に可能にした。
- アルゴリズムは、実世界のマイクロデータセット処理において計算上の実行可能性を示した。
- 社会福祉分野のデータセットを用いた評価により、本手法の実用的適用性と性能が確認された。
- 従来の手法と比較して、より洗練され、正確なプライバシーリスク評価が可能になった。
- 結果から、本リスク指標が、プライバシーに配慮が必要な分野におけるデータ公開意思決定を効果的に支援できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。