Skip to main content
QUICK REVIEW

[論文レビュー] Feature Selection for Classification under Anonymity Constraint

Baichuan Zhang, Noman Mohammed|arXiv (Cornell University)|Dec 22, 2015
Privacy-Preserving Technologies in Data参考文献 42被引用数 10
ひとこと要約

本稿では、k-匿名性制約下でのバイナリ分類データセットに対するプライバシー保護型特徴選択手法を提案し、『包含によるk-匿名性』を導入することで、特徴部分集合の選択によって個人識別情報の保護を実現する。この手法は、サブモジュラリティを用いたユーティリティ指標と貪欲アルゴリズムを組み合わせ、プライバシーと分類性能のバランスを図り、特徴の抑制を最小限に抑えつつ、実世界のデータセットで優れた性能を示している。

ABSTRACT

Over the last decade, proliferation of various online platforms and their increasing adoption by billions of users have heightened the privacy risk of a user enormously. In fact, security researchers have shown that sparse microdata containing information about online activities of a user although anonymous, can still be used to disclose the identity of the user by cross-referencing the data with other data sources. To preserve the privacy of a user, in existing works several methods (k-anonymity, l-diversity, differential privacy) are proposed that ensure a dataset which is meant to share or publish bears small identity disclosure risk. However, the majority of these methods modify the data in isolation, without considering their utility in subsequent knowledge discovery tasks, which makes these datasets less informative. In this work, we consider labeled data that are generally used for classification, and propose two methods for feature selection considering two goals: first, on the reduced feature set the data has small disclosure risk, and second, the utility of the data is preserved for performing a classification task. Experimental results on various real-world datasets show that the method is effective and useful in practice.

研究の動機と目的

  • 分類に用いられる高次元かつスパースなマイクロデータにおけるユーザーのプライバシーを保護する課題に対処すること。
  • 分類タスクの高機能性を維持しつつk-匿名性を保証する特徴選択手法を開発すること。
  • スパースで高次元なデータセットに適した、新たな匿名化指標『包含によるk-匿名性』を導入すること。
  • サブモジュラリティユーティリティ関数を最適化することで、効率的な貪欲アルゴリズムによる特徴選択を可能にすること。
  • 本手法の有効性を、プライバシーと機能性のトレードオフが明確に現れる実世界のデータセットを用いて実証すること。

提案手法

  • 各レコードが選択された特徴部分集合において、少なくともk−1個の他のレコードと区別不能であることを要件とする、新たなプライバシー指標『包含によるk-匿名性』を提案する。
  • k-匿名性制約下で分類性能を最大化する最適化問題として特徴選択を定式化する。
  • 情報量の増加やジニ不純度の低減などのサブモジュラリティを有するユーティリティ指標(例:情報ゲイン、ジニ不純度低減)を用いることで、貪欲アルゴリズムが近似的に最適な結果を得られることを保証する。
  • k-匿名性を維持しつつユーティリティを最大化するように、反復的に特徴を追加する貪欲な前向き選択アルゴリズムを適用する。
  • カテゴリカル特徴に対してもバイナリ化を適用することで、非バイナリデータセットへの応用を可能にする。
  • 分類性能の測定として、標準的な分類モデル(例:決定木、SVM)を用いて特徴部分集合を評価する。

実験結果

リサーチクエスチョン

  • RQ1高次元かつスパースなマイクロデータにおいて、分類性能に悪影響を及げることなく、特徴選択によってk-匿名性を達成できるか?
  • RQ2包含によるk-匿名性は、従来のk-匿名性と比較して、プライバシー保護とデータ機能性の両面で優れているか?
  • RQ3サブモジュラリティユーティリティ指標は、プライバシー制約下でも効率的かつ効果的な特徴選択を可能にするか?
  • RQ4k-匿名性が適用された状況下で、特徴選択が分類精度に与える影響は何か?
  • RQ5本手法は、多様な実世界のデータセットにおいてスケーラブルで頑健であるか?

主な発見

  • 提案手法は、特徴の抑制を最小限に抑えつつ、顕著なk-匿名性を達成し、高次元データにおける個人識別情報の再特定リスクを著しく低減した。
  • サブモジュラリティユーティリティ指標の活用により、貪欲アルゴリズムが分類性能を維持する高品質な特徴部分集合を効率的に選択できた。
  • 実験結果から、本手法はユーザーが定めたk-匿名性制約を満たしつつ、複数のデータセットで高い分類精度(例:F1スコア > 0.85)を維持していることが示された。
  • 本手法は、CMベースの特徴選択や一般化に基づく匿名化手法など、既存の手法よりもプライバシーと機能性の両方の指標で優れた性能を示した。
  • 包含によるk-匿名性は、過剰なデータ歪みを回避するため、高次元環境下で従来のk-匿名性よりも効果的であることが分かった。
  • 本手法は、バイナリ化を経たカテゴリカル特徴を含む実世界のデータセットに対しても、スケーラブルかつ効果的に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。