Skip to main content
QUICK REVIEW

[論文レビュー] Privacy Preserving Association Rule Mining Revisited

Aziz Mohaisen, Dowon Hong|ArXiv.org|Aug 23, 2008
Privacy-Preserving Technologies in Data参考文献 22被引用数 4
ひとこと要約

本稿は、プライバシー保護型関連ルールマイニング(PP-ARM)のためのFSスキームを再検討し、その高いストレージおよび計算コスト、および偽の取引フィルタリング攻撃に対する脆弱性を特定する。本稿では、FSとPS(MASK)技術を組み合わせたハイブリッドスキームを提案し、より強いプライバシーを実現するとともに、メモリ使用量を低減し、誤り率を低下させる。理論的分析と実データセットを用いた実験により、その有効性が検証された。

ABSTRACT

The privacy preserving data mining (PPDM) has been one of the most interesting, yet challenging, research issues. In the PPDM, we seek to outsource our data for data mining tasks to a third party while maintaining its privacy. In this paper, we revise one of the recent PPDM schemes (i.e., FS) which is designed for privacy preserving association rule mining (PP-ARM). Our analysis shows some limitations of the FS scheme in term of its storage requirements guaranteeing a reasonable privacy standard and the high computation as well. On the other hand, we introduce a robust definition of privacy that considers the average case privacy and motivates the study of a weakness in the structure of FS (i.e., fake transactions filtering). In order to overcome this limit, we introduce a hybrid scheme that considers both privacy and resources guidelines. Experimental results show the efficiency of our proposed scheme over the previously introduced one and opens directions for further development.

研究の動機と目的

  • PP-ARMにおけるFSスキームの高いストレージおよび計算コストを解消すること。
  • FSの偽の取引フィルタリング攻撃に対する実用的脆弱性を分析すること。
  • FSとPS(MASK)の長所を組み合わせたハイブリッドスキームを構築し、より優れたプライバシーとリソース効率を実現すること。
  • 最悪ケース保証だけでなく、平均ケースプライバシーを考慮した洗練されたプライバシー定義を提示すること。
  • ハイブリッドスキームのプライバシー、誤り、リソース使用量の観点から、実験的評価を実施すること。

提案手法

  • まず、実データに偽の取引を挿入することでFS手法を適用し、その後、PS(MASK)スキームを適用してさらにデータを隠蔽するハイブリッドスキーム(HS)を導入する。
  • プライバシーの定量的評価に、式 P_HS_p = 1 - (P_PS_r / (1 + w)) を用いる。ここで P_PS_r はPSスキーム下での正しく再識別可能な確率、w は偽の取引の数を表す。
  • 2段階の隠蔽処理を実施:まず、1件の実取引あたりw件の偽の取引を挿入し、次にPSスキームでアイテムの存在を確率p=0.5でランダムに変更する。
  • 理論的分析により、ハイブリッドスキームのプライバシーは、FSまたはPS単体よりも常に高いことを示した。
  • BMS-WebView-1データセット(59,602件の取引、平均長さl=2)を用い、最小サポート閾値smin = 0.001, 0.0025, 0.005の変動に対して、偽陽性および偽陰性誤りを評価した。
  • メモリ効率の条件を導出:同じプライバシー水準を達成する場合、w2 ≤ w1 が成り立つことから、ハイブリッドスキームはFS単体よりも少ないストレージで実現可能であることを証明した。

実験結果

リサーチクエスチョン

  • RQ1FSスキームの平均ケースプライバシーは、最悪ケース保証と比べてどのように異なり、実世界の展開にどのような影響を及えるか?
  • RQ2FSスキームの実際のストレージおよび計算コストはどの程度で、プライバシーを損なわず低減可能か?
  • RQ3実際の場面で、FSスキームは偽の取引フィルタリング攻撃に対してより強固にできるか?
  • RQ4FSとPSスキームを組み合わせることで、プライバシーの向上、誤りの低減、リソースオーバーヘッドの低減を実現できるハイブリッドアプローチが得られるか?
  • RQ5提案されたハイブリッドスキームにおいて、プライバシー、誤り、ストレージの理論的および実験的トレードオフはどのようなものか?

主な発見

  • ハイブリッドスキームは、P_HS_p ≥ P_FS_p および P_HS_p ≥ P_PS_p が成り立つことから、FSまたはPS単体よりも高いプライバシーを達成する。
  • 同じプライバシー水準において、ハイブリッドスキームはFS単体よりも少ないストレージを要する。P_FS_p = P_HS_p = 0.95 かつ P_PS_r = 0.3 の場合、w2 = 5 で十分であるが、FS単体では w1 ≥ 19 必要である。
  • BMS-WebView-1を用いた実験では、w=2 かつ smin=0.001 の条件下で、ハイブリッドスキームはFSに比べて偽陽性誤りを最大43%、偽陰性誤りを最大45%低減した。
  • w=4 かつ smin=0.001 の場合、ハイブリッドスキームは偽陽性1.591件、偽陰性1.620件を記録したが、FSは偽陽性1.027件、偽陰性1.152件であった。これは、wが高くなると誤り低減のトレードオフが生じることを示している。
  • ハイブリッドスキームは、元のFSスキームの高いメモリオーバーヘッドを顕著に低減しながらも、高いプライバシーを維持しており、実世界への展開がより現実的である。
  • 分析により、PSスキームでは実取引の存在によってプライバシーが損なわれないことが確認された。これに対して、FSスキームはフィルタリング攻撃に対して脆弱であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。