Skip to main content
QUICK REVIEW

[论文解读] On Addressing Efficiency Concerns in Privacy Preserving Data Mining

Shipra Agrawal, Vijay Krishnan|arXiv (Cornell University)|Oct 17, 2003
Imbalanced Data Classification Techniques参考文献 10被引用 5
一句话总结

该论文提出EMASK,一种针对隐私保护关联规则挖掘的优化算法,通过使用针对符号的扰动参数和针对性优化,减少了数据扰动带来的运行时开销。通过仔细调节扰动参数并将计数开销移至数据库遍历的末尾,EMASK在保持高隐私(100分中70分以上)和高准确率(100分中80分以上)的同时,实现了接近标准Apriori算法5倍以内的挖掘性能。

ABSTRACT

Data mining services require accurate input data for their results to be meaningful, but privacy concerns may influence users to provide spurious information. To encourage users to provide correct inputs, we recently proposed a data distortion scheme for association rule mining that simultaneously provides both privacy to the user and accuracy in the mining results. However, mining the distorted database can be orders of magnitude more time-consuming as compared to mining the original database. In this paper, we address this issue and demonstrate that by (a) generalizing the distortion process to perform symbol-specific distortion, (b) appropriately choosing the distortion parameters, and (c) applying a variety of optimizations in the reconstruction process, runtime efficiencies that are well within an order of magnitude of undistorted mining can be achieved.

研究动机与目标

  • 解决隐私保护数据挖掘中的关键性能瓶颈,即经过扰动的数据挖掘比直接挖掘慢几个数量级。
  • 克服先前方案(如MASK)的低效性,尽管这些方案确保了隐私和准确率,但运行时成本过高。
  • 设计一种新算法,实现在关联规则挖掘中同时具备高隐私、高准确率和可接受的运行时效率。
  • 引入并评估一种新的隐私概念——重新质询隐私(reinterrogated privacy),即挖掘者可能利用输出规则对扰动数据进行探查。
  • 提供实用的参数估计公式和优化技术,使隐私保护挖掘在真实应用场景中可行。

提出的方法

  • 将MASK中的扰动过程泛化,实现符号特定扰动,对事务中1(项目存在)和0(项目缺失)使用不同的参数。
  • 推导出用于估计最优扰动参数(p和q)的解析公式,以在隐私、准确率和效率之间实现平衡。
  • 重新组织挖掘流程,将所有由扰动带来的额外计数操作推迟到每次数据库遍历的末尾,从而最小化运行时开销。
  • 应用优化技术,减少频繁项集生成过程中的冗余计算,尤其在密集数据库中效果显著。
  • 引入一种新的隐私度量——重新质询隐私,用于捕捉基于规则的原始数据条目重新识别风险。
  • 使用合成数据集和真实数据集对方法进行验证,测量在不同参数设置下的运行时间、隐私和准确率。

实验结果

研究问题

  • RQ1能否将隐私保护关联规则挖掘的运行时开销降低至标准挖掘的1个数量级以内?
  • RQ2符号特定扰动的何种参数设置能实现隐私、准确率和效率之间的最佳权衡?
  • RQ3当规则被用于探查扰动数据时,重新质询隐私(reinterrogated privacy)如何影响整体隐私保证?
  • RQ4通过将计数开销移至数据库遍历末尾的优化策略,能否显著提升挖掘性能?
  • RQ5在不同数据集上,是否存在一个稳定的‘机会窗口’,使得高隐私、高准确率和可接受的效率能够共存?

主要发现

  • 在真实数据集上,EMASK将挖掘运行时间减少至标准Apriori的5倍以内,实现了5倍的性能开销,而非先前的100–1000倍。
  • 在扰动参数p=0.4和q=0.98下,EMASK在真实数据集上实现了70分以上(满分100)的隐私得分和80分以上(满分100)的准确率,证明了三项目标之间的可行平衡。
  • 合成数据集实验表明,隐私和准确率对参数设置极为敏感,尤其是q值;当q=0.99时,由于项集较长,准确率出现较大波动。
  • 在真实数据集上,尽管运行时开销增加约15–30倍,隐私和准确率依然保持强劲,且数据稀疏性在一定程度上缓解了效率问题。
  • 扰动参数的估计公式能有效识别出隐私、准确率和效率均达到最大化的最优‘机会窗口’。
  • 重新质询隐私模型表明,即使存在基于规则的探查,最优参数设置下隐私保证依然稳固,验证了该方法的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。