[论文解读] An Improved Approach to High Level Privacy Preserving Itemset Mining
本文提出了一种增强的事务随机化技术,结合虚假事务插入与每事务项随机化,以提升高级项集挖掘中的隐私保护。通过使用随机化函数替换事务内的项目,并注入合成事务,该方法在保持反单调性的同时增强了隐私保护,从而实现准确的频繁项集与关联规则挖掘。
Privacy preserving association rule mining has triggered the development of many privacy preserving data mining techniques. A large fraction of them use randomized data distortion techniques to mask the data for preserving. This paper proposes a new transaction randomization method which is a combination of the fake transaction randomization method and a new per transaction randomization method. This method distorts the items within each transaction and ensures a higher level of data privacy in comparison to the previous approaches. The pertransaction randomization method involves a randomization function to replace the item by a random number guarantying privacy within the transaction also. A tool has also been developed to implement the proposed approach to mine frequent itemsets and association rules from the data guaranteeing the antimonotonic property.
研究动机与目标
- 解决现有随机化数据失真技术在关联规则挖掘过程中隐私保护方面的局限性。
- 克服传统方法在事务内项目级隐私保护方面易受攻击的缺陷。
- 确保反单调性得以保持,从而允许在扰动数据上正确挖掘频繁项集与关联规则。
- 开发一个实用工具,以实现并评估所提出的隐私保护挖掘方法。
- 在不显著损害挖掘模式可用性的情况下,实现更高水平的隐私保护。
提出的方法
- 提出一种结合虚假事务插入与每事务项随机化的混合事务随机化方法。
- 应用随机化函数,将每个事务内的单个项目替换为随机数,以隐藏项目级信息。
- 将合成(虚假)事务注入数据集中,进一步扰乱攻击者对模式的重建。
- 确保随机化后的数据保持反单调性,从而支持有效的频繁项集挖掘。
- 实现一个工具,用于处理扰动数据并提取频繁项集与关联规则。
- 采用受控的随机化函数,通过使项目到数字的映射不可预测来保证隐私。
实验结果
研究问题
- RQ1在关联规则挖掘过程中,如何增强单个事务内项目级隐私?
- RQ2将虚假事务插入与每事务项随机化相结合,相较于现有方法,能在多大程度上提升隐私保护?
- RQ3在应用所提出的随机化技术后,反单调性是否能够保持?
- RQ4所提出的方法在保护敏感项集的同时,能否保持关联规则挖掘的准确性?
- RQ5所实现工具在真实数据场景下的实际可行性与性能如何?
主要发现
- 与先前的随机化数据失真技术相比,所提出的方法实现了更高水平的隐私保护。
- 虚假事务与每事务项随机化的结合,能有效扰乱攻击者对模式的重建。
- 在扰动数据中,反单调性得以保持,从而支持正确的频繁项集挖掘。
- 所开发的工具成功从随机化数据集中提取出频繁项集与关联规则。
- 该方法通过随机映射函数确保事务内项目级信息得到保护。
- 工具的实证结果表明,隐私保护得到增强,同时挖掘准确率未出现显著损失。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。