[论文解读] Privacy Preserving Association Rule Mining Revisited
本文重新审视了用于隐私保护关联规则挖掘(PP-ARM)的FS方案,指出其存在高存储和计算开销,且易受虚假事务过滤攻击的影响。提出了一种结合FS与PS(MASK)技术的混合方案,在降低内存使用量和错误率的同时,实现了更强的隐私保护,该方案通过理论分析和在真实数据集上的实验得到验证。
The privacy preserving data mining (PPDM) has been one of the most interesting, yet challenging, research issues. In the PPDM, we seek to outsource our data for data mining tasks to a third party while maintaining its privacy. In this paper, we revise one of the recent PPDM schemes (i.e., FS) which is designed for privacy preserving association rule mining (PP-ARM). Our analysis shows some limitations of the FS scheme in term of its storage requirements guaranteeing a reasonable privacy standard and the high computation as well. On the other hand, we introduce a robust definition of privacy that considers the average case privacy and motivates the study of a weakness in the structure of FS (i.e., fake transactions filtering). In order to overcome this limit, we introduce a hybrid scheme that considers both privacy and resources guidelines. Experimental results show the efficiency of our proposed scheme over the previously introduced one and opens directions for further development.
研究动机与目标
- 解决PP-ARM中FS方案存在的高存储和计算开销问题。
- 分析FS方案在实际中对虚假事务过滤攻击的脆弱性。
- 设计一种结合FS与PS(MASK)优势的混合方案,以实现更好的隐私保护和资源效率。
- 提出一种改进的隐私定义,不仅考虑最坏情况下的隐私保证,还涵盖平均情况下的隐私表现。
- 通过实验评估混合方案在隐私性、错误率和资源使用方面的性能表现。
提出的方法
- 提出一种混合方案(HS),首先通过插入虚假事务将FS方法应用于真实数据,随后应用PS(MASK)方案对数据进行进一步混淆。
- 使用公式 P_HS_p = 1 - (P_PS_r / (1 + w)) 来量化混合方案的隐私性,其中 P_PS_r 表示在PS方案下正确重新识别的概率,w 为虚假事务的数量。
- 采用两步混淆机制:首先,每条真实事务注入 w 个虚假事务;其次,在PS方案中使用 p=0.5 的概率对项目存在性进行随机扰动。
- 通过理论分析证明,混合方案的隐私性始终优于单独使用FS或PS方案。
- 使用BMS-WebView-1数据集(59,602条事务,平均长度 l=2)在不同最小支持度阈值(smin = 0.001, 0.0025, 0.005)下评估了误报和漏报错误。
- 推导出内存效率条件:当隐私水平相等时,w2 ≤ w1,证明混合方案所需的存储量低于单独使用FS方案。
实验结果
研究问题
- RQ1FS方案的平均情况隐私与最坏情况隐私保证相比如何?这对实际部署有何影响?
- RQ2FS方案的实际存储和计算成本是多少?是否可以在不牺牲隐私的前提下降低这些开销?
- RQ3在实际中,能否使FS方案对虚假事务过滤攻击更具鲁棒性?
- RQ4将FS与PS方案结合是否能形成一种混合方法,从而在提升隐私性、降低错误率和减少资源开销方面实现改进?
- RQ5所提出的混合方案在理论与实证层面,其隐私性、错误率与存储开销之间存在怎样的权衡关系?
主要发现
- 混合方案的隐私性高于单独使用FS或PS方案,理论证明为 P_HS_p ≥ P_FS_p 且 P_HS_p ≥ P_PS_p。
- 在相同隐私水平下,混合方案所需存储量低于FS方案:当 P_FS_p = P_HS_p = 0.95 且 P_PS_r = 0.3 时,w2 = 5 即可满足需求,而FS方案需要 w1 ≥ 19。
- 在BMS-WebView-1数据集上的实验表明,当 w=2 且 smin=0.001 时,混合方案相比FS方案将误报错误降低了最多43%,漏报错误降低了最多45%。
- 当 w=4 且 smin=0.001 时,混合方案的误报数为1.591,漏报数为1.620,而FS方案分别为1.027和1.152,表明在更高 w 值下存在错误降低的权衡。
- 混合方案在显著降低原始FS方案内存开销的同时,仍保持了高水平的隐私保护,使其在实际部署中更具可行性。
- 分析结果表明,PS方案的隐私性不会因真实事务的存在而受损,而FS方案则易受过滤攻击影响,验证了其实际脆弱性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。