[论文解读] An Effective Clustering Approach to Web Query Log Anonymization
本文提出了一种基于聚类的新型方法,通过将查询建模为非结构化事务数据,并利用聚类和泛化实现k-匿名化,从而对网络查询日志进行匿名化。在AOL查询日志上的实验表明,该方法在保护隐私的同时,数据可用性高于现有最先进方法。
Web query log data contain information useful to research; however, release of such data can re-identify the search engine users issuing the queries. These privacy concerns go far beyond removing explicitly identifying information such as name and address, since non-identifying personal data can be combined with publicly available information to pinpoint to an individual. In this work we model web query logs as unstructured transaction data and present a novel transaction anonymization technique based on clustering and generalization techniques to achieve the k-anonymity privacy. We conduct extensive experiments on the AOL query log data. Our results show that this method results in a higher data utility compared to the state of-the-art transaction anonymization methods.
研究动机与目标
- 为解决发布网络查询日志时存在的隐私风险,这些日志即使不包含显式标识符,也可能重新识别用户。
- 克服现有匿名化技术在确保隐私的同时降低数据可用性的局限性。
- 开发一种通过聚类和泛化查询日志实现k-匿名化的方法,同时保留有意义的模式。
- 在真实世界查询日志数据上评估所提出方法,并与现有方法在数据可用性方面进行比较。
提出的方法
- 作者将网络查询日志建模为非结构化事务数据,将每个查询视为关键词的事务。
- 应用聚类算法,根据关键词重叠和语义相似性对相似查询进行分组。
- 在每个聚类内,使用替换特定术语为更广泛类别或通配符等技术对查询进行泛化。
- 通过确保每个聚类中至少包含k个查询来强制实现k-匿名化,防止用户被重新识别。
- 选择性地应用泛化以最小化信息损失,同时保持隐私。
- 在AOL查询日志数据集上评估该方法,并使用指标比较其数据可用性与隐私保护能力。
实验结果
研究问题
- RQ1基于聚类的泛化技术是否能有效实现网络查询日志的匿名化,同时保持数据可用性?
- RQ2与现有事务数据匿名化技术相比,所提出方法在k-匿名化和数据可用性方面表现如何?
- RQ3在不损失对研究具有意义的模式的前提下,查询日志能在多大程度上被泛化?
- RQ4不同的聚类策略对隐私与可用性之间平衡的影响如何?
主要发现
- 所提出的基于聚类的匿名化方法在AOL查询日志数据集上,相比现有最先进事务数据匿名化技术,实现了更高的数据可用性。
- 该方法通过形成每个聚类中至少包含k个查询的聚类,成功实现了k-匿名化。
- 在聚类内高效地应用泛化,最大限度地减少了日志中语义和结构信息的损失。
- 该方法保持了有意义的查询模式,使匿名化后的日志仍可用于研究。
- 实验结果表明,该方法在相同隐私约束下,相比现有方法更有效地保留了数据可用性。
- 即使在具有多样化和复杂查询模式的大规模真实世界查询日志上,该方法也表现出良好的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。