Skip to main content
QUICK REVIEW

[论文解读] Ontology-Based Quality Evaluation of Value Generalization Hierarchies for Data Anonymization

Vanessa Ayala-Rivera, Patrick McDonagh|arXiv (Cornell University)|Mar 5, 2015
Privacy-Preserving Technologies in Data参考文献 26被引用 7
一句话总结

本文提出一种基于本体的方法,通过测量语义一致性和分类结构,对数据匿名化中的价值泛化层级(VGH)进行定量质量评估。该方法利用语义相似度度量和层次加权,计算综合的 VghGSL 分数,实现客观比较并识别出指定不当的 VGH,从而通过保留原始语义提高数据可用性。

ABSTRACT

In privacy-preserving data publishing, approaches using Value Generalization Hierarchies (VGHs) form an important class of anonymization algorithms. VGHs play a key role in the utility of published datasets as they dictate how the anonymization of the data occurs. For categorical attributes, it is imperative to preserve the semantics of the original data in order to achieve a higher utility. Despite this, semantics have not being formally considered in the specification of VGHs. Moreover, there are no methods that allow the users to assess the quality of their VGH. In this paper, we propose a measurement scheme, based on ontologies, to quantitatively evaluate the quality of VGHs, in terms of semantic consistency and taxonomic organization, with the aim of producing higher-quality anonymizations. We demonstrate, through a case study, how our evaluation scheme can be used to compare the quality of multiple VGHs and can help to identify faulty VGHs.

研究动机与目标

  • 解决数据匿名化中价值泛化层级(VGH)缺乏标准化、客观评估方法的问题。
  • 通过整合参考本体中的语义一致性和分类组织,形式化 VGH 的质量。
  • 提供一种定量度量方法,以识别存在缺陷或次优的 VGH,减少过度泛化和语义损失。
  • 支持用户基于语义保真度而非主观判断来选择或优化 VGH。
  • 通过更精确地定义 VGH,保留分类属性的原始语义,从而提高匿名化数据的可用性。

提出的方法

  • 该方法使用既定的语义相似度度量,计算每个概念与其泛化祖先之间的语义相似度得分。
  • 在每个层级上定义 LevelGSL(基于层级的泛化语义损失)得分,采用最大值或平均值函数以捕捉最坏情况或平均语义损失。
  • 应用基于层级的权重 $ w_i $,以强调在层级中更具体、更低层级上的语义损失。
  • VghGSL(VGH 泛化语义损失)得分作为综合度量,结合所有层级的 LevelGSL 得分,得分越高表示语义保留越好。
  • 该方法利用参考本体,以确保 VGH 术语之间语义关系的一致性与形式化。
  • 通过基于语义和结构标准的统一评估,支持对多个 VGH 进行比较。

实验结果

研究问题

  • RQ1如何基于语义一致性和分类结构,客观地衡量价值泛化层级(VGH)的质量?
  • RQ2指定不当的 VGH 的关键指标是什么?如何实现其定量检测?
  • RQ3VGH 中的语义损失在多大程度上影响了匿名化数据的可用性?
  • RQ4不同的加权策略(如最大值 vs. 平均值)如何影响在不同层级上对 VGH 质量的评估?
  • RQ5基于本体的语义相似度度量能否有效区分高质量与低质量的 VGH?

主要发现

  • VGH1 在使用恒定权重时获得 0.2454 的 VghGSL 得分,在使用基于层级的权重时获得 0.2023,优于 VGH2 的 0.2773 和 0.2791,表明其具有更好的语义保留能力。
  • 基于层级的权重策略揭示,VGH2 在 Level 1 的语义损失为 0.09,比 VGH1 在 Level 3 的损失更具破坏性,因为低层级损失了更具体的意义。
  • VGH2 在 Level 1 的 LevelGSL 达到峰值 0.1440,表明其泛化定义不佳:子概念的语义损失高于其父概念,违反了语义层级原则。
  • 使用最大值函数选择 LevelGSL 可突出最坏情况的语义损失,因此在识别 VGH 设计中的关键缺陷方面非常有效。
  • 该方法成功识别出 VGH2 中存在不一致的泛化,例如子概念的语义具体性低于其父概念,这会损害语义完整性。
  • 结果表明,具有细粒度且语义一致的泛化层级能带来更高的数据可用性,而任意或不一致的层级则因过度泛化而降低可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。