Skip to main content
QUICK REVIEW

[论文解读] Fine Grained Classification of Personal Data Entities

Riddhiman Dasgupta, Balaji Ganesan|arXiv (Cornell University)|Nov 23, 2018
Topic Modeling参考文献 11被引用 6
一句话总结

本文提出一种神经模型,通过整合现有基于规则的标注器输出作为上下文特征,实现对个人数据实体(PDEs)的细粒度分类,显著提升分类性能。该方法引入了134种PDE分类层级,并构建了两个新数据集(民选官员维基百科与Enron邮件),在Enron数据集上达到最高98.5%的F1值,在OntoNotes上也取得显著提升,证明了现成的NLP工具可仅以极低代价增强细粒度PDE分类性能。

ABSTRACT

Entity Type Classification can be defined as the task of assigning category labels to entity mentions in documents. While neural networks have recently improved the classification of general entity mentions, pattern matching and other systems continue to be used for classifying personal data entities (e.g. classifying an organization as a media company or a government institution for GDPR, and HIPAA compliance). We propose a neural model to expand the class of personal data entities that can be classified at a fine grained level, using the output of existing pattern matching systems as additional contextual features. We introduce new resources, a personal data entities hierarchy with 134 types, and two datasets from the Wikipedia pages of elected representatives and Enron emails. We hope these resource will aid research in the area of personal data discovery, and to that effect, we provide baseline results on these datasets, and compare our method with state of the art models on OntoNotes dataset.

研究动机与目标

  • 为解决GDPR与HIPAA下个人数据实体(PDEs)细粒度分类的空白,这些法规要求高召回率和超越粗粒度命名实体识别(NER)标签的精确分类。
  • 开发一种可扩展的解决方案,通过利用现有模式匹配系统作为上下文特征,减少对昂贵手工构建规则的依赖。
  • 构建一个全面的、分层的134种细粒度PDE类型分类体系,以在隐私合规领域实现分类标准化。
  • 提供新的人工标注数据集,其中包含细粒度PDE类型,以支持个人数据发现与分类领域的研究。

提出的方法

  • 该方法采用神经序列标注模型(RNN、注意力机制或BiLSTM)进行细粒度实体分类,并通过外部系统生成的标记级特征进行增强。
  • 将基于规则的个人数据标注器(PDAs)的输出——包括词性标注(POS)、命名实体识别(NER)标签以及领域特定类型标签——作为额外的上下文特征,以提升模型泛化能力。
  • 该模型在两个新数据集上端到端进行训练:一个来自民选官员维基百科页面,另一个来自Enron电子邮件通信,两者均标注了细粒度PDE类型。
  • 通过一个后处理的基于规则的模块,融合神经模型与PDAs的预测结果,以提升最终分类结果的鲁棒性与一致性。
  • 在新数据集和OntoNotes基准上评估该方法,比较使用与不使用额外PDA特征时的性能表现。
  • 该框架设计具有可扩展性,可通过接入领域特定的基于规则标注器并使用标注数据进行微调,轻松适配新领域。

实验结果

研究问题

  • RQ1整合现有基于规则的个人数据标注器输出,能否提升神经模型在个人数据实体细粒度分类中的性能?
  • RQ2与标准NER系统相比,该方法在捕捉细微PDE类型(如 /bio/education/alma_mater)方面的有效性如何?
  • RQ3现成的语法特征(POS、NER)以及基于规则系统生成的领域特定类型标签,对分类准确率和F1分数的提升程度如何?
  • RQ4该方法在政治人物传记与企业邮件等多样化领域中,能否在极少微调的情况下实现良好泛化?
  • RQ5添加PDA特征对各类别性能的影响如何,特别是对低资源或罕见PDE类型?

主要发现

  • 与基线模型相比,PDA生成的特征(POS、NER、基于规则的类型)使Enron邮件数据集上的微平均F1提升1.8个百分点,宏平均F1提升1.6个百分点。
  • 在民选代表数据集中,加入特征的模型几何平均F1达到0.979,而基线模型为0.939,各项指标均实现一致提升。
  • 对于罕见或细粒度标签(如 /org/company/news 和 /person/political_figure),F1分数分别从基线的0.0和0.08提升至0.49和0.14,表明在低资源类别上取得显著改进。
  • 当使用特征时,模型在Enron数据集上达到98.5%的F1,在民选代表数据集上达到96.4%的F1,表明在不同领域中均具有强大鲁棒性。
  • 类别层面的分析表明,特征融合显著提升了细粒度PDE类型的分类性能,尤其对标准NER系统此前未能充分识别的类型效果显著。
  • 结果证实,低成本的现成NLP工具可为细粒度PDE分类带来显著收益,从而减少对昂贵手工特征工程的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。