Skip to main content
QUICK REVIEW

[论文解读] A Neural Architecture for Person Ontology population

Balaji Ganesan, Riddhiman Dasgupta|arXiv (Cornell University)|Jan 22, 2020
Data Quality and Management参考文献 15被引用 4
一句话总结

本文提出了一种神经网络流水线,通过细粒度实体分类和关系抽取模型,从非结构化文本中自动填充人物本体。该工作引入了一个包含36种个人数据实体类型和9种关系的新数据集,通过轻量级特征改进了最先进模型,并使用图神经网络进行链接预测,在UDBMS数据集上实现了64.56%的ROC AUC。

ABSTRACT

A person ontology comprising concepts, attributes and relationships of people has a number of applications in data protection, didentification, population of knowledge graphs for business intelligence and fraud prevention. While artificial neural networks have led to improvements in Entity Recognition, Entity Classification, and Relation Extraction, creating an ontology largely remains a manual process, because it requires a fixed set of semantic relations between concepts. In this work, we present a system for automatically populating a person ontology graph from unstructured data using neural models for Entity Classification and Relation Extraction. We introduce a new dataset for these tasks and discuss our results.

研究动机与目标

  • 为解决手动填充人物本体所面临的耗时且易出错的挑战。
  • 开发一种系统,能够从非结构化文本中自动提取并分类个人数据实体(PDEs)。
  • 通过将轻量级特征整合到神经模型中,改进细粒度实体分类性能。
  • 利用句子级嵌入和图神经网络,提升人物间关系抽取的性能。
  • 构建一个可扩展的流水线,从原始文本中填充语义人物本体图。

提出的方法

  • 该系统采用结合规则标注器(SystemT)、Stanford NER以及神经模型进行实体分类和关系抽取的流水线架构。
  • 通过引入轻量级特征,增强了细粒度实体分类模型,在OntoNotes数据集上将F1分数从0.678提升至0.740。
  • 关系抽取采用On2Vec模型,利用通用句子编码器(USE)生成的句子嵌入,但使用句子级输入时性能下降。
  • 应用图神经网络(P-GNN)对提取的人物实体进行链接预测,在UDBMS和Elected Reps数据集上均优于GCN。
  • 最终通过提取的实体、属性和推断的关系构建本体图,并可导出为RDF/PPI格式。
  • 该流水线在两个数据集上进行评估:UDBMS(DBPedia Person)和Elected Representatives,主要采用ROC AUC作为评估指标。

实验结果

研究问题

  • RQ1轻量级特征是否能在个人数据场景下显著提升细粒度实体分类性能?
  • RQ2在使用基于翻译的模型(如On2Vec)时,引入句子级嵌入是否能提升关系抽取性能?
  • RQ3图神经网络能否有效从提取的实体和关系数据中推断出新的人员间关系?
  • RQ4P-GNN在个人数据本体图的链接预测任务中与GCN相比表现如何?
  • RQ5神经网络流水线在多大程度上能够实现从非结构化文本自动填充人物本体?

主要发现

  • 所提出的NFGEC+模型在OntoNotes数据集上取得了0.740的F1分数,显著优于基线模型NFGEC(0.678 F1)。
  • On2Vec结合句子嵌入在TACRED数据集上表现不佳,仅达到17.8%的准确率,表明句子级输入未提升关系抽取性能。
  • 位置感知图神经网络(P-GNN)在UDBMS数据集上实现了64.56%的ROC AUC,优于GCN的46.89%。
  • 在Elected Representatives数据集上,P-GNN实现了64.73%的ROC AUC,而GCN仅为40.47%,表现出一致的优越性。
  • 该系统成功构建了人物本体图,如图9所示,支持问答和推理等下游任务。
  • 本研究公开了包含36种PDET和9种PDER类型的标注数据集,为未来个人数据本体填充研究提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。