Skip to main content
QUICK REVIEW

[논문 리뷰] A Neural Architecture for Person Ontology population

Balaji Ganesan, Riddhiman Dasgupta|arXiv (Cornell University)|2020. 01. 22.
Data Quality and Management참고 문헌 15인용 수 4
한 줄 요약

이 논문은 자연어 처리 모델과 그래프 신경망을 활용하여 비구조화된 텍스트에서 사람 온톨로지 자동 구축을 위한 신경망 파이프라인을 제안한다. 새로운 데이터셋(36개의 개인 데이터 엔티티 유형 및 9개의 관계 포함), 경량 특징을 통합한 상태최고 수준의 모델 개선, 그리고 링크 예측에 그래프 신경망을 적용하여 UDBMS 데이터셋에서 64.56%의 ROC AUC를 달성한다.

ABSTRACT

A person ontology comprising concepts, attributes and relationships of people has a number of applications in data protection, didentification, population of knowledge graphs for business intelligence and fraud prevention. While artificial neural networks have led to improvements in Entity Recognition, Entity Classification, and Relation Extraction, creating an ontology largely remains a manual process, because it requires a fixed set of semantic relations between concepts. In this work, we present a system for automatically populating a person ontology graph from unstructured data using neural models for Entity Classification and Relation Extraction. We introduce a new dataset for these tasks and discuss our results.

연구 동기 및 목표

  • 수동으로 사람 온톨로지를 채우는 데 드는 시간과 실수의 위험을 해결하기 위해.
  • 비구조화된 텍스트에서 개인 데이터 엔티티(PDEs)를 자동으로 추출하고 분류하는 시스템을 개발하기 위해.
  • 신경망 모델에 경량 특징을 통합하여 세분화된 엔티티 분류 성능을 향상시키기 위해.
  • 문장 수준의 임베딩과 그래프 신경망을 활용하여 사람 간 관계 추출을 향상시키기 위해.
  • 원시 텍스트에서 의미론적 사람 온톨로지 그래프를 구축하기 위한 확장 가능한 파이프라인을 구축하기 위해.

제안 방법

  • 시스템은 규칙 기반 애너테이터(SystemT), Stanford NER, 엔티티 분류 및 관계 추출을 위한 신경망 모델을 조합한 파이프라인을 사용한다.
  • 세분화된 엔티티 분류 모델은 경량 특징을 통합하여 OntoNotes 데이터셋에서 F1 점수를 0.678에서 0.740으로 향상시켰다.
  • 관계 추출은 On2Vec를 사용하며, Universal Sentence Encoder(USE)에서 유도한 문장 임베딩을 활용하지만, 문장 수준의 입력을 사용할 경우 성능이 저하된다.
  • 추출된 사람 엔티티에 대해 링크 예측을 위해 그래프 신경망(P-GNN)을 적용하였으며, UDBMS 및 Elected Reps 데이터셋에서 GCN보다 뛰어난 성능을 보였다.
  • 최종 온톨로지 그래프는 추출된 엔티티, 속성, 유추된 관계를 기반으로 구성되며, RDF/PPI 형식으로 내보낼 수 있다.
  • 파이프라인은 UDBMS(DBPedia Person) 및 Elected Representatives 두 데이터셋에서 평가되었으며, 주요 평가 지표로 ROC AUC를 사용하였다.

실험 결과

연구 질문

  • RQ1경량 특징이 개인 데이터 맥락에서 세분화된 엔티티 분류 성능을 크게 향상시킬 수 있는가?
  • RQ2On2Vec과 같은 번역 기반 모델을 사용할 때 문장 수준의 임베딩을 통합하면 관계 추출 성능이 향상되는가?
  • RQ3그래프 신경망이 추출된 엔티티 및 관계 데이터로부터 새로운 사람 간 관계를 효과적으로 유추할 수 있는가?
  • RQ4P-GNN의 링크 예측 성능는 개인 데이터 온톨로지 그래프에서 GCN과 비교해 어떻게 다른가?
  • RQ5신경망 파이프라인이 비구조화된 텍스트에서 사람 온톨로지를 얼마나 자동으로 구축할 수 있는가?

주요 결과

  • 제안된 NFGEC+ 모델은 OntoNotes 데이터셋에서 기준 모델(NFGEC)의 0.678 F1 점수 대비 0.740 F1 점수를 기록하여 유의미한 향상을 이룩했다.
  • 문장 임베딩을 사용한 On2Vec는 TACRED 데이터셋에서 뿐만 아니라 성능이 저조하여 정확도가 17.8%에 그쳐, 문장 수준의 입력이 관계 추출 성능 향상에 기여하지 못함을 시사한다.
  • 위치 인식 그래프 신경망(P-GNN)은 UDBMS 데이터셋에서 64.56%의 ROC AUC를 달성하여 GCN(46.89%)을 능가했다.
  • Elected Representatives 데이터셋에서는 P-GNN가 64.73%의 ROC AUC를 기록하여 GCN의 40.47%를 상회하여 일관된 우수성을 입증했다.
  • 시스템은 성공적으로 사람 온톨로지 그래프를 구축하였으며, 그림 9에서 시각화된 바와 같이, 질문 응답 및 추론과 같은 후행 작업을 지원한다.
  • 36개의 PDET 및 9개의 PDER 유형을 포함한 데이터셋은 공개되어 향후 개인 데이터 온톨로지 자동 구축 연구에 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.