Skip to main content
QUICK REVIEW

[논문 리뷰] Topological and Semantic Graph-based Author Disambiguation on DBLP Data in Neo4j

Valentina Franzoni, Michele Lepri|arXiv (Cornell University)|2019. 01. 25.
Advanced Graph Neural Networks참고 문헌 25인용 수 10
한 줄 요약

이 논문은 DBLP 문헌 데이터셋에서 Neo4j를 사용하여 위상적이고 의미론적인 그래프 기반 방법을 제안한다. 2단계 네트워크 탐색을 통한 위상적 유사도를 활용하고, 최소한의 입력(이름과 논문 제목)만을 요구함으로써 전역 네트워크 지식이 필요 없이도 높은 정밀도, 정확도, 특이도를 달성한다.

ABSTRACT

In this work, we introduce a novel method for entity resolution author disambiguation in bibliographic networks. Such a method is based on a 2-steps network traversal using topological similarity measures for rating candidate nodes. Topological similarity is widely used in the Link Prediction application domain to assess the likelihood of an unknown link. A similarity function can be a good approximation for equality, therefore can be used to disambiguate, basing on the hypothesis that authors with many common co-authors are similar. Our method has experimented on a graph-based representation of the public DBLP Computer Science database. The results obtained are extremely encouraging regarding Precision, Accuracy, and Specificity. Further good aspects are the locality of the method for disambiguation assessment which avoids the need to know the global network, and the exploitation of only a few data, e.g. author name and paper title (i.e., co-authorship data).

연구 동기 및 목표

  • DBLP와 같은 대규모 문헌 네트워크에서 저자 이름 간섭 해소 문제를 해결한다.
  • 저자 이름과 논문 제목 이외의 광범위한 메타데이터에 의존도를 줄이기 위해 최소한의 입력 데이터로 간섭 해소를 수행한다.
  • 전체 네트워크의 전역 지식이 필요 없이 국소적 해소를 가능하게 한다.
  • 공저자 패턴을 이용한 위상적 유사도 측정을 통해 간섭 해소 정확도를 향상시킨다.
  • Neo4j를 사용하여 실제 문헌 데이터에서 그래프 기반 방법의 효과성을 입증한다.

제안 방법

  • 저자와 논문을 노드로, 저자성을 관계로 하는 속성 그래프로 DBLP 데이터셋을 표현한다.
  • 공동 저자를 공유하는 기반으로 2단계 네트워크 탐색을 적용하여 후보 저자를 식별한다.
  • 공통 이웃과 구조적 근접도 측정을 사용하여 후보 저자 간의 위상적 유사도를 계산한다.
  • 논문 제목의 의미론적 유사도를 보조 신호로 활용하여 간섭 해소 결정을 정밀화한다.
  • 위상적 유사도와 의미론적 유사도 점수를 통합하여 후보 저자를 순위 매겨 이름 간섭을 해결한다.
  • 확장성과 계산 오버헤드 감소를 위해 간섭 해소를 국소적 주변부로 제한한다.

실험 결과

연구 질문

  • RQ1공저자 네트워크에서의 위상적 유사도가 간섭 해소된 저자 정체성을 효과적으로 식별하는 데 유용한가?
  • RQ2위상적 유사도와 의미론적 유사도를 결합하면 각각을 별도로 사용할 때보다 간섭 해소 성능을 어떻게 향상시키는가?
  • RQ3전체 네트워크 맥락 없이도 최소한의 입력 데이터(이름과 논문 제목)로 간섭 해소를 어느 정도 달성할 수 있는가?
  • RQ4국소적 네트워크 탐색이 저자 간섭 해소에서 정밀도와 특이도에 어떤 영향을 미치는가?
  • RQ5이 방법은 실제 문헌 데이터인 DBLP와 같은 실세계 데이터에서 어떻게 확장성과 성능을 발휘하는가?

주요 결과

  • 이 방법은 DBLP 데이터셋에서 높은 정밀도, 정확도, 특이도를 달성한다.
  • 공동 저자를 공유하는 기반의 위상적 유사도가 올바른 저자 매칭을 식별하는 강력한 신호를 제공한다.
  • 위상적 유사도와 의미론적 유사도의 조합은 각각의 신호만을 사용할 때보다 간섭 해소 성능을 향상시킨다.
  • 이 방법은 전역 네트워크 분석이 필요 없이 국소적으로 작동하므로 확장성을 향상시킨다.
  • 이 방법은 실질적인 응용에 적합하기 위해 최소한의 입력(저자 이름과 논문 제목)만을 요구한다.
  • 결과는 실세계 데이터셋에서 검증되었으며, AIKE 2018에서 발표되어 실용적 적용 가능성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.