Skip to main content
QUICK REVIEW

[論文レビュー] Topological and Semantic Graph-based Author Disambiguation on DBLP Data in Neo4j

Valentina Franzoni, Michele Lepri|arXiv (Cornell University)|Jan 25, 2019
Advanced Graph Neural Networks参考文献 25被引用数 10
ひとこと要約

この論文では、Neo4jを用いてDBLPの書誌データセットにおける著者の一意特定のため、トポロジー的および意味的グラフベースの手法を提案する。2ステップのネットワーク走査によるトポロジー的類似度を活用し、最小限の入力(著者名と論文題名)で、全体のネットワーク知識を必要とせずに高い正確性、再現率、特異度を達成する。

ABSTRACT

In this work, we introduce a novel method for entity resolution author disambiguation in bibliographic networks. Such a method is based on a 2-steps network traversal using topological similarity measures for rating candidate nodes. Topological similarity is widely used in the Link Prediction application domain to assess the likelihood of an unknown link. A similarity function can be a good approximation for equality, therefore can be used to disambiguate, basing on the hypothesis that authors with many common co-authors are similar. Our method has experimented on a graph-based representation of the public DBLP Computer Science database. The results obtained are extremely encouraging regarding Precision, Accuracy, and Specificity. Further good aspects are the locality of the method for disambiguation assessment which avoids the need to know the global network, and the exploitation of only a few data, e.g. author name and paper title (i.e., co-authorship data).

研究の動機と目的

  • DBLPのような大規模な書誌ネットワークにおける著者名の一意特定の課題に対処すること。
  • 著者名と論文題名のみを用いて、豊富なメタデータに依存するのを減らすこと。
  • 全体のネットワークの全体像を必要とせずに、局所的な一意特定を可能にすること。
  • 共著者パターンを活用してトポロジー的類似度測定を用いることで、一意特定の正確性を向上させること。
  • Neo4jを用いて、実世界の書誌データにおいてグラフベース手法の有効性を実証すること。

提案手法

  • DBLPデータセットを、著者と論文のノード、および著者関係を表すリレーションシップとして、Neo4jにおけるプロパティグラフとして表現する。
  • 共著者を共有する著者を特定するため、2ステップのネットワーク走査を適用する。
  • 共通の隣接ノードと構造的近接度の指標を用いて、候補著者の間のトポロジー的類似度を計算する。
  • 論文題名の意味的類似度を二次的信号として用い、一意特定の意思決定を精緻化する。
  • トポロジー的類似度と意味的類似度のスコアを統合して候補著者をランク付けし、名前の曖昧さを解消する。
  • スケーラビリティを確保し、計算コストを低減するために、一意特定を局所的な近傍に制限する。

実験結果

リサーチクエスチョン

  • RQ1共著者ネットワークにおけるトポロジー的類似度は、正しい著者マッチングを特定する強力な信号となるか?
  • RQ2トポロジー的類似度と意味的類似度を組み合わせることで、単独で用いる場合と比較して、一意特定のパフォーマンスがどのように向上するか?
  • RQ3全体のネットワーク文脈がなくても、最小限の入力データ(著者名と論文題名)でどの程度一意特定が達成可能か?
  • RQ4局所的ネットワーク走査が、著者一意特定における正確性と特異度に与える影響はいかほどか?
  • RQ5実世界の書誌データ(例:DBLP)において、この手法はどのようにスケーリングし、性能を発揮するか?

主な発見

  • 本手法は、DBLPデータセットにおいて高い正確性、再現率、特異度を達成した。
  • 共著者を共有するというトポロジー的類似度は、正しい著者マッチングを特定する強力な信号を提供する。
  • トポロジー的類似度と意味的類似度を組み合わせることで、単独の信号よりも一意特定のパフォーマンスが向上した。
  • 本手法は局所的に動作するため、全体のネットワーク解析を必要とせず、スケーラビリティが向上する。
  • 本手法は、著者名と論文題名という最小限の入力のみを必要とするため、実世界の応用において実用的である。
  • 結果は実世界のデータセットで検証され、AIKE 2018で発表され、実用的応用性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。