Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Author Name Disambiguation with CNF Blocking

Kunho Kim, Athar Sefid|arXiv (Cornell University)|Sep 27, 2017
Data Quality and Management参考文献 21被引用数 7
ひとこと要約

この論文は、PubMedのような大規模な学術データベースにおけるスケーラブルな著者名の曖昧性解消(AND)のための、新しい結合正規形(CNF)ブロッキング手法を提案する。論文では、従来のDNR手法とは論理的に双対であるCNF形式のブロッキング述語を学習することで、10.5分間で82.17%の候補ペアを削減し、高い完全性(PC=0.99)を維持しながら、重複のないブロック生成によって並列クラスタリングを効率的に行えるようにする。

ABSTRACT

An author name disambiguation (AND) algorithm identifies a unique author entity record from all similar or same publication records in scholarly or similar databases. Typically, a clustering method is used that requires calculation of similarities between each possible record pair. However, the total number of pairs grows quadratically with the size of the author database making such clustering difficult for millions of records. One remedy for this is a blocking function that reduces the number of pairwise similarity calculations. Here, we introduce a new way of learning blocking schemes by using a conjunctive normal form (CNF) in contrast to the disjunctive normal form (DNF). We demonstrate on PubMed author records that CNF blocking reduces more pairs while preserving high pairs completeness compared to the previous methods that use a DNF with the computation time significantly reduced. Thus, these concepts in scholarly data can be better represented with CNFs. Moreover, we also show how to ensure that the method produces disjoint blocks so that the rest of the AND algorithm can be easily paralleled. Our CNF blocking tested on the entire PubMed database of 80 million author mentions efficiently removes 82.17% of all author record pairs in 10 minutes.

研究の動機と目的

  • 著者名の曖昧性解消(AND)のスケーラビリティ課題に取り組む。特に、レコード数の増加に伴いペairワイズ類似度計算が二次関数的に増加する、PubMedのような大規模学術データベースにおいて。
  • 特に人気のあるローマ字姓が原因で極めて大きなブロックが発生し、計算時間を圧迫するなど、ヒューリスティックブロッキング手法の非効率性と不均衡性を克服する。
  • 既存のDNRに基づく学習ブロッキングを改善し、論理的に双対なCNFに基づくアプローチを導入することで、より速い初期拒否と高い完全性を実現する。
  • クラスタリングの並列化を可能にするために、ブロックが重複しないようにする。
  • 8000万件の著者表記を含むPubMedの完全データベース上で、計算コストを低く抑えつつ高いペア削減効果を示す。

提案手法

  • 結合正規形(CNF)を用いたブロッキング関数を学習し、各ブロッキング述語を論理的論理和(例:(fn,first(5)) ∨ (fn,compatible))の論理積として表現することで、一致しないペアの早期拒否を効率的に行う。
  • F1スコアやジャコーデ係数などの利益関数を用いた貪欲な逐次カバー法を採用し、完全性と効率性を最適化するため、CNF式に追加する最良の述語項を反復的に選択する。
  • 最初の段階で純粋な論理積構造を強制することで、CNFブロッキングを拡張し、重複するブロックに属するレコードが存在しないようにし、クラスタリング段階のネイティブ並列化を可能にする。
  • CNFとDNRの論理的双対性を活用する:DNRは論理和の論理積を用いるが、CNFは論理積の論理和を用いるため、一致しないペアのプルーニングがより速く行える。
  • 欠落または曖昧な値(例:中间名、名前の表記のばらつき)に対応するため、新たな述語「compatible」を導入し、実世界の学術データにおける耐障害性を向上させる。
  • PubMedデータ上で監視付き学習設定を用いて評価し、PC(ペア完全性)とRR(削減比)の指標を用いて、DNRブロッキングおよびキャンバスクラスタリングと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1CNFに基づくブロッキング手法は、著者名の曖昧性解消において、既存のDNRに基づく学習ブロッキングよりもペア削減率、完全性、処理速度の面で優れているか?
  • RQ2CNFブロッキングは、DNRブロッキングと比較して、一致しないペアの早期拒否により、より速い処理を実現できるか?
  • RQ3CNFブロッキング手法は、完全性の損失が著しくない範囲で、重複のないブロックを生成できるか? これにより、効率的な並列クラスタリングが可能になるか?
  • RQ4本手法は、実世界の大規模データベース(PubMed、8000万件の著者表記)において、ペア削減率と実行時間の点で効果的か?
  • RQ5「compatible」述語は、欠落または変動する名前フィールドの存在下で、耐障害性と完全性を向上させる役割を果たしているか?

主な発見

  • CNFブロッキング手法は、8000万件の著者表記を含むPubMedの完全データベースで、24スレッドを用いて10.5分間で全可能な著者レコードペアの82.17%を削減した。
  • ペア完全性(PC)が0.99の条件下で、CNFブロッキングのブロッキング時間は1.39秒であり、DNRブロッキング(2.09秒)やキャンバスクラスタリング(0.44秒)よりも顕著に速かった。 ただし、キャンバスクラスタリングは最も速かったが、リコールが低かった。
  • CNFブロッキングは、完全性と効率性の両面でDNRブロッキングを上回った。特にPC>0.9の高水準で顕著で、学術データの概念がCNF形式でより適切に表現されることを示した。
  • 学習されたCNFブロッキング関数は「compatible」述語を頻繁に使用しており、欠落または変動する名前フィールドの処理においてその有効性が裏付けられた。
  • 非重複CNFブロッキング拡張は、PC=0.99で1.57秒のブロッキング時間を達成し、クラスタリング段階のネイティブ並列化を可能にした。
  • CNFの論理構造により、早期拒否がより速くなった:CNFは論理和の論理積であるため、1つの論理和項で失敗すれば即座にペアが拒否される。 一方、DNRではすべての項をチェックする必要がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。