Skip to main content
QUICK REVIEW

[論文レビュー] Random Forest DBSCAN for USPTO Inventor Name Disambiguation

Kunho Kim, Madian Khabsa|arXiv (Cornell University)|Feb 4, 2016
Data Quality and Management参考文献 22被引用数 12
ひとこと要約

本論文では、ランダムフォレスト分類器を用いて対照的類似度を計算し、DBSCANを用いてクラスタリングすることで、USPTO特許データベースにおける発明者名の曖昧性解消のスケーラブルで機械学習ベースの手法を提案する。この手法は、USPTO PatentsViewコンペティションデータセットにおいて最先端の性能を達成し、1200万件の発明者名の曖昧性解消を6.5時間で実行した。F1スコアは、すべての競合アルゴリズムを上回った。

ABSTRACT

Name disambiguation and the subsequent name conflation are essential for the correct processing of person name queries in a digital library or other database. It distinguishes each unique person from all other records in the database. We study inventor name disambiguation for a patent database using methods and features from earlier work on author name disambiguation and propose a feature set appropriate for a patent database. A random forest was selected for the pairwise linking classifier since they outperform Naive Bayes, Logistic Regression, Support Vector Machines (SVM), Conditional Inference Tree, and Decision Trees. Blocking size, very important for scaling, was selected based on experiments that determined feature importance and accuracy. The DBSCAN algorithm is used for clustering records, using a distance function derived from random forest classifier. For additional scalability clustering was parallelized. Tests on the USPTO patent database show that our method successfully disambiguated 12 million inventor mentions within 6.5 hours. Evaluation on datasets from USPTO PatentsView inventor name disambiguation competition shows our algorithm outperforms all algorithms in the competition.

研究の動機と目的

  • 共通の姓、名前の表記のばらつき、およびスペルミスのため、名前が曖昧になりがちな大規模特許データベースにおける発明者名の曖昧性解消の課題に対処すること。
  • 一般の著者名の曖昧性解消特徴とは異なり、特許メタデータに特化した特徴セットを構築し、曖昧性解消の正確性を向上させること。
  • 数百万件の発明者レコードを効率的に処理できるスケーラブルで並列処理可能なシステムを設計すること。
  • ランダムフォレストとDBSCANを組み合わせたパイプラインを用いて、USPTO PatentsView発明者名曖昧性解消コンペティションで既存のアルゴリズムを上回ること。

提案手法

  • 特許メタデータから得られる名前の表記のばらつき、所属機関、出願履歴などの特徴セットをカスタムで作成し、その上でランダムフォレスト分類器を学習する。
  • 発明者レコード間の対照的類似度は、ランダムフォレスト分類器が同一発明者と判断した割合として計算される。
  • ランダムフォレストから得られる距離関数を用いてDBSCANクラスタリングを実行し、レコードを一意の発明者クラスタにグループ化する。
  • 計算複雑性を低減するためにブロッキングを適用し、複数コアにブロックをスケジューリングすることで並列処理を実現する。
  • 人気のある名前による大きなブロックを管理するため、メモリに配慮したブロッキング戦略を採用しているが、それでもメモリがボトルネックのままである。
  • 標準的な指標(精度、再現率、F1スコア)を用いて、USPTO PatentsViewコンペティションデータセット上で手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1特許に特化した特徴で学習されたランダムフォレスト分類器は、SVM、ナイーブベイズ、ロジスティック回帰といった従来の分類器よりも、発明者名の曖昧性解消において優れた性能を示すか?
  • RQ2ランダムフォレストベースの類似度関数とDBSCANクラスタリングを組み合わせることで、他のクラスタリングや分類手法よりも曖昧性解消の正確性が向上するか?
  • RQ3提案されたブロッキングおよび並列処理戦略は、1200万件のレコードを含む特許データベースにおいて、スケーラビリティと実行時間性能にどのような影響を与えるか?
  • RQ4本手法は、USPTO PatentsViewコンペティションにおける既存のソリューションと比較して、再現率とF1スコアをどの程度向上させるか?

主な発見

  • 提案手法は、すべてのテストセットで平均F1スコア0.9882 ± 0.0029を達成し、コンペティション優勝者のF1スコア0.9827 ± 0.0035(片側Wilcoxon検定、p = 0.03125)を有意に上回った。
  • ランダムフォレスト分類器は、最小で0.05%のアウトオブバッグ(OOB)誤差率を達成し、対照的分類の信頼性が非常に高いことを示した。
  • 12コアのマシン上で1200万件の発明者名の曖昧性解消を6.5時間で完了し、並列処理による強力なスケーラビリティを示した。
  • 「共通の特徴」データセットでは、サンプル数が多いためかつてないほどデータベース全体の分布をよく反映しており、わずかに高い性能を示した。
  • 再現率が精度よりも低く、ブロッキングによって一部の真の一致が検出されなかったことが示され、ブロッキング戦略の改善の余地があることがわかった。
  • ランダムフォレストの投票から得られる学習済み距離関数は、手作業で設計された指標よりも効果的であり、優れたクラスタリング性能を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。