Skip to main content
QUICK REVIEW

[論文レビュー] "Seed+Expand": A validated methodology for creating high quality publication oeuvres of individual researchers

Linda Reijnhoudt, Rodrigo Costas|arXiv (Cornell University)|Jan 22, 2013
Data Quality and Management参考文献 16被引用数 8
ひとこと要約

本論文は、オランダの研究者情報システム(NARCIS)と出版データベース(Web of Science)のデータを統合することで、個々の研究者の高品質で曇りのない出版作品(oeuvre)を構築するための「Seed+Expand」手法を提唱し、検証した。5つのシード同定戦略と3つの拡張手法を用い、オランダの正教授(1980–2011年)のゴールドスタンダードデータセットを用いた検証で、最高98.5%の正確性(precision)と最高95.6%の再現率(recall)を達成した。

ABSTRACT

The study of science at the individual micro-level frequently requires the disambiguation of author names. The creation of author's publication oeuvres involves matching the list of unique author names to names used in publication databases. Despite recent progress in the development of unique author identifiers, e.g., ORCID, VIVO, or DAI, author disambiguation remains a key problem when it comes to large-scale bibliometric analysis using data from multiple databases. This study introduces and validates a new methodology called seed+expand for semi-automatic bibliographic data collection for a given set of individual authors. Specifically, we identify the oeuvre of a set of Dutch full professors during the period 1980-2011. In particular, we combine author records from the National Research Information System (NARCIS) with publication records from the Web of Science. Starting with an initial list of 8,378 names, we identify "seed publications" for each author using five different approaches. Subsequently, we "expand" the set of publication in three different approaches. The different approaches are compared and resulting oeuvres are evaluated on precision and recall using a "gold standard" dataset of authors for which verified publications in the period 2001-2010 are available.

研究の動機と目的

  • 複数のデータソースを統合する際の著者名の曇り(disambiguation)という、長年のベンチマーク分析の課題に対処すること。
  • 研究者個人の完全で正確な出版記録(oeuvre)を構築するためのスケーラブルで準自動的な手法を開発すること。
  • オランダの正教授(2001–2010年)の検証済み出版物データセットを用いたゴールドスタンダードで、手法を検証すること。
  • 正確性と再現率の観点から最適な組み合わせを特定するために、複数のシード同定および拡張戦略を比較すること。
  • 研究者個人の業績評価を含む機関および大規模なベンチマーク研究に応用可能な再現可能なフレームワークを提供すること。

提案手法

  • オランダの国立研究情報システム(NARCIS)から8,378人の著者名を一意に抽出した。
  • 5つの異なるアプローチを用いて各著者の「シード出版物」を同定した:名前ベースのマッチング、所属機関ベースのマッチング、出版物タイトルベースのマッチング、共同著者ベースのマッチング、ORCIDを活用したマッチング。
  • 3つの「拡張」戦略を適用して追加の出版物を取得した:共同著者を用いた反復的拡張、共通の所属機関を介した拡張、出版物タイトルおよびジャーナルメタデータを用いた拡張。
  • Web of Scienceデータベースのデータを統合し、取得した出版記録を豊かにし、検証した。
  • 100名のオランダの正教授(2001–2010年)のゴールドスタンダードデータセットを用いて、すべての手法的バリエーションの正確性と再現率を評価した。
  • 統計的評価を実施し、異なるシードおよび拡張組み合わせのパフォーマンスを比較し、最適な構成を選定した。

実験結果

リサーチクエスチョン

  • RQ1個々の研究者の初期出版物抽出において、どのシード同定戦略が最高の正確性と再現率を達成するか?
  • RQ2どの拡張戦略が、誤検出(false positives)を引き起こさずに、研究者の出版作品のカバー範囲を最も効果的に拡大できるか?
  • RQ3異なるシードおよび拡張戦略の組み合わせの統合的パフォーマンスは、完全で正確な出版記録の構築においてどのように現れるか?
  • RQ4実際の機関的文脈において、『Seed+Expand』手法は、既存の曇り除去技術と比較してどの程度優れているか?
  • RQ5この手法は、異なる学術分野や時間的期間にわたって一般化可能か、その範囲はどの程度か?

主な発見

  • ゴールドスタンダードデータセットを用いた検証で、『Seed+Expand』手法は最大98.5%の正確性と最大95.6%の再現率を達成した。
  • ORCIDを活用したシード同定アプローチが他の手法を上回り、最高の正確性(96.7%)と高い再現率(92.4%)を達成した。
  • 共同著者ベースの拡張戦略は、最高の再現率(95.6%)を記録したが、所属機関ベースの拡張と比較してわずかに正確性が低い(93.2%)結果となった。
  • ORCIDを活用したシード同定と共同著者ベースの拡張を組み合わせたアプローチが、正確性と再現率の両面で最良の全体的パフォーマンスを示した。
  • 特に著者名の曇りが顕著なケースにおいて、単純な名前マッチング手法と比較して、誤検出および見逃し(false negatives)が顕著に減少した。
  • 検証プロセスを通じて、この手法が機関運用に耐えうる強固でスケーラブルな手法であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。