Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning vs. Rules and Out-of-the-Box vs. Retrained: An Evaluation of Open-Source Bibliographic Reference and Citation Parsers

Dominika Tkaczyk, Andrew Collins|arXiv (Cornell University)|Feb 4, 2018
Natural Language Processing Techniques被引用数 6
ひとこと要約

この論文は、10種類のオープンソースの文献引用情報および引用情報パーサーを評価し、機械学習ベースのアプローチとルールベースのアプローチ、およびデフォルト設定(out-of-the-box)と再訓練済みのモデルを比較している。機械学習ツールはルールベースのものよりも再帰率(recall)で顕著に優れており(0.66 対 0.22)、GROBID がデフォルト設定で最高の F1 スコア(0.89)を記録した。また、再訓練によりすべてのツールの性能が向上し、特に CERMINE(+11%)と ParsCit(+16%)で顕著な向上が見られた。

ABSTRACT

Bibliographic reference parsing refers to extracting machine-readable metadata, such as the names of the authors, the title, or journal name, from bibliographic reference strings. Many approaches to this problem have been proposed so far, including regular expressions, knowledge bases and supervised machine learning. Many open source reference parsers based on various algorithms are also available. In this paper, we apply, evaluate and compare ten reference parsing tools in a specific business use case. The tools are Anystyle-Parser, Biblio, CERMINE, Citation, Citation-Parser, GROBID, ParsCit, PDFSSA4MET, Reference Tagger and Science Parse, and we compare them in both their out-of-the-box versions and versions tuned to the project-specific data. According to our evaluation, the best performing out-of-the-box tool is GROBID (F1 0.89), followed by CERMINE (F1 0.83) and ParsCit (F1 0.75). We also found that even though machine learning-based tools and tools based on rules or regular expressions achieve on average similar precision (0.77 for ML-based tools vs. 0.76 for non-ML-based tools), applying machine learning-based tools results in a recall three times higher than in the case of non-ML-based tools (0.66 vs. 0.22). Our study also confirms that tuning the models to the task-specific data results in the increase in the quality. The retrained versions of reference parsers are in all cases better than their out-of-the-box counterparts; for GROBID F1 increased by 3% (0.92 vs. 0.89), for CERMINE by 11% (0.92 vs. 0.83), and for ParsCit by 16% (0.87 vs. 0.75).

研究の動機と目的

  • 実世界のビジネスユースケースにおける10種類のオープンソースの文献引用情報および引用情報パーサーの性能を評価・比較すること。
  • 機械学習ベースのパーサーが、ルールベースまたは正規表現ベースのパーサーに比べて、正確性と頑健性の面で優れているかどうかを評価すること。
  • プロジェクト固有のデータを用いた再訓練が、パーサーの性能に与える影響を調査すること。
  • デジタル図書館や学術的テキスト処理における高精度・高再帰率の文献メタデータ抽出に最も効果的なツールと設定を特定すること。

提案手法

  • Anystyle-Parser、Biblio、CERMINE、Citation、Citation-Parser、GROBID、ParsCit、PDFSSA4MET、Reference Tagger、Science Parse の10種類のオープンソースの参照および引用情報パーサーを選定した。
  • プロジェクト固有のデータセット(文献引用文字列)を用いて、各パーサーをデフォルト設定と再訓練済みの両方の設定で評価した。
  • 標準的な情報検索メトリクス(精度、再帰率、F1 スコア)を用いて、ツールおよび設定間での性能を比較した。
  • 異なるアーキテクチャを持つツール間での公平な比較を確保するため、一貫した評価プロトコルとラベル付き真値データを用いた。
  • ドメイン適応の効果を評価するため、プロジェクト固有のデータを用いて機械学習ベースのツールを再訓練した。
  • 性能特性の相対比較を可能にするために、ツールを機械学習ベースとルールベースに分類した。

実験結果

リサーチクエスチョン

  • RQ1実世界のデータセットにおいて、機械学習ベースの参照パーサーはルールベースのパーサーと比べて、精度と再帰率の面でどの程度異なるか?
  • RQ2同じパーサーのデフォルト設定と再訓練済み設定の間で、性能にどのような差があるか?
  • RQ3デフォルト設定および再訓練済み設定の両方で、最も高い F1 スコアを達成するのはどのパーサーか?
  • RQ4ドメイン固有の再訓練が、参照および引用パーサーの性能にどの程度向上効果をもたらすか?
  • RQ5機械学習ベースのパーサーは一貫してルールベースのパーサーを上回るのか? もしそうなら、どのメトリクスで上回っているか?

主な発見

  • GROBID はデフォルト設定で最高の F1 スコア(0.89)を記録し、次いで CERMINE(0.83)、ParsCit(0.75)が続く。
  • 機械学習ベースのツールは、精度がほぼ同等(0.77 対 0.76)であるにもかかわらず、再帰率が顕著に高く(0.66 対 0.22)なった。
  • 再訓練によりすべてのパーサーの性能が向上し、相対的な向上率が最も大きかったのは ParsCit(F1 で +16%)、次いで CERMINE(+11%)、GROBID(+3%)であった。
  • GROBID の再訓練済みバージョンは F1 スコア 0.92 を達成し、デフォルト設定の 0.89 を上回った。
  • CERMINE の F1 スコアは再訓練後、0.83 から 0.92 に上昇し、ドメイン固有データへの適応性の高さが示された。
  • ParsCit の F1 スコアは再訓練後、0.75 から 0.87 に向上し、中程度の性能であったツールでもファインチューニングによる恩恵が得られることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。