Skip to main content
QUICK REVIEW

[論文レビュー] Synthetic vs. Real Reference Strings for Citation Parsing, and the Importance of Re-training and Out-Of-Sample Data for Meaningful Evaluations: Experiments with GROBID, GIANT and Cora

Mark Grennan, Joeran Beel|arXiv (Cornell University)|Apr 22, 2020
Natural Language Processing Techniques参考文献 31被引用数 4
ひとこと要約

本研究では、citation parserの学習に用いる合成参照文字列と実際の参照文字列の有効性を評価し、GIANTデータセットから得た合成データがGROBIDの学習に用いられた場合、実データと同等の性能(F1 = 0.74)を示すことを実証した。再訓練により性能が著しく向上(F1 +30%)し、学習時に多様な分野タイプを含めることで、評価対象外の分野であっても結果が向上(F1 +13.5%)することから、citation parsingモデルに合成データが有効であることが示された。

ABSTRACT

Citation parsing, particularly with deep neural networks, suffers from a lack of training data as available datasets typically contain only a few thousand training instances. Manually labelling citation strings is very time-consuming, hence synthetically created training data could be a solution. However, as of now, it is unknown if synthetically created reference-strings are suitable to train machine learning algorithms for citation parsing. To find out, we train Grobid, which uses Conditional Random Fields, with a) human-labelled reference strings from 'real' bibliographies and b) synthetically created reference strings from the GIANT dataset. We find that both synthetic and organic reference strings are equally suited for training Grobid (F1 = 0.74). We additionally find that retraining Grobid has a notable impact on its performance, for both synthetic and real data (+30% in F1). Having as many types of labelled fields as possible during training also improves effectiveness, even if these fields are not available in the evaluation data (+13.5% F1). We conclude that synthetic data is suitable for training (deep) citation parsing models. We further suggest that in future evaluations of reference parsers both evaluation data similar and dissimilar to the training data should be used for more meaningful evaluations.

研究の動機と目的

  • GIANTデータセットの合成参照文字列がcitation parsingモデルの学習に適しているかどうかを評価すること。
  • GROBIDの性能を、合成データと人間ラベルによる実際のcitation文字列の両方で学習した場合に比較すること。
  • 学習中に多様な分野タイプを含めることのモデル効果への影響を調査すること。
  • out-of-sampleデータの重要性がcitation parserの意味のある性能評価に与える影響を評価すること。
  • citation parsingシステムの学習と評価に関する、根拠に基づく推奨事項を提示すること。

提案手法

  • GROBID(CRFベースのcitation parser)を、GIANTデータセットの合成参照文字列とCoraデータセットの実際の人間ラベル付きcitation文字列の両方で学習した。
  • 再訓練を実施し、合成データおよび実データの両方でF1スコアの向上を評価した。
  • 評価データに存在しない分野であっても、学習時に幅広いラベル付き分野を組み込んだ。
  • 学習中に見られなかったデータ(out-of-sampleデータ)を用いて、モデルの汎化性能と頑健性を評価した。
  • 複数の実験的設定において、主にF1スコアを指標として性能を測定した。
  • 訓練データの種別(合成対実データ)、再訓練の有無、分野の多様性を比較し、主な性能要因を特定した。

実験結果

リサーチクエスチョン

  • RQ1GIANTデータセットの合成参照文字列は、実際の人間ラベル付きデータと同等の性能を示すcitation parsingモデルの学習に有効に機能するか?
  • RQ2GROBIDのようなcitation parserが、合成データまたは実データで学習された場合、再訓練がF1スコアに与える影響はいかほどか?
  • RQ3学習時により多様なラベル付き分野を含めることで、評価対象外の分野であってもパーサーの性能が向上するか?
  • RQ4out-of-sampleデータは、citation parserの評価の妥当性をどの程度向上させるか?
  • RQ5合成データは、citation parsingシステムの学習と評価の代替として実用的か?

主な発見

  • GIANTデータセットの合成参照文字列を用いてGROBIDを学習した場合、実際の人間ラベル付き文字列と同等のF1スコア(0.74)を達成した。
  • モデルの再訓練により、合成データおよび実データの両方でF1スコアが30%向上し、その影響が顕著であることが示された。
  • 学習時に多様な分野タイプを含めることで、評価データに存在しない分野であってもF1スコアが13.5%向上した。
  • 本研究では、合成データがcitation parsingモデルの学習に実用的で効果的な代替手段であることが示された。
  • 評価に類似および非類似のout-of-sampleデータを併用することで、より意味的で頑健な性能評価が可能になる。
  • 再訓練と多様な分野の表現を組み合わせることで、合成データをcitation parserの学習に活用することが支持される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。