Skip to main content
QUICK REVIEW

[論文レビュー] Neighborhood Contrastive Learning for Scientific Document Representations with Citation Embeddings

Malte Ostendorff, Nils Rethmeier|arXiv (Cornell University)|Feb 14, 2022
Topic Modeling被引用数 10
ひとこと要約

本稿では、引用グラフ埋め込みを用いて連続的で重複のないポジティブおよびネガティブサンプルを生成する、科学的文書表現のための近接対照的学習手法であるSciNCLを提案する。引用埋め込み空間内のk近傍からサンプリングすることで、SciNCLは1%のトレーニングトリプレットのみを用いても、SPECTERの80.0に対し81.8の最先端性能を達成し、汎用言語モデルと組み合わせた場合、ドメイン内事前学習モデルを上回る。

ABSTRACT

Learning scientific document representations can be substantially improved through contrastive learning objectives, where the challenge lies in creating positive and negative training samples that encode the desired similarity semantics. Prior work relies on discrete citation relations to generate contrast samples. However, discrete citations enforce a hard cut-off to similarity. This is counter-intuitive to similarity-based learning, and ignores that scientific papers can be very similar despite lacking a direct citation - a core problem of finding related research. Instead, we use controlled nearest neighbor sampling over citation graph embeddings for contrastive learning. This control allows us to learn continuous similarity, to sample hard-to-learn negatives and positives, and also to avoid collisions between negative and positive samples by controlling the sampling margin between them. The resulting method SciNCL outperforms the state-of-the-art on the SciDocs benchmark. Furthermore, we demonstrate that it can train (or tune) models sample-efficiently, and that it can be combined with recent training-efficient methods. Perhaps surprisingly, even training a general-domain language model this way outperforms baselines pretrained in-domain.

研究の動機と目的

  • 直接的な引用がポジティブおよびネガティブサンプル間の硬いカットオフと重複を引き起こすため、離散的引用に基づく対照的学習の限界を是正すること。
  • 引用グラフ埋め込みからの連続的類似度信号を活用することで、サンプルの効率性と表現品質を向上させること。
  • ポジティブ・ネガティブサンプルの重複を回避し、サンプリングの難易度を制御することが、ドメイン内事前学習よりも科学的NLPタスクにおいて効果的であることを示すこと。
  • 最小限のデータと計算リソースで、一般ドメイン言語モデルの微調整を効果的に行えるようにすること、たとえ更新されるパラメータがバイアスパラメータのみであっても同様である。

提案手法

  • SciNCLは、離散的引用関係に代わって、連続的で無向の類似度信号として引用グラフ埋め込みを用いて対照的サンプルを生成する。
  • ポジティブおよびネガティブサンプルは、引用埋め込み空間内のk近傍から選択され、重複を避けるために設定可能なマージンを用いる。
  • 本手法は、類似した論文(ポジティブ)を埋め込み空間ですり合わせ、類似しないもの(ネガティブ)を遠ざける対照的学習目的関数を採用する。
  • ハードネガティブは、ポジティブクラスタの周囲のマージンからサンプリングされ、困難ではあるが重複しないように保証される。
  • 本手法は、BERT-Base や BERT-Large などの一般ドメインモデルを含む、任意の事前学習言語モデルと互換性を持つ。
  • 1%のトリプレットのみでトレーニングするか、BitFit(バイアス項のみを学習)を用いることで、計算コストを顕著に削減するサンプル効率性を達成する。

実験結果

リサーチクエスチョン

  • RQ1引用グラフ埋め込みからの連続的類似度信号は、離散的引用関係に比べ、科学的文書表現学習を改善できるか?
  • RQ2ポジティブ・ネガティブペア間のサンプリングマージンを制御することで、より良い性能が得られ、勾配崩壊を回避できるか?
  • RQ31%のトレーニングトリプレットまたは最小限のパラメータ更新(例:BitFit)を用いても、SciNCLは最先端の結果を達成できるか?
  • RQ4一般ドメイン言語モデルをSciNCLで微調整することは、SciBERTのようなドメイン内事前学習よりも効果的か?

主な発見

  • SciNCLは、SciDocsベンチマークで81.8という新記録を達成し、SPECTERの80.0を上回った。
  • トレーニングトリプレットの1%でのみ学習した場合、80.8のスコアを達成し、SPECTERのベースラインより0.8ポイント高く、一部の設定ではオラクルトリプレットよりも1.0ポイント高い。
  • BitFit(パラメータの0.1%のみを学習)を用いた場合、81.2のスコアを達成し、高いパラメータ効率性を示した。
  • 一般ドメインBERTモデルをSciNCLで微調整した結果、ドメイン内事前学習(SPECTERを含む)を上回った。これは、サンプルの質がドメイン特化事前学習よりも優れていることを示唆する。
  • テストおよび検証用論文をトレーニングから除外しても、本手法は安定しており、データ漏洩の問題がないことが示された。
  • SciNCLの性能向上は、主にサンプリング戦略の改善によるものであり、モデルアーキテクチャーや事前学習データの影響ではない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。