Skip to main content
QUICK REVIEW

[論文レビュー] Using Similarity Measures to Select Pretraining Data for NER

Xiang Dai, Sarvnaz Karimi|arXiv (Cornell University)|Apr 1, 2019
Topic Modeling参考文献 50被引用数 18
ひとこと要約

本稿では、名前付きエンティティ認識(NER)のための事前学習データの効果を予測する3つの費用対効果に優れた類似度指標——ターゲット語彙カバー率、言語モデルのパープレクサリティ、単語ベクトルの分散——を提案する。これらの指標が性能を信頼性高く予測することを示しており、特に事前学習言語モデルを用いる場合、小規模で類似したデータセットが大規模で汎用的なものよりも優れていることが判明している。

ABSTRACT

Word vectors and Language Models (LMs) pretrained on a large amount of unlabelled data can dramatically improve various Natural Language Processing (NLP) tasks. However, the measure and impact of similarity between pretraining data and target task data are left to intuition. We propose three cost-effective measures to quantify different aspects of similarity between source pretraining and target task data. We demonstrate that these measures are good predictors of the usefulness of pretrained models for Named Entity Recognition (NER) over 30 data pairs. Results also suggest that pretrained LMs are more effective and more predictable than pretrained word vectors, but pretrained word vectors are better when pretraining data is dissimilar.

研究の動機と目的

  • 現在、ヒューリスティックな直感に依存しているが、NERタスクのための事前学習データ選択に体系的な手法が不足している問題に対処する。
  • 事前学習済み単語ベクトルや言語モデルがターゲットNERデータセットでどれほど効果的に機能するかを予測できる、コスト効率の良い定量的指標を開発する。
  • 分野(主題分野)とトーン(対話的文脈)の両方の類似性が、効果的な事前学習に不可欠であるかどうかを調査する。
  • 小規模で類似した事前学習データが、性能と計算コストの面で大規模で汎用的なコーパスを上回る可能性があるかどうかを評価する。
  • 研究者が広範な試行錯誤を経ずに、実用的でデータ駆動型のフレームワークを提供する。

提案手法

  • 3つの類似度指標を提案する:(1) ターゲット語彙カバー率(VCcR)、ソース語彙とターゲット語彙の語彙的重複度を測定する;(2) 言語モデルのパープレクサリティ、ターゲットデータに言語モデルがどの程度適合するかを評価する;(3) 単語ベクトルの分散、ターゲットデータで微調整した際の単語ベクトルの変化を測定する。
  • 単語ベクトルはネガティブサンプリングを用いたスキップグラム(word2vec)で、言語モデルは標準的なトランスフォーマーに基づくアーキテクチャで、さまざまなソースコーパスで学習する。
  • 5つのソースと6つのターゲットNERデータセットを用いて、30組のデータペアで事前学習モデルを評価し、生物学や地域ビジネスなど多様な分野と、ウィキペディア、レビュー、医療プロトコルなど多様なトーンをカバーする。
  • 各指標が下流のNER F1スコアの向上をどの程度うまく予測できるかを評価するために、統計的相関分析を実施する。
  • アブレーションスタディを実施し、ソースデータサイズ、類似性、ハイパーパramータ設定がモデル性能に与える影響を分離して分析する。
  • コスト効率を検証するため、はるかに大規模なコーパスで事前学習された公開モデルと比較する。

実験結果

リサーチクエスチョン

  • RQ1ターゲット語彙カバー率、言語モデルのパープレクサリティ、単語ベクトルの分散は、NERのための事前学習データの効果を信頼性高く予測できるか?
  • RQ2分野とトーンの両方の類似性が、事前学習モデルの性能に顕著な影響を与えるのか、それとも分野の類似性だけで十分か?
  • RQ3小規模でドメイン特化した事前学習コーパスが、NER性能と計算コストの面で大規模で汎用的なコーパスを上回る可能性があるか?
  • RQ4事前学習済み単語ベクトルと事前学習済み言語モデルの選択は、ソースとターゲットデータの類似性にどのように依存するか?
  • RQ5ソースデータサイズが、類似性がモデル性能に与える影響を緩和する程度はどの程度か?

主な発見

  • ターゲット語彙カバー率(VCcR)は、事前学習済み単語ベクトルの効果を予測する最強の指標であり、語彙の重複度が高いほどNER性能が著しく向上する。
  • ソースとターゲットデータが類似している場合、事前学習済み言語モデルは単語ベクトルを上回り、最適化設定でWetLabでは最大79.62 F1、ScienceIEでは42.07 F1を達成する。
  • 500 MBのPubMedデータ(小規模で類似したコーパス)で事前学習したモデルは、10億トークンの汎用データで学習したモデルを上回り、学習時間を週単位から数時間に短縮する。
  • 類似性が低いデータペア(例:PubMedからCoNLL2003)では、ソースサイズにかかわらず、事前学習済み単語ベクトルが常に言語モデルを上回る。
  • Chiuら(2016)が提案したハイパーパramータ設定は、ほとんどのデータペアで単語ベクトルの性能を向上させるが、類似性の影響が依然として優勢である。
  • ソースデータサイズが500 MBを超えると収益逓減の傾向を示し、効果的な事前学習において類似性がサイズよりも重要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。