Skip to main content
QUICK REVIEW

[論文レビュー] Incorporating Word Sense Disambiguation in Neural Language Models

Jan Philip Wahle, Terry Ruas|arXiv (Cornell University)|Jun 15, 2021
Natural Language Processing Techniques参考文献 27被引用数 4
ひとこと要約

本稿では、WordNetの説明定義をニューラル言語モデルに統合することで、追加のパラメータをほとんど追加せずに、語義の意味づけ(WSD)を向上させる2つの教師あり事前学習手法—LMGCおよびLMGC-M—を提案する。マスクされた言語モデルと説明分類の両方を同時に学習することで、SemEvalおよびSensevalベンチマークでWSD性能が0.5% F1向上し、GLUEタスク全体で平均1.1%向上を達成。GlossBERT や KBERT-W+W といった最先端モデルを上回る性能を発揮する。

ABSTRACT

We present two supervised (pre-)training methods to incorporate gloss definitions from lexical resources into neural language models (LMs). The training improves our models' performance for Word Sense Disambiguation (WSD) but also benefits general language understanding tasks while adding almost no parameters. We evaluate our techniques with seven different neural LMs and find that XLNet is more suitable for WSD than BERT. Our best-performing methods exceeds state-of-the-art WSD techniques on the SemCor 3.0 dataset by 0.5% F1 and increase BERT's performance on the GLUE benchmark by 1.1% on average.

研究の動機と目的

  • 事前学習段階でWordNetの説明定義から得られる語彙的知識を統合することで、ニューラル言語モデルにおける語義の意味づけ(WSD)を向上させること。
  • WSD以外の下流NLPタスク、たとえばテキスト類似度や文分類におけるモデルのパフォーマンスを維持または向上させること。
  • 任意のTransformerベースの言語モデルに適用可能な一般化可能で、パラメータ効率の良い手法を構築すること。再トレーニングやアーキテクチャの変更を回避する。
  • WSD事前学習が、GLUEなどのベンチマークで向上したパフォーマンスによって測定可能な、一般的な言語理解の向上をもたらすかどうかを示すこと。
  • 再現可能性と知識拡張型言語モデル分野のさらなる研究を支援するため、公開可能な実装を提供すること。

提案手法

  • 本手法である言語モデル説明分類(LMGC)は、WSDをテキスト分類タスクとして扱い、文とWordNetの候補となる説明定義を特別トークンで区切って連結する。
  • モデルは、曖昧語を特別トークンで強調し、多義語を説明定義の前に付加することで、2つの教師信号を用いて微調整する。
  • 線形分類ヘッドを[CLS]トークンの表現に適用し、モデルの文脈的埋め込みを活用して正しい説明を予測する。
  • 強化された手法であるLMGC-Mは、マスクされた言語モデル(MLM)と説明分類を1回の学習プロセスで統合し、共同最適化によって表現学習を向上させる。
  • 単語埋め込みや注意機構に変更を加えずに、さまざまな事前学習済みモデル(例:BERT、RoBERTa、XLNet)に適用可能である。
  • パラメータ集約的なメカニズム(例:知識注意機構やワードピece再トークン化)を避けることで、効率性とスケーラビリティを確保する。

実験結果

リサーチクエスチョン

  • RQ1事前学習段階でWordNetの説明定義を統合することで、ニューラル言語モデルにおける語義の意味づけ(WSD)性能が向上するか?
  • RQ2説明定義を用いたWSD事前学習は、WSD以外の下流NLPタスクにおけるモデルの一般化能力を向上させるか?
  • RQ3MLMと説明分類の共同学習(LMGC-M)は、分離または逐次的な微調整と比較して、パフォーマンスと効率性の面で優れているか?
  • RQ4重いパラメータを持つモデル(例:KBERT-W+W)に比べ、軽量でパラメータ効率の良い手法が優れた性能を発揮できるか?
  • RQ5WSD事前学習は、GLUEやSuperGLUEのようなベンチマークでどの程度のパフォーマンス向上をもたらすか?

主な発見

  • LMGC-Mは、SemEvalおよびSenseval WSDベンチマークで、最高性能を示したベースライン(GlossBERT)と比較して、F1スコアで0.5%の絶対的向上を達成した。
  • GLUEベンチマークでは、BERT BASEベースラインと比較して平均1.1%のパフォーマンス向上を示し、一般的な言語理解の向上を裏付けた。
  • LMGC-Mは、約4倍のパラメータと32%の追加トレーニング時間を要するKBERT-W+Wを上回り、推論効率はほぼ同等を維持した。
  • MLMと説明分類の共同学習(LMGC-M)は、分離学習よりも優れたパフォーマンスを示し、意味的および文法的表現の相乗的学習が有効であることを示唆した。
  • XLNetベースのLMGC-Mは、追加のパラメータなしに、テストされたすべてのモデルの中で最高のWSDパフォーマンスを達成し、BERTやRoBERTaを上回った。
  • 本手法は一般化性に優れている:WSDで事前学習したモデルは、テキスト類似度、文分類、自然言語推論など、多様なNLPタスクで一貫した改善を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。