Skip to main content
QUICK REVIEW

[論文レビュー] Quantifying the Contextualization of Word Representations with Semantic Class Probing

Mengjie Zhao, Philipp Dufter|arXiv (Cornell University)|Apr 25, 2020
Topic Modeling被引用数 4
ひとこと要約

この論文は、文脈化された単語埋め込みからの意味的クラス(s-classes)推定を用いて、BERTにおける文脈化を定量化する。下位層が文脈化に最も寄与しており、±5語の局所的文脈で十分であり、微調整により事前学習済みの文脈化知識が保持される一方で、上位層がタスク固有の性質を強めることが判明した。

ABSTRACT

Pretrained language models have achieved a new state of the art on many NLP tasks, but there are still many open questions about how and why they work so well. We investigate the contextualization of words in BERT. We quantify the amount of contextualization, i.e., how well words are interpreted in context, by studying the extent to which semantic classes of a word can be inferred from its contextualized embeddings. Quantifying contextualization helps in understanding and utilizing pretrained language models. We show that top layer representations achieve high accuracy inferring semantic classes; that the strongest contextualization effects occur in the lower layers; that local context is mostly sufficient for semantic class inference; and that top layer representations are more task-specific after finetuning while lower layer representations are more transferable. Finetuning uncovers task related features, but pretrained knowledge is still largely preserved.

研究の動機と目的

  • BERTが意味的クラス推定を用いて、文脈における単語の解釈がどの程度効果的に行われるかを定量的に測定すること。
  • BERTにおける文脈化に寄与する個々のネットワーク層の寄与度を調査すること。
  • 文脈ウィンドウサイズの大きさが単語表現の文脈化に与える影響を評価すること。
  • 微調整がBERT表現の文脈化能力に与える影響を分析すること。
  • 微調整後に事前学習済みの文脈化知識がどの程度保持されるかを評価すること。

提案手法

  • ターゲット単語の意味的クラス(s-classes)を予測する診断分類器を用いて、文脈化されたBERT単語埋め込みをプローブすること。
  • Wikipediaベースの意味的クラスリソース(Wiki-PSE)を用いて、意味的クラスを定義・ラベル付けし、語義の明確化を行うこと。
  • BERTの各層、文脈ウィンドウサイズ、事前学習済みモデル対微調整済みモデルの間で、s-classes推定のパフォーマンスを評価すること。
  • F1スコアを用いて文脈化を測定し、高いスコアがより強い文脈解釈を示すものとする。
  • 完全な文の文脈から局所的文脈ウィンドウ(例:±5語)への比較を行い、文脈長の要件を評価すること。
  • 下流タスクにおける微調整前後でのs-classes推定パフォーマンスの変化を分析し、表現の適応を研究すること。

実験結果

リサーチクエスチョン

  • RQ1BERTの文脈化された単語埋め込みは、文脈における単語の意味的クラスをどの程度効果的に推定できるか?
  • RQ2どのBERT層が文脈化に最も寄与しており、層ごとの寄与度はどのように変化するか?
  • RQ3有効な単語文脈化に必要な文脈(語のウィンドウサイズ)はどの程度か?
  • RQ4微調整はBERT表現の文脈化能力にどのように影響するか?
  • RQ5微調整後に事前学習済みの文脈化知識はどの程度保持されるか?

主な発見

  • BERTは高いs-classes推定パフォーマンス(F1 ≈ 85%)を達成しており、強力な文脈化が可能であるが、改善の余地がある。
  • 最も顕著な文脈化効果はBERTの下位層に見られ、上位2層では最小限の増分的向上が得られる。
  • 局所的文脈(10語ウィンドウ、±5語)で十分に効果的な文脈化が可能であるため、完全な文のアテンションが必ずしも必要ではない。
  • 微調整により、品詞タグ付けなどの単語レベルタスクでは上位層表現に顕著な変化が生じるが、類似文同定などの文レベルタスクではそれほど顕著ではない。
  • 微調整後も事前学習済みの文脈化知識は良好に保持されており、特に下位層では高い転送性を維持している。
  • 微調整後、上位層表現はタスク固有の性質を強める一方で、下位層表現は一般化された文脈化能力を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。