Skip to main content
QUICK REVIEW

[論文レビュー] Contextualized Word Embeddings Encode Aspects of Human-Like Word Sense Knowledge

Sathvik Nair, Mahesh Srinivasan|arXiv (Cornell University)|Oct 25, 2020
Language and cultural evolution被引用数 15
ひとこと要約

本研究では、BERTに基づく文脈依存単語埋め込みが、多義性と同音異義の違いを人間の認識に類似して捉えているかどうかを調査する。ウェブベースの空間配置タスクを通じて、32語の英単語について参加者が意味の類縁度を評価した。その結果、BERT埋め込みはこれらの判断を信頼性高く表現しており、同音異義語(例:動物としてのbatとスポーツ用具としてのbat)の意味は多義語(例:動物としてのchickenと肉としてのchicken)よりも埋め込み空間で顕著に離れていることが判明し、ニューラル表現が意味の類縁度に関する人間の直感を反映していることが示された。

ABSTRACT

Understanding context-dependent variation in word meanings is a key aspect of human language comprehension supported by the lexicon. Lexicographic resources (e.g., WordNet) capture only some of this context-dependent variation; for example, they often do not encode how closely senses, or discretized word meanings, are related to one another. Our work investigates whether recent advances in NLP, specifically contextualized word embeddings, capture human-like distinctions between English word senses, such as polysemy and homonymy. We collect data from a behavioral, web-based experiment, in which participants provide judgments of the relatedness of multiple WordNet senses of a word in a two-dimensional spatial arrangement task. We find that participants' judgments of the relatedness between senses are correlated with distances between senses in the BERT embedding space. Homonymous senses (e.g., bat as mammal vs. bat as sports equipment) are reliably more distant from one another in the embedding space than polysemous ones (e.g., chicken as animal vs. chicken as meat). Our findings point towards the potential utility of continuous-space representations of sense meanings.

研究の動機と目的

  • 文脈依存単語埋め込み(例:BERT)が、人間の意味の類縁度に関する直感を反映しているかどうかを評価すること。
  • BERT表現が多義語と同音異義語の意味ペアを埋め込み類似度に基づいて区別できるかどうかを調査すること。
  • 語の意味表現に関する心理言語学的理論と、意味関係をエンコードしないリソース(例:WordNet)の間のギャップを埋めること。
  • 連続空間における埋め込みが、意味関連の類似度メトリクスをシンボリックなオントロジーに補完する可能性を評価すること。

提案手法

  • 32語の英単語について、参加者が意味の類縁度を評価するウェブベースの2次元空間配置タスクを実施した。
  • Semcorコーパスからの語トークンについて、WordNetの意味識別子が付与されたBERT文脈依存埋め込みを収集した。
  • 意味埋め込み間のコサイン類似度を計算し、BERT空間における意味の類縁度の指標を作成した。
  • 人的類縁度判断とBERTベースの類似度指標を相関分析を用いて比較した。
  • 多義語と同音異義語の意味ペアの区別を目的とした分類器をBERT埋め込み上で学習した。
  • 分類器の誤り行列と誤り率を分析し、モデルが意味タイプを区別する信頼性を評価した。

実験結果

リサーチクエスチョン

  • RQ1BERT埋め込みは人的な意味の類縁度判断を反映しているか?
  • RQ2BERTは埋め込み類似度に基づいて多義語と同音異義語の意味ペアを区別できるか?
  • RQ3BERTベースの意味類縁度指標は、人的直感とどの程度相関しているか?
  • RQ4BERT埋め込み上で学習した意味分類モデルの性能は、同音異義語ペアと多義語ペアのどちらに対してより正確か?

主な発見

  • 人的な意味類縁度判断は、BERT埋め込み空間におけるコサイン類似度と有意に相関していた。
  • 同音異義語ペアは多義語ペアよりもBERT埋め込みで有意に類似度が低く、人間の直感を反映していた。
  • BERTベースの分類器は、同音異義語ペアについて平均F1スコア0.992を達成し、高い識別精度を示した。
  • 多義語ペアについては、平均F1スコア0.752を達成し、低いが依然として意味のある識別能力を示した。
  • 分類器による誤りのペアワイズ分析は、人間の類縁度判断の予測に、直接的な埋め込み距離よりもわずかに優れた性能を示した。
  • 誤り分析から、BERT埋め込みは多義語ペアよりも同音異義語ペアをより信頼性高く区別できることを示し、微妙な多義語関係を捉える能力の限界が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。