[論文レビュー] How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings
この論文は、BERT、ELMo、GPT-2の隠れ状態の幾何構造を分析することで、単語表現の文脈感受性を調査している。その結果、表現は顕著に非等方的であり、上位層では文脈に特化した性質が強いが、静的埋め込みによる説明が可能な分散は5%未塔であり、文脈に依存する表現は有限個の意味固有のベクトルに還元可能でないことが示された。
Replacing static word embeddings with contextualized word representations has yielded significant improvements on many NLP tasks. However, just how contextual are the contextualized representations produced by models such as ELMo and BERT? Are there infinitely many context-specific representations for each word, or are words essentially assigned one of a finite number of word-sense representations? For one, we find that the contextualized representations of all words are not isotropic in any layer of the contextualizing model. While representations of the same word in different contexts still have a greater cosine similarity than those of two different words, this self-similarity is much lower in upper layers. This suggests that upper layers of contextualizing models produce more context-specific representations, much like how upper layers of LSTMs produce more task-specific representations. In all layers of ELMo, BERT, and GPT-2, on average, less than 5% of the variance in a word's contextualized representations can be explained by a static embedding for that word, providing some justification for the success of contextualized representations.
研究の動機と目的
- BERT、ELMo、GPT-2のような文脈依存型単語モデルの表現が、実際にどの程度文脈に特化しているかを特定すること。
- 文脈依存型表現が有限個の意味固有埋め込みに対応しているのか、それとも無限個の文脈特化型ベクトルに対応しているのかを調査すること。
- 特に非等方性と類似性構造に注目して、層間およびモデル間の幾何的性質を比較すること。
- 文脈依存型表現の第一主成分から得られる静的埋め込みの有効性を評価すること。
- 文脈特化性がELMo、BERT、GPT-2の間でどのように異なるか、およびその影響が下流タスクのパフォーマンスにどのように現れるかを理解すること。
提案手法
- 同じ単語の異なる文脈における文脈依存型表現間のコサイン類似度を計算することで、文脈特化性を測定した。
- ベクトル空間内での単語ベクトルの集中度を測定することで、表現空間の非等方性を分析した。
- 主成分分析(PCA)を用いて、各単語の層全体における文脈依存型表現の第一主成分を抽出した。
- 第一主成分が文脈依存型表現の分散のどの程度を説明しているか(MEV)を測定することで、静的埋め込みへの還元可能性を評価した。
- 非等方性を補正することで、表現空間内の方向的バイアスから真正の文脈特化性を分離した。
- PCAから得た静的埋め込みを、標準的な単語埋め込みベンチマーク(例:SimLex、MEN、WordSim、Googleアナロジー)で評価した。
実験結果
リサーチクエスチョン
- RQ1BERT、ELMo、GPT-2における文脈依存型単語表現が、有限個の意味固有ベクトルに割り当てられるのではなく、本当に文脈に特化しているのか、その程度はどの程度か。
- RQ2表現空間の非等方性が、文脈依存型埋め込みの解釈やパフォーマンスにどのように影響を与えるか。
- RQ3文脈特化性は層やモデル(特にELMo、BERT、GPT-2)の間でどのように異なるか。
- RQ4文脈依存型表現の第一主成分から得た静的単語埋め込みは、GloVe や FastText といった従来の静的埋め込みを上回る性能を示せるか。
- RQ5非等方性を補正した上で、単一の静的ベクトルが文脈依存型表現の分散のどの程度を説明できるか。
主な発見
- ELMo、BERT、GPT-2の全層において、文脈依存型単語表現は非等方的であり、ベクトルが狭い円すじに集中している。GPT-2の最終層は極めて非等方的であり、ランダムな単語ペア間でもほぼ完全なコサイン類似度を示す。
- 異なる文脈における同じ単語の表現は同一ではなく、上位層へ行くほどコサイン類似度が低下する。これは文脈特化性の増加を示している。
- 非等方性を補正した後、全層および全モデルにおいて、単語の文脈依存型表現の分散の平均で5%未塔が第一主成分によって説明可能である。
- 上位層での高い文脈特化性にもかかわらず、下位層の表現(特にBERTの第一層)の第一主成分は、GloVe や FastText を上回る性能を示した。
- 文脈特化性の現れ方は異なる:ELMoでは上位層で同じ文内の単語間の類似度が増加するが、BERTでは類似度の低下がやや顕著で、GPT-2ではそのような増加は見られず、同じ文内の単語はランダムペアと同等の類似度である。
- GPT-2表現の主成分は、ELMo や BERT とは著しく劣り、極めて文脈特化型の表現は静的近似に不適切であることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。