Skip to main content
QUICK REVIEW

[論文レビュー] Comparing in context: Improving cosine similarity measures with a metric tensor

Isa M. Apallius de Vos, Ghislaine L. van den Boogerd|arXiv (Cornell University)|Mar 28, 2022
Topic Modeling被引用数 4
ひとこと要約

本論文では、文脈に応じたメトリックテンソルを提案し、文脈固有の内積を学習することでコサイン類似度を向上させ、事前学習済み埋め込みを変更せずに単語類似度相関を向上させる。この手法は、特にBERTのような文脈依存モデルにおいて顕著な向上を示し、未学習のデータセットへの一般化性能が向上し、学習された動的類似度メトリクスにより解釈可能性が向上する。

ABSTRACT

Cosine similarity is a widely used measure of the relatedness of pre-trained word embeddings, trained on a language modeling goal. Datasets such as WordSim-353 and SimLex-999 rate how similar words are according to human annotators, and as such are often used to evaluate the performance of language models. Thus, any improvement on the word similarity task requires an improved word representation. In this paper, we propose instead the use of an extended cosine similarity measure to improve performance on that task, with gains in interpretability. We explore the hypothesis that this approach is particularly useful if the word-similarity pairs share the same context, for which distinct contextualized similarity measures can be learned. We first use the dataset of Richie et al. (2020) to learn contextualized metrics and compare the results with the baseline values obtained using the standard cosine similarity measure, which consistently shows improvement. We also train a contextualized similarity measure for both SimLex-999 and WordSim-353, comparing the results with the corresponding baselines, and using these datasets as independent test sets for the all-context similarity measure learned on the contextualized dataset, obtaining positive results for a number of tests.

研究の動機と目的

  • コサイン類似度における標準的なユークリッド内積を、学習可能なメトリックテンソルに置き換えることで単語類似度評価を向上させること。
  • 文脈化された語対データセット上で学習された文脈固有の類似度測定が、静的ベースラインよりも優れた性能を示すかどうかを調査すること。
  • 学習された類似度メトリクスが、関連のないデータセットへ一般化可能であるかどうかを検証し、語対の文脈を超えた転送可能性をテストすること。
  • 埋め込み再訓練からメトリクス学習を分離することで、類似度計算の解釈可能性と効率性を向上させること。
  • 学習されたメトリクスを構成的分布的意味論およびテンソル縮約フレームワークに統合する可能性を検討すること。

提案手法

  • 対称的で正定値のメトリックテンソルGを用いた一般化されたコサイン類似度を導入し、標準的なユークリッド内積を⟨u,v⟩_G = u^T G vに置き換える。
  • 人間によるスコアとの相関最適化により、文脈化された語対類似度データセット(例:上位関係)からメトリックテンソルGを学習する。
  • ハイパニム(例:'Birds', 'Fishes')の統合データセットを用いて、文脈を超えた類似度パターンを捉える。
  • 独立したテストセット(例:SimLex-999, WordSim-353)に学習済みメトリクスを適用し、ゼロショット一般化性能を評価する。
  • 同じ事前学習済み埋め込み(例:BERT, GPT-2, Word2Vec)を用いて、標準的なコサイン類似度とメトリックテンソルを強化したバージョンの両方で性能を比較する。
  • ピアソンおよびスピアマンの相関係数を評価指標として用い、ベースラインモデルに対する改善を評価する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み埋め込みを再訓練せずに、文脈に応じたメトリックテンソルが単語類似度ベンチマークにおけるコサイン類似度性能を向上させられるか?
  • RQ2ハイパニムなどの文脈化されたデータセット上でメトリクスを学習すると、WS353 や SL999 などの関連のない語対で学習する場合よりも優れた一般化性能が得られるか?
  • RQ3ある語対セットで学習したメトリクスが、SimLex-999 や WordSim-353 のような独立した、関連のないデータセットへどの程度一般化できるか?
  • RQ4異なる事前学習埋め込みモデル(例:BERT, GPT-2, Word2Vec)において、メトリックテンソル手法の性能はどのように異なるか?
  • RQ5モデルアーキテクチャと文脈の多様性が、学習されたメトリックテンソルの安定性と解釈可能性に与える影響は何か?

主な発見

  • BERT埋め込みを用いてテストした結果、メトリックテンソル手法はSimLex-999およびWordSim-353の相関スコアを顕著に向上させ、ピアソン相関が0.487、スピアマンが0.519に達し、ベースラインの0.239および0.267を上回った。
  • ハイパニム全体で学習した最良のモデルは、独立したデータセットへの一般化がうまくいき、BERTにおけるSimLex-999の相関で100%の向上(ベースライン0.151対0.375)を示した。
  • 文脈化された表現(例:BERT)は、メトリクス学習後の相対的向上が最も顕著で、SimLex-999で相関が100%向上した。これは、埋め込みと類似度測定の両方で文脈の蓄積的利点が得られていることを示している。
  • ハイパニム全体で学習したモデルは、個々のハイパニム固有のモデルを上回り、学習中に多様な文脈にさらされることで一般化と転移学習が向上することを示唆している。
  • 最良のモデルを用いることで、SimLex-999(ピアソン0.658)およびWordSim-353(ピアソン0.704)でSOTA性能を達成し、以前のSOTA結果を上回った。
  • 学習済みメトリクス下での語ベクトルの分布は、より直線的かつ集中的になった。これは、メトリクスがベクトル空間における意味的関係を効果的に整列させていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。