Skip to main content
QUICK REVIEW

[論文レビュー] Relevance-based Word Embedding

Hamed Zamani, W. Bruce Croft|arXiv (Cornell University)|May 9, 2017
Topic Modeling参考文献 35被引用数 20
ひとこと要約

本稿では、語の頻度の近接性ではなく、クエリ-ドキュメントの関連性に基づいて単語埋め込みを学習する2つの教師なしニューラルネットワークモデル—関連性尤度最大化(RLM)と関連性事後分布推定(RPE)—を提案する。600万件のクエリとその上位ドキュメントで訓練されたモデルは、クエリ拡張およびクエリ分類タスクにおいて、word2vecやGloVeを著しく上回る性能を示し、関連性に基づく学習が情報検索に適した意味的関係をよりよく捉えられることを示している。

ABSTRACT

Learning a high-dimensional dense representation for vocabulary terms, also known as a word embedding, has recently attracted much attention in natural language processing and information retrieval tasks. The embedding vectors are typically learned based on term proximity in a large corpus. This means that the objective in well-known word embedding algorithms, e.g., word2vec, is to accurately predict adjacent word(s) for a given word or context. However, this objective is not necessarily equivalent to the goal of many information retrieval (IR) tasks. The primary objective in various IR tasks is to capture relevance instead of term proximity, syntactic, or even semantic similarity. This is the motivation for developing unsupervised relevance-based word embedding models that learn word representations based on query-document relevance information. In this paper, we propose two learning models with different objective functions; one learns a relevance distribution over the vocabulary set for each query, and the other classifies each term as belonging to the relevant or non-relevant class for each query. To train our models, we used over six million unique queries and the top ranked documents retrieved in response to each query, which are assumed to be relevant to the query. We extrinsically evaluate our learned word representation models using two IR tasks: query expansion and query classification. Both query expansion experiments on four TREC collections and query classification experiments on the KDD Cup 2005 dataset suggest that the relevance-based word embedding models significantly outperform state-of-the-art proximity-based embedding models, such as word2vec and GloVe.

研究の動機と目的

  • 従来の単語埋め込みの目的(語の頻度の近接性)と情報検索の主な目的(関連性モデリング)との不一致を是正すること。
  • リアルタイムの検索を必要とせず、教師なしでオフラインで学習可能な単語埋め込みモデルを開発すること。
  • 関連性分布に基づいて学習された埋め込みを用いることで、クエリ拡張やクエリ分類などの下流タスクを改善すること。
  • 関連性ベースの埋め込みが、word2vec や GloVe などの近接性ベースの埋め込みと比較して、実世界の情報検索応用において一般化性能が優れているかどうかを評価すること。
  • 学習データのサイズと埋め込み次元数がモデル性能に与える影響を調査すること。

提案手法

  • 関連性尤度最大化(RLM)モデルは、各クエリに対して語彙語の確率分布を学習し、クエリに関連するドキュメントに各語が出現する尤度を推定する。
  • 関連性事後分布推定(RPE)モデルは、二値分類の目的関数を用いて、各語が特定のクエリに関連するか否かを分類する。
  • 両モデルは、600万件以上のクエリとその上位で検索されたドキュメントを用いてオフラインで訓練され、これらは関連すると仮定されている。
  • 大規模な学習データにスケーリング可能な神経ネットワークアーキテクチャと効率的な学習アルゴリズムを採用している。
  • 人的ラベルによる関連性ラベルが不要なため、完全に教師なしの学習が可能である。
  • モデルはTRECコレクション(AP, Robust, ClueWeb09, ClueWeb12)およびKDD Cup 2005データセットを用いた外部評価で評価されている。

実験結果

リサーチクエスチョン

  • RQ1クエリ-ドキュメントの関連性信号に基づいて学習された単語埋め込みは、word2vec や GloVe などの近接性ベースのモデルを情報検索タスクで上回ることができるか?
  • RQ2関連性ベースの埋め込みは、クエリ拡張およびクエリ分類において、近接性ベースの埋め込みと比較してどのように異なるか?
  • RQ3埋め込み次元数が関連性ベースのモデルの性能に与える影響は何か?
  • RQ4効果的な関連性ベースの単語埋め込みを学習するために、どの程度の学習データ量が必要か?
  • RQ5なぜRPEはクエリ分類ではRLMを上回るが、クエリ拡張ではRLMが優れているのか?

主な発見

  • 4つのTRECコレクションにおけるクエリ拡張タスクで、関連性ベースの単語埋め込みはword2vecやGloVeを著しく上回り、より良い語の選択により検索性能が向上した。
  • 関連性ベースのモデルが生成する拡張語は、個々の語に焦点を当てる近接性ベースのモデルとは異なり、クエリ全体とより意味的に整合性がある。
  • KDD Cup 2005データセットにおけるクエリ分類では、RLMとRPEの両方がベースラインを上回り、特にRPEがF1スコアと精度スコアで優れた結果を達成した。
  • 両モデルの性能は埋め込み次元数の増加に伴い向上し、400次元以上で安定化した。
  • 安定した性能を得るには少なくとも400万件の学習クエリが必要であり、RLMはRPEよりもより多くのデータを必要としていた。
  • 感度分析により、関連性ベースのモデルがハイパーパrameterの選択に対して頑健であり、データ量に応じて効果的にスケーリングできることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。