Skip to main content
QUICK REVIEW

[論文レビュー] Vector of Locally-Aggregated Word Embeddings (VLAWE): A Novel Document-level Representation

Radu Tudor Ionescu, Andrei M. Butnaru|arXiv (Cornell University)|Feb 23, 2019
Text and Document Classification Technologies被引用数 8
ひとこと要約

本稿では、コンピュータビジョンにおけるVLADにインspiredされた、文書レベルの表現を新たに提案する。VLAWE(Vector of Locally-Aggregated Word Embeddings)は、k-meansを用いて単語埋め込みをクラスタリングし、各単語埋め込みとその最も近いクラスターセンタまでの残差を計算することで文書表現を生成する。これにより、映画レビューデータセットで93.3%の精度を達成し、前人最高の結果より10ポイント上回った。

ABSTRACT

In this paper, we propose a novel representation for text documents based on aggregating word embedding vectors into document embeddings. Our approach is inspired by the Vector of Locally-Aggregated Descriptors used for image representation, and it works as follows. First, the word embeddings gathered from a collection of documents are clustered by k-means in order to learn a codebook of semnatically-related word embeddings. Each word embedding is then associated to its nearest cluster centroid (codeword). The Vector of Locally-Aggregated Word Embeddings (VLAWE) representation of a document is then computed by accumulating the differences between each codeword vector and each word vector (from the document) associated to the respective codeword. We plug the VLAWE representation, which is learned in an unsupervised manner, into a classifier and show that it is useful for a diverse set of text classification tasks. We compare our approach with a broad range of recent state-of-the-art methods, demonstrating the effectiveness of our approach. Furthermore, we obtain a considerable improvement on the Movie Review data set, reporting an accuracy of 93.3%, which represents an absolute gain of 10% over the state-of-the-art approach. Our code is available at https://github.com/raduionescu/vlawe-boswe/.

研究の動機と目的

  • 単語埋め込みの平均/和集合によるポーリングを超える、強力で非教師ありの文書レベル表現の開発。
  • コンピュータビジョンのVLADフレームワークを自然言語処理に適応し、単語埋め込みのより良い意味的集約を実現すること。
  • 訓練データとテストデータの語彙分布のギャップを解消するため、最近隣接クラスタへの割り当てによりOoV語の処理を可能にする。
  • 特にリソースが限られた環境やドメインシフトが生じる状況においても、多様なテキスト分類ベンチマークで最先端の性能を示すこと。

提案手法

  • 大規模コーパス上で事前学習された単語埋め込み(例:GloVe)を用い、クラスタリングの入力として使用する。
  • 単語埋め込みベクトルに対してk-meansクラスタリングを適用し、意味的に関連する単語埋め込みのセンタ(コードブック)を学習する。
  • 各文書について、各単語埋め込みをその最も近いクラスターセンタ(コードワード)に割り当てる。これにより、単語-コードワードの関連性集合が形成される。
  • 各コードワードと、そのコードワードに割り当てられたすべての単語埋め込みとの差分(残差)の和を計算することで、VLAWE表現を構築する。
  • 微調整なしで、得られた高次元ベクトルを分類器(例:SVM)の入力として使用する。
  • 推論時において、未知語(OoV語)を最近隣接するコードワードに割り当てることで、OoVに強い耐性を実現する。

実験結果

リサーチクエスチョン

  • RQ1コンピュータビジョンからインspiredされたVLADフレームワークを、自然言語処理における単語埋め込みの文書レベル表現学習に効果的に適応できるか?
  • RQ2クラスタの残差による単語埋め込みの集約(VLAWE)は、テキスト分類タスクにおいて単純な平均化や和集合よりも優れた性能を発揮するか?
  • RQ3従来のbag-of-wordsや埋め込み平均化手法と比較して、VLAWEはOoV語をどのように処理するか?
  • RQ4VLAWEは、リソースが限られた環境やドメインシフトが生じる状況を含む、多様なテキスト分類ベンチマークで最先端の性能を達成できるか?
  • RQ5クラスタ数(k)のようなハイパーパrameterが、VLAWEの性能と耐性に与える影響はいかほどか?

主な発見

  • VLAWEは映画レビューデータセットで93.3%の精度を達成し、前人最高の結果より10ポイントの絶対的向上を示した。
  • RT-2kデータセットでは94.1%の精度を達成し、文献に報告されたすべての既存結果を上回った。
  • Subjデータセットでは95.0%の精度を達成し、テストされたすべての手法の中で2番目に高いスコアであり、最良手法からわずか1%の差であった。
  • TRECデータセットでは3番目に高い精度を記録し、最先端の96.1%から2%の差を示した。
  • k=2またはPCAを用いた次元削減を施したコンactバージョンでは、それぞれ93.0%および93.2%の精度を達成し、特徴量サイズを著しく削減しながらも、性能の低下は最小限に抑えられた。
  • 5つのベンチマークデータセットすべてにおいて、平均単語埋め込みベースラインおよび標準的なbag-of-wordsベースラインを常に上回り、ほとんどの場合で5%以上の向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。