Skip to main content
QUICK REVIEW

[論文レビュー] Improving Document Classification with Multi-Sense Embeddings

Vivek Gupta, Ankit Saw|arXiv (Cornell University)|Nov 18, 2019
Topic Modeling参考文献 42被引用数 7
ひとこと要約

本稿では、多義語の単語埋め込みとスパースで低次元の多様体学習を活用することで、文書分類性能を向上させる新しい文書表現手法SCDV-MSを提案する。文脈を用いて語の意味を明確化し、曖昧なクラスタ割り当てに直接スパarsityを適用し、単語-トピックベクトルを低次元空間に射影することで、SCDV-MSは、SCDVよりも時間的・空間的計算量を削減しつつ、マルチクラスおよびマルチラベル文書分類で最先端の性能を達成する。

ABSTRACT

Efficient representation of text documents is an important building block in many NLP tasks. Research on long text categorization has shown that simple weighted averaging of word vectors for sentence representation often outperforms more sophisticated neural models. Recently proposed Sparse Composite Document Vector (SCDV) (Mekala et. al, 2017) extends this approach from sentences to documents using soft clustering over word vectors. However, SCDV disregards the multi-sense nature of words, and it also suffers from the curse of higher dimensionality. In this work, we address these shortcomings and propose SCDV-MS. SCDV-MS utilizes multi-sense word embeddings and learns a lower dimensional manifold. Through extensive experiments on multiple real-world datasets, we show that SCDV-MS embeddings outperform previous state-of-the-art embeddings on multi-class and multi-label text categorization tasks. Furthermore, SCDV-MS embeddings are more efficient than SCDV in terms of time and space complexity on textual classification tasks.

研究の動機と目的

  • SCDVの限界、特に語の意味の曖昧さを無視している点と、高次元でノイズの多い表現を扱う点を是正する。
  • 単一の意味を持つベクトルではなく、文脈に依存する多義語の単語埋め込みを組み込むことで、文書表現を改善する。
  • 最終的な文書ベクトルではなく、単語-トピックベクトルレベルでのスパarsity適用により、計算コストとストレージコストを削減する。
  • 深層学習パイプラインにおける文書埋め込みの有効な利用を可能にするために、それらを低次元で連続的かつ情報豊富な多様体に射影する。

提案手法

  • 文書表現における語の意味の曖昧さを解消するために、単一意味の単語埋め込みの代わりに、多義語で文脈に依存する埋め込みを採用する。
  • 曇ったクラスタ割り当て(単語-トピックベクトル)にスレッショルドベースのスパarsityを直接適用し、ノイズを低減するとともに効率性を向上させる。
  • Doc2VecCで初期化された頑健な単語ベクトルを用いて、'the' や 'and' のような高頻度の共通語の負の加法的影響を抑制する。
  • オートエンコーダーを用いて、スパースな単語-トピックベクトルを非線形な低次元多様体に射影し、局所的近傍構造を保持する。
  • 連続的で低次元の文書表現を学習し、下流の分類タスクに有効で、深層学習アーキテクチャと互換性を持つようにする。
  • オートエンコーダーを用いて単語-トピックベクトルの次元を削減することで、顕著な性能損失を伴わず、推論速度を向上させ、ストレージ要件を低減する。

実験結果

リサーチクエスチョン

  • RQ1多義語の単語埋め込みは、単一意味の埋め込みと比較して、文書分類性能を向上させることができるか?
  • RQ2最終的な文書ベクトルではなく、単語-トピックベクトルレベルでのスパarsity適用は、より優れた性能と効率性をもたらすか?
  • RQ3スパースな単語-トピックベクトルから、意味構造を保持したまま低次元で連続的な表現を学習できるか?
  • RQ4共通語からのノイズは文書表現の品質にどのように影響するか? そして、効果的に抑制できるか?
  • RQ5分類性能を著しく損なわず、単語-トピックベクトルを次元削減によってどれほど圧縮できるか?

主な発見

  • SCDV-MSは、マルチクラスおよびマルチラベル文書分類タスクにおいて、SCDVおよびBERT(pr)を上回り、最先端の結果を達成する。
  • 次元削減に伴う性能損失は、SCDVよりもSCDV-MSで著しく小さい。12,000次元から2,000次元に削減しても、F1スコアはわずか1%低下するにとどまる。
  • 単語-トピックベクトルの高スパarsity(98%スパース)のおかげで、SCDV-MSでは特徴抽出時間がSCDV(わずか1%スパース)と比較して43倍短縮される。
  • R-SCDV-MSの低次元化されたベクトル(2,000次元の密ベクトル)を用いることで、予測時間が8.5倍短縮され、優れた効率性が実証された。
  • R-SCDV-MSのモデルサイズはSCDVの6倍小さく、学習は1.25倍速く、スケーラビリティの向上が顕著である。
  • SCDV-MSの単語-トピックベクトルは、畳み込みニューラルネットワーク(CNN)の入力として直接使用可能であり、同じ次元の元の単語埋め込みを上回る性能を発揮した(20Newsgroupデータセットで検証)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。