Skip to main content
QUICK REVIEW

[論文レビュー] Text Classification based on Word Subspace with Term-Frequency

Erica K. Shimomoto, Lincon S. Souza|arXiv (Cornell University)|Jun 8, 2018
Text and Document Classification Technologies被引用数 3
ひとこと要約

本稿では、相互部分空間法(MSM)フレームワーク内において、語の部分空間および項頻度(TF)重み付き語の部分空間を用いた新しいテキスト分類手法を提案する。単語2vecベクトルを低次元部分空間としてモデル化し、PCAに重みを付けて語の頻度を組み込むことで、Reuters-8データセットで92.01%の正確性を達成し、MNB や SVM といった従来手法よりも95%の有意水準で顕著に優れている。

ABSTRACT

Text classification has become indispensable due to the rapid increase of text in digital form. Over the past three decades, efforts have been made to approach this task using various learning algorithms and statistical models based on bag-of-words (BOW) features. Despite its simple implementation, BOW features lack semantic meaning representation. To solve this problem, neural networks started to be employed to learn word vectors, such as the word2vec. Word2vec embeds word semantic structure into vectors, where the angle between vectors indicates the meaningful similarity between words. To measure the similarity between texts, we propose the novel concept of word subspace, which can represent the intrinsic variability of features in a set of word vectors. Through this concept, it is possible to model text from word vectors while holding semantic information. To incorporate the word frequency directly in the subspace model, we further extend the word subspace to the term-frequency (TF) weighted word subspace. Based on these new concepts, text classification can be performed under the mutual subspace method (MSM) framework. The validity of our modeling is shown through experiments on the Reuters text database, comparing the results to various state-of-art algorithms.

研究の動機と目的

  • bag-of-words モデルの限界、すなわち意味的意味の欠如、高次元性、スパarsity を解決すること。
  • 語2vecベクトルを用いて、テキストクラス内の語ベクトルの内在的変動を低次元部分空間表現として保存することで、意味的関係を維持すること。
  • 語の頻度情報を部分空間モデルに直接組み込み、分類の正確性を向上させること。
  • MSMフレームワーク下での語の部分空間およびTF重み付き語の部分空間の有効性を評価すること。

提案手法

  • 高次元語ベクトル空間内における低次元線形部分空間としての語の部分空間の概念を導入し、テキストクラス内の語ベクトルの内在的変動を表す。
  • データの中心化を行わずPCAを適用することで、各クラスの語の部分空間をモデル化し、クラスの支配的意味的構造を保持する。
  • PCAプロセスに項頻度を重みとして組み込むことで、語の部分空間をTF重み付き語の部分空間に拡張し、頻度に配慮した部分空間モデリングを可能にする。
  • 相互部分空間法(MSM)を用いてテキスト分類を実行し、クエリドキュメントの部分空間と訓練クラスの部分空間を、正規化された角度(canonical angles)で比較する。
  • 語2vecを用いて、ベクトル幾何学による意味的類似性を符号化する分散表現を生成する。
  • 語の頻度をインスタンス重みとして用いる重み付きPCAの変種を採用し、表現の忠実性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1語2vecベクトルの低次元部分空間表現は、テキスト分類におけるテキストクラスの意味的コンテンツを効果的にモデル化できるか?
  • RQ2部分空間モデリングプロセスに項頻度を組み込むことで、標準的な語の部分空間と比較して分類性能にどのような影響を与えるか?
  • RQ3提案手法のTF重み付き語の部分空間法は、MNB や SVM や LSA といった従来のテキスト分類ベースラインを、ベンチマークデータセット上で上回るか?
  • RQ4部分空間ベースの手法は、次元削減と計算コストの低減を図りながら、意味的変動をどの程度保持できるか?
  • RQ5TF重み付き部分空間による性能向上は、頻度に依存しない手法と比較して統計的に有意であるか?

主な発見

  • TF重み付き語の部分空間法(TF-MSM)は、Reuters-8データセットで92.01%の正確性を達成し、それより低い正確性を示したマルチノミアル・ナイーブベイズ(MNB)を顕著に上回った。
  • t検定により、TF-MSMの性能がMNBを95%の有意水準で顕著に上回ることが確認され、p値は0.031であった。
  • 語の部分空間表現は、元の語ベクトル空間の次元の半分程度の次元で、クラスの変動の大部分を保持しており、高いコンパクト性と効率性を示した。
  • LSA や SVM は、TF-IDF重み付きbag-of-words特徴量を用いた場合に成績が悪く、ストップワードが除去され、レアワードが不足している状況ではTF-IDFが効果的でないことが示唆された。
  • ベクトルの角度と部分空間幾何学を通じて意味的類似性が効果的にモデル化されており、文脈ごとにグループ化された語2vecベクトルが一貫性のある部分空間を形成することを示した。
  • 結果として、分散語表現に適用されたMSMにおける語の部分空間モデリングは、従来手法よりも効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。