Skip to main content
QUICK REVIEW

[論文レビュー] DCDistance: A Supervised Text Document Feature extraction based on class labels

Charles Henrique Porto Ferreira, Débora Maria Rossi de Medeiros|arXiv (Cornell University)|Jan 14, 2018
Text and Document Classification Technologies参考文献 11被引用数 10
ひとこと要約

DCDistanceは、各ドキュメントをクラス代表ベクトルへの距離のk次元ベクトルとして表現することにより次元削減を実現する教師ありテキスト特徴抽出手法であり、ベンチマークデータセットにおいて従来手法および最先端手法と比較して分類精度を向上させながら、99%を超える特徴次元削減を達成している。

ABSTRACT

Text Mining is a field that aims at extracting information from textual data. One of the challenges of such field of study comes from the pre-processing stage in which a vector (and structured) representation should be extracted from unstructured data. The common extraction creates large and sparse vectors representing the importance of each term to a document. As such, this usually leads to the curse-of-dimensionality that plagues most machine learning algorithms. To cope with this issue, in this paper we propose a new supervised feature extraction and reduction algorithm, named DCDistance, that creates features based on the distance between a document to a representative of each class label. As such, the proposed technique can reduce the features set in more than 99% of the original set. Additionally, this algorithm was also capable of improving the classification accuracy over a set of benchmark datasets when compared to traditional and state-of-the-art features selection algorithms.

研究の動機と目的

  • 高次元かつスパースなbag-of-words表現の次元の呪いを軽減することを目的とする。
  • 従来の特徴選択手法における高い計算コストとパラメータ感度の問題を克服することを目的とする。
  • クラスラベル情報を利用し、コンパクトで情報豊富な表現を生成する教師あり特徴抽出手法を開発することを目的とする。
  • 反復的またはヒューリスティックな特徴順位付けに依存せずに、極めて高い次元削減と分類性能の向上を両立させることを目的とする。
  • 距離ベースの特徴をクラス固有の意味的コンテンツに関連付けることで、解釈可能な表現を可能とすることを目的とする。

提案手法

  • 各クラスの代表ベクトルを、そのクラスに属するすべての訓練ドキュメントベクトルの和として構築する。
  • 各テストドキュメントについて、選択された距離計測法(例:コサイン距離またはL2距離)を用いて、各クラス代表ベクトルとの距離を計算する。
  • 各ドキュメントに対してk次元の特徴ベクトルを形成する。ここでkは異なるクラスラベルの数である。
  • 得られた距離ベクトルを、下流の分類モデルへの最終入力表現として使用する。
  • 線形時間計算量を達成するために、効率的なデータ構造を活用する。
  • 特徴生成の段階でクラスラベル情報を直接組み込むことで、手法が本質的に教師ありであることを保証する。

実験結果

リサーチクエスチョン

  • RQ1距離ベースの特徴抽出手法は、99%を超える次元削減を達成しつつ、分類精度を維持または向上させることができるか?
  • RQ2DCDistanceの性能は、従来手法および最先端の特徴選択技術と比較して、精度および削減率の観点でどのように差がつくか?
  • RQ3導出された距離特徴は、クラストピックとの意味的関係をどの程度反映しているか?
  • RQ4提案手法は、前処理時間の短縮と特徴数のハイパーパramータチューニングの不要化を達成できるか?
  • RQ5代表ベクトルおよびそれに関連する高重み語は、クラス意味論に関してどの程度解釈可能か?

主な発見

  • DCDistanceは、評価されたすべてのデータセットで元の特徴集合を99%以上削減し、極めて高い次元削減を達成している。
  • この手法は、20 Newsgroups、Genes、Clusterなどの複数のベンチマークデータセットで、元のbag-of-words表現および最先端の特徴選択手法と比較して分類精度を向上させた。
  • クラス代表ベクトル内の上位語は、それぞれのクラストピックと強く意味的相関を示しており、意味的特徴学習が行われていることを示している。
  • アルゴリズムは線形時間計算量を達成しており、大規模なテキストデータセットにおいてスケーラブルで効率的であることが確認された。
  • 距離ベースの特徴は、特徴生成段階でクラスレベルの情報を統合しているため、優れた一般化性能を示したことが考えられる。
  • すべてのテストデータセットにおいて、4つの競合手法および元の特徴セットと比較して、精度および削減率の両面で優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。