Skip to main content
QUICK REVIEW

[論文レビュー] Text classification based on ensemble extreme learning machine

Ming Li, Peilun Xiao|arXiv (Cornell University)|May 10, 2018
Machine Learning and ELM参考文献 23被引用数 16
ひとこと要約

この論文では、情報エントロピーを用いたサンプルの重要度を測定し、コストセンシティブ学習と統合することで、特にデータの不均衡が顕著な状況においてもテキスト分類の精度を向上させる、AE1-WELMと呼ばれるアンサンブル極端学習マシンフレームワークを提案する。AdaBoost.M1に重み付きELMを統合し、単語ベクトル表現と組み合わせることで、高次元スパース表現の影響を軽減し、ベンチマークテキスト分類タスクで優れた性能を達成する。

ABSTRACT

In this paper, we propose a novel approach based on cost-sensitive ensemble weighted extreme learning machine; we call this approach AE1-WELM. We apply this approach to text classification. AE1-WELM is an algorithm including balanced and imbalanced multiclassification for text classification. Weighted ELM assigning the different weights to the different samples improves the classification accuracy to a certain extent, but weighted ELM considers the differences between samples in the different categories only and ignores the differences between samples within the same categories. We measure the importance of the documents by the sample information entropy, and generate cost-sensitive matrix and factor based on the document importance, then embed the cost-sensitive weighted ELM into the AdaBoost.M1 framework seamlessly. Vector space model(VSM) text representation produces the high dimensions and sparse features which increase the burden of ELM. To overcome this problem, we develop a text classification framework combining the word vector and AE1-WELM. The experimental results show that our method provides an accurate, reliable and effective solution for text classification.

研究の動機と目的

  • テキスト分類におけるクラスの不均衡とクラス内サンプルのばらつきを適切に扱えない標準的な重み付きELMの限界を是正すること。
  • サンプルの情報エントロピーに基づく文書の重要度を学習プロセスに組み込むことで、分類精度を向上させること。
  • ELMにおける高次元・スパースなベクトル空間モデル(VSM)表現の影響を、単語ベクトル特徴との統合によって軽減すること。
  • アンサンブル学習を用いて、バランスあり・不均衡な多クラステキスト分類の両方に対して、堅牢でスケーラブルなフレームワークを構築すること。
  • 現実のテキスト分類タスクにおいて一般的なデータの不均衡と特徴のスパarsityに対処する効果的なソリューションを提供すること。

提案手法

  • 文書の重要度をサンプルの情報エントロピーで計算し、それに基づいたコストセンシティブ行列と要因を導入することで、クラス内サンプルの差を反映する。
  • クラス固有およびサンプル固有の重みを重み付きELMに追加することで、不均衡データセットにおける分類性能を向上させる。
  • コストセンシティブな重み付きELMをAdaBoost.M1のブースティングフレームワークに統合し、弱学習器を繰り返し改善するアンサンブルモデル(AE1-WELM)を構築する。
  • 従来のVSMと分散表現(word vectors)を組み合わせたハイブリッドテキスト表現モデルを採用し、ELMにおけるスパarsityと次元の呪いを緩和する。
  • 特徴表現と分類の両方を一括して最適化するエンドツーエンドの学習により、一般化性能を向上させる。
  • 学習中にエントロピーに基づく重要度スコアに応じて動的にサンプル重みを調整し、重要な文書の誤分類を低減する。

実験結果

リサーチクエスチョン

  • RQ1同じクラス内におけるサンプルの重要度を効果的に測定し、学習プロセスに統合することで、分類性能を向上させることは可能か?
  • RQ2情報エントロピーとコストセンシティブ学習を統合することで、不均衡なテキスト分類タスクにおけるELMの性能はどの程度向上するか?
  • RQ3VSMと単語ベクトル表現を組み合わせることで、ELMベースのテキスト分類におけるスパarsityと次元の負担を軽減できるか?
  • RQ4提案されたAE1-WELMフレームワークは、バランスあり・不均衡なデータセットにおいて、標準ELMや他のアンサンブル手法と比較して、精度と頑健性の面で優れているか?
  • RQ5コストセンシティブな重み付きELMをAdaBoost.M1フレームワークに統合することで、全体の分類信頼性にどのような影響を与えるか?

主な発見

  • AE1-WELMフレームワークは、複数のベンチマークテキスト分類データセットにおいて、標準ELMおよび重み付きELMよりも高い分類精度を達成した。
  • 情報エントロピーに基づくサンプルの重要度統合により、マイノリティクラスにおける性能が顕著に向上し、不均衡な状況下での誤分類が削減された。
  • ハイブリッドVSMと単語ベクトル表現により、特徴次元数とスパarsityが低減され、ELMにおける収束速度が向上し、一般化性能が向上した。
  • AE1-WELMのアンサンブル構造に加え、コストセンシティブ学習を組み合わせることで、さまざまなテキスト分類タスクにおいてより安定的で信頼性の高い予測が得られた。
  • 本手法は、バランスあり・不均衡な多クラステキスト分類問題の両方において、一貫してベースラインモデルを上回る頑健性を示した。
  • 実験的結果から、本フレームワークが従来のVSMベースのELMにおける高次元スパース特徴の悪影響を効果的に軽減していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。