Skip to main content
QUICK REVIEW

[論文レビュー] A hybrid learning algorithm for text classification

S. M. Kamruzzaman, Farhana Haider|arXiv (Cornell University)|Sep 23, 2010
Data Mining Algorithms and Applications参考文献 5被引用数 13
ひとこと要約

本稿では、限られた学習データから特徴を抽出するために語の関連ルールを活用するハイブリッドテキスト分類アルゴリズムを提案する。この特徴は、それらを基にナイーブベイズ分類器を適用し、最終的な分類には単一の遺伝的アルゴリズムを用いる。本手法は、従来のシステムと比較して、より高い正確性を達成するとともに、学習データの要件を低減しており、データが少ない状況下での性能向上を示している。

ABSTRACT

Text classification is the process of classifying documents into predefined categories based on their content. Existing supervised learning algorithms to automatically classify text need sufficient documents to learn accurately. This paper presents a new algorithm for text classification that requires fewer documents for training. Instead of using words, word relation i.e association rules from these words is used to derive feature set from preclassified text documents. The concept of Naive Bayes classifier is then used on derived features and finally only a single concept of Genetic Algorithm has been added for final classification. Experimental results show that the classifier build this way is more accurate than the existing text classification systems.

研究の動機と目的

  • 限られたラベル付き学習文書を用いたテキスト分類の課題に対処すること。
  • 個々の語ではなく語の関連から特徴を導出することで、大規模な学習コーパスに依存するのを減らすこと。
  • 関連ルールマイニング、ナイーブベイズ、遺伝的アルゴリズム最適化を組み合わせたハイブリッドアーキテクチャにより、分類の正確性を向上させること。
  • ラベル付きテキストが乏しい分野に適した、よりデータ効率の良い分類システムを開発すること。

提案手法

  • 特徴抽出は、事前に分類済みの文書内の語の共起に基づいて導出された関連ルールを用い、従来の語ベースの特徴とは置き換える。
  • 導出された関連ルールが、語間の意味的関係を捉えた新たな特徴集合を形成する。
  • ルールベースの特徴集合に対してナイーブベイズ分類器を適用し、確率的分類を実行する。
  • 最終的な分類ステップでは、ナイーブベイズの出力をもとに意思決定境界を最適化する目的で単一の遺伝的アルゴリズムを用いる。
  • ルールベースの特徴工学と確率的分類、進化的最適化を統合したハイブリッドモデルが構築される。
  • 標準的なテキスト分類データセットを用いて、ICECE 2004 コンference から得たデータでシステムを評価する。

実験結果

リサーチクエスチョン

  • RQ1限られた学習データにおいて、語の間の関連ルールがテキスト分類の性能を向上させることができるか?
  • RQ2ナイーブベイズと遺伝的アルゴリズムを組み合わせることで、単体のモデルと比較して分類の正確性が向上するか?
  • RQ3ハイブリッドアプローチによって、テキスト分類における大規模な学習コーパスの必要性はどの程度低減できるか?
  • RQ4データが少ない状況下で、ルールベースの特徴抽出法は従来の語頻度アプローチと比べてどの程度優れているか?

主な発見

  • 提案されたハイブリッドアルゴリズムは、既存のテキスト分類システムよりも高い分類正確性を達成している。
  • 関連ルールを用いた特徴抽出により、少ない学習文書でも効果的な学習が可能である。
  • 最終分類ステップにおける遺伝的アルゴリズムの統合により、モデルの性能が向上している。
  • 本システムは、データが乏しい状況下でも優れた性能を示しており、データが不足する応用分野に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。