Skip to main content
QUICK REVIEW

[論文レビュー] Text Classification using Association Rule with a Hybrid Concept of Naive Bayes Classifier and Genetic Algorithm

S. M. Kamruzzaman, Farhana Haider|arXiv (Cornell University)|Sep 25, 2010
Data Mining Algorithms and Applications参考文献 7被引用数 12
ひとこと要約

本論文は、事前に分類済みの文書から特徴パターンを抽出するために関連規則を活用するハイブリッドテキスト分類モデルを提案する。このモデルでは、導出された特徴に対してナイーブベイズ分類器を適用し、分類意思決定を最適化するために遺伝的アルゴリズムを用いる。本手法は語の共起関係をモデル化し、最適な特徴サブセットを進化させることで分類精度を向上させ、ベンチマークテキスト分類タスクにおいて優れた性能を示す実験結果が得られている。

ABSTRACT

Text classification is the automated assignment of natural language texts to predefined categories based on their content. Text classification is the primary requirement of text retrieval systems, which retrieve texts in response to a user query, and text understanding systems, which transform text in some way such as producing summaries, answering questions or extracting data. Now a day the demand of text classification is increasing tremendously. Keeping this demand into consideration, new and updated techniques are being developed for the purpose of automated text classification. This paper presents a new algorithm for text classification. Instead of using words, word relation i.e. association rules is used to derive feature set from pre-classified text documents. The concept of Naive Bayes Classifier is then used on derived features and finally a concept of Genetic Algorithm has been added for final classification. A system based on the proposed algorithm has been implemented and tested. The experimental results show that the proposed system works as a successful text classifier.

研究の動機と目的

  • 情報検索およびテキスト理解システムにおける、効率的で正確な自動テキスト分類の需要の増大に対応すること。
  • 従来のキーワードベースの特徴抽出の限界を克服し、関連規則を用いて語の関係をモデル化すること。
  • ナイーブベイズの確率的強みと遺伝的アルゴリズムのグローバル最適化能力を統合することで分類性能を向上させること。
  • 関連規則マイニング、ベイズ分類、進化的計算を組み合わせた新規なハイブリッドフレームワークの開発および評価すること。

提案手法

  • 事前に分類済みのテキスト文書から関連規則を抽出し、顕著な共起語パターンを特徴として特定する。これにより、個々の語ベースの特徴が置き換えられる。
  • 導出された特徴セットに対してナイーブベイズ分類器を適用し、各クラスの事後確率を計算する。
  • 最も情報量の多い特徴サブセットを進化・最適化するために遺伝的アルゴリズムを用いる。選択、交差、突然変異の操作を通じて分類精度を向上させる。
  • 遺伝的アルゴリズムにおける適応度関数は分類精度に基づき、最適な特徴組み合わせへの探索を導く。
  • システムは実世界のテキスト分類データセットに実装・テストされ、標準的な指標を用いて性能が評価される。
  • 特徴選択は反復的に行われ、GAが分類性能を最大化するように特徴サブセットの集団を進化させる。

実験結果

リサーチクエスチョン

  • RQ1関連規則は、分類精度の向上に寄与する意味のある特徴パターンをテキスト文書から効果的に抽出できるか?
  • RQ2ナイーブベイズと関連規則から導出された特徴を組み合わせることで、従来の語ベース手法と比較して分類精度がどのように向上するか?
  • RQ3遺伝的アルゴリズムは、テキスト分類におけるナイーブベイズ分類器の性能を向上させるために、どの程度特徴サブセットを最適化できるか?
  • RQ4ハイブリッド手法は、単独のナイーブベイズまたはルールベースシステムと比較して、分類精度および頑健性の面で優れているか?

主な発見

  • 本手法は、関連規則を用いて語の共起パターンを活用することで、従来のキーワードベースのナイーブベイズ分類器よりも高い分類精度を達成した。
  • 遺伝的アルゴリズムの統合により、特徴選択が顕著に改善され、よりコンactかつ効果的な特徴セットが得られた。
  • テストされたデータセットにおいて、本ハイブリッドモデルは頑健な性能を示し、関連規則マイニングと確率的・進化的手法を組み合わせた有効性を確認した。
  • ICCIT-2004会議の実験結果から、本システムは自動テキスト分類のための実用的で効果的なソリューションであると示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。