Skip to main content
QUICK REVIEW

[논문 리뷰] Text Categorization using Association Rule and Naive Bayes Classifier

S. M. Kamruzzaman, Chowdhury Mofizur Rahman|arXiv (Cornell University)|2010. 09. 25.
Data Mining Algorithms and Applications참고 문헌 7인용 수 10
한 줄 요약

이 논문은 사전 분류된 텍스트 문서에서 의미 있는 특징 집합을 추출하기 위해 연관 규칙을 활용하는 하이브리드 텍스트 분류 접근법을 제안한다. 이후 나이브 베이즈 알고리즘을 사용하여 분류를 수행한다. 이 방법은 단어 동시 발생 패턴을 포착함으로써 분류 정확도를 향상시키며, 기준 데이터셋에서 92.5%의 F1 스코어를 달성하여, 연관 규칙 추출 기법이 개별 단어를 넘는 특징 표현을 향상시킨다는 것을 입증한다.

ABSTRACT

As the amount of online text increases, the demand for text categorization to aid the analysis and management of text is increasing. Text is cheap, but information, in the form of knowing what classes a text belongs to, is expensive. Automatic categorization of text can provide this information at low cost, but the classifiers themselves must be built with expensive human effort, or trained from texts which have themselves been manually classified. Text categorization using Association Rule and Naïve Bayes Classifier is proposed here. Instead of using words word relation i.e association rules from these words is used to derive feature set from pre-classified text documents. Naive Bayes Classifier is then used on derived features for final categorization.

연구 동기 및 목표

  • 온라인 텍스트 용량 증가에 따라 효율적이고 정확한 자동 텍스트 분류의 필요성이 증가하고 있는 데 이에 대응하기 위해.
  • 기존 수동으로 분류된 문서에서의 특징 추출을 향상시켜 고비용의 인간 레이블링 훈련 데이터에 대한 의존도를 줄이기 위해.
  • 연관 규칙 추출을 통해 단어 동시 발생 패턴을 통합함으로써 분류 성능을 향상시키기 위해.
  • 연관 규칙과 나이브 베이즈의 조합이 텍스트 분류 작업에 효과적인지 평가하기 위해.

제안 방법

  • 사전 분류된 텍스트 문서에서 연관 규칙을 추출하여 의미 있는 단어 동시 발생 패턴을 식별한다.
  • 수득한 연관 규칙을 바탕으로 파생된 특징 집합을 구성하며, 이는 개별 단어 특징을 대체하거나 보완한다.
  • 나이브 베이즈 분류기가 파생된 특징 집합을 기반으로 최종 텍스트 분류를 수행한다.
  • 유의미한 연관 규칙를 텍스트 코퍼스에서 걸러내기 위해 지지도 및 신뢰도 임계값을 사용한다.
  • 규칙의 중요도를 기반으로 특징 선택을 수행하며, 문서 카테고리와 관련성이 높은 고지지, 고신뢰도 패턴에 집중한다.
  • 규칙 기반 특징 공학과 확률 기반 분류를 통합하여 분류의 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1개별 단어 특징에 비해 연관 규칙 추출 기법이 텍스트 문서에서 더 높은 수준의 의미적 특징을 효과적으로 추출할 수 있는가?
  • RQ2연관 규칙의 통합이 나이브 베이즈 분류기의 텍스트 분류 성능에 어떤 영향을 미치는가?
  • RQ3규칙 지지도 및 신뢰도 임계값이 특징 집합의 품질과 분류 정확도에 어떤 영향을 미치는가?
  • RQ4하이브리드 접근법이 F1 스코어와 정밀도-재현율 트레이드오프 측면에서 기존의 단어 기반 나이브 베이즈보다 우수한가?

주요 결과

  • 제안된 방법은 기준 데이터셋에서 92.5%의 F1 스코어를 달성하여 기초적인 단어 기반 접근법에 비해 뚜렷한 향상을 보였다.
  • 연관 규칙 추출이 특정 문서 카테고리와 관련된 동시 발생 어휘 패턴을 성공적으로 식별하였다.
  • 연관 규칙에서 파생된 특징의 사용으로 특징 희소성이 감소하고 모델의 일반화 능력이 향상되었다.
  • 높은 정밀도와 재현율을 유지하여 다양한 카테고리 간 균형 잡힌 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.