Skip to main content
QUICK REVIEW

[논문 리뷰] A hybrid learning algorithm for text classification

S. M. Kamruzzaman, Farhana Haider|arXiv (Cornell University)|2010. 09. 23.
Data Mining Algorithms and Applications참고 문헌 5인용 수 13
한 줄 요약

이 논문은 제한된 훈련 데이터에서 특징을 추출하기 위해 단어 연관 규칙을 활용하는 하이브리드 텍스트 분류 알고리즘을 제안한다. 이 알고리즘은 유도된 특징에 대해 나이브 베이즈 분류기를 적용하고, 최종 분류를 위해 단일 유전 알고리즘을 사용한다. 기존 시스템에 비해 더 높은 정확도를 달성하면서도 훈련 데이터 요구량을 줄여, 낮은 데이터 환경에서 향상된 성능을 보여준다.

ABSTRACT

Text classification is the process of classifying documents into predefined categories based on their content. Existing supervised learning algorithms to automatically classify text need sufficient documents to learn accurately. This paper presents a new algorithm for text classification that requires fewer documents for training. Instead of using words, word relation i.e association rules from these words is used to derive feature set from preclassified text documents. The concept of Naive Bayes classifier is then used on derived features and finally only a single concept of Genetic Algorithm has been added for final classification. Experimental results show that the classifier build this way is more accurate than the existing text classification systems.

연구 동기 및 목표

  • 제한된 레이블이 부여된 훈련 문서로 인한 텍스트 분류 과제를 해결하기 위해.
  • 개별 단어가 아닌 단어 간 연관성에서 유도된 특징을 통해 대규모 훈련 코퍼스에 대한 의존도를 줄이기 위해.
  • 연관 규칙 마이닝, 나이브 베이즈, 그리고 유전 알고리즘 최적화를 조합한 하이브리드 아키텍처를 통해 분류 정확도를 향상시키기 위해.
  • 레이블이 부족한 도메인에 적합한 더 데이터 효율적인 분류 시스템을 개발하기 위해.

제안 방법

  • 특징 추출은 사전 분류된 문서 내 단어 공존 현상에서 유도된 연관 규칙를 사용하여 수행되며, 기존의 단어 기반 특징 대신 사용된다.
  • 유도된 연관 규칙는 단어 간 의미적 관계를 포착하는 새로운 특징 세트를 형성한다.
  • 규칙 기반 특징 세트에 대해 나이브 베이즈 분류기가 확률적 분류를 위해 적용된다.
  • 최종 분류 단계에서 단일 유전 알고리즘이 사용되어 나이브 베이즈 출력 기반으로 결정 경계를 최적화한다.
  • 하이브리드 모델은 규칙 기반 특징 공학, 확률적 분류, 그리고 진화 최적화를 통합한다.
  • 시스템은 ICECE 2004 회의에서 제공한 표준 텍스트 분류 데이터셋을 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1제한된 훈련 데이터에서 단어 간 연관 규칙이 텍스트 분류 성능을 향상시킬 수 있는가?
  • RQ2나이브 베이즈와 유전 알고리즘을 조합하면 단독 모델 대비 분류 정확도가 향상되는가?
  • RQ3하이브리드 접근 방식은 텍스트 분류에서 대규모 훈련 코퍼스가 필요한 정도를 어느 정도 줄일 수 있는가?
  • RQ4저데이터 설정에서 규칙 기반 특징 추출 방법은 전통적인 단어 빈도 접근 방식과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 하이브리드 알고리즘이 기존의 텍스트 분류 시스템보다 더 높은 분류 정확도를 달성한다.
  • 특징 추출에 연관 규칙를 사용함으로써, 훈련 문서 수가 적어도 효과적인 학습이 가능하다.
  • 최종 분류 단계에서 유전 알고리즘을 통합함으로써 모델 성능이 향상된다.
  • 시스템은 낮은 데이터 환경에서 뛰어난 성능을 보이며, 데이터가 부족한 응용 분야에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.