Skip to main content
QUICK REVIEW

[논문 리뷰] Text classification based on ensemble extreme learning machine

Ming Li, Peilun Xiao|arXiv (Cornell University)|2018. 05. 10.
Machine Learning and ELM참고 문헌 23인용 수 16
한 줄 요약

이 논문은 텍스트 분류 정확도를 향상시키기 위해 비용 감수성 학습과 정보 엔트로피를 통한 표본 중요도 측정을 통합한 앙상블 극단적 학습 기반 프레임워크인 AE1-WELM을 제안한다. 특히 데이터 불균형 상황에서 성능 향상을 도모한다. 가중치가 부여된 ELM을 AdaBoost.M1에 통합하고, 단어 벡터 표현과 결합함으로써 고차원적 희소성 문제를 완화하며, 벤치마크 텍스트 분류 작업에서 뛰어난 성능을 달성한다.

ABSTRACT

In this paper, we propose a novel approach based on cost-sensitive ensemble weighted extreme learning machine; we call this approach AE1-WELM. We apply this approach to text classification. AE1-WELM is an algorithm including balanced and imbalanced multiclassification for text classification. Weighted ELM assigning the different weights to the different samples improves the classification accuracy to a certain extent, but weighted ELM considers the differences between samples in the different categories only and ignores the differences between samples within the same categories. We measure the importance of the documents by the sample information entropy, and generate cost-sensitive matrix and factor based on the document importance, then embed the cost-sensitive weighted ELM into the AdaBoost.M1 framework seamlessly. Vector space model(VSM) text representation produces the high dimensions and sparse features which increase the burden of ELM. To overcome this problem, we develop a text classification framework combining the word vector and AE1-WELM. The experimental results show that our method provides an accurate, reliable and effective solution for text classification.

연구 동기 및 목표

  • 표준 가중치가 부여된 ELM이 텍스트 분류에서 클래스 불균형과 내부 클래스 표본 변동성을 다루는 데에 한계가 있음을 해결하기 위해.
  • 표본 정보 엔트로피를 통한 문서 중요도를 학습 과정에 통합하여 분류 정확도를 향상시키기 위해.
  • 분류 기반의 고차원적 희소 벡터 공간 모델(VSM) 표현의 영향을 줄이기 위해 단어 벡터 특징과 통합함으로써 ELM에서의 영향을 감소시키기 위해.
  • 앙상블 학습을 활용하여 균형 잡힌 및 불균형적인 다중 클래스 텍스트 분류에 모두 적용 가능한 강력하고 확장 가능한 프레임워크를 개발하기 위해.
  • 실제 텍스트 분류 과제에서 흔히 발생하는 데이터 불균형과 특징의 희소성 문제에 효과적인 해결책을 제공하기 위해.

제안 방법

  • 문서 중요도를 반영하기 위해 표본 정보 엔트로피를 사용하여 계산된 비용 감수성 행렬과 요소를 도입하여 내부 클래스 표본 차이를 반영한다.
  • 불균형 데이터셋에서의 분류 성능 향상을 위해 카테고리별 및 표본별 가중치를 부여한 가중치가 부여된 ELM을 개선한다.
  • 비용 감수성 가중치가 부여된 ELM을 AdaBoost.M1 부스팅 프레임워크에 통합하여 반복적으로 약한 학습기들을 향상시키는 앙상블 모델(AE1-WELM)을 구축한다.
  • 기존의 VSM과 분산형 단어 벡터를 조합하는 하이브리드 텍스트 표현 모델을 통해 ELM에서의 희소성과 차원의 문제를 완화한다.
  • 프레임워크는 종단 간 학습 방식으로 구현되며, 특징 표현과 분류가 함께 최적화되어 일반화 능력 향상에 기여한다.
  • 학습 중에 엔트로피 기반 중요도 점수에 따라 표본 가중치를 동적으로 조정하여 중요한 문서의 오분류를 줄인다.

실험 결과

연구 질문

  • RQ1동일 클래스 내 표본 중요도를 효과적으로 측정하고 학습 과정에 통합함으로써 분류 성능 향상을 달성할 수 있는가?
  • RQ2정보 엔트로피와 결합된 비용 감수성 학습이 불균형 텍스트 분류 과제에서 ELM의 성능을 얼마나 향상시키는가?
  • RQ3VSM과 단어 벡터 표현을 조합함으로써 ELM 기반 텍스트 분류에서의 희소성과 차원 부담을 줄일 수 있는가?
  • RQ4제안된 AE1-WELM 프레임워크는 균형 잡힌 및 불균형 데이터셋에서 표준 ELM 및 기타 앙상블 방법과 비교해 정확도와 내구성 측면에서 어떻게 성과를 내는가?
  • RQ5비용 감수성 가중치가 부여된 ELM을 AdaBoost.M1 프레임워크에 통합함으로써 전체 분류 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • AE1-WELM 프레임워크는 여러 벤치마크 텍스트 분류 데이터셋에서 표준 ELM 및 가중치가 부여된 ELM보다 높은 분류 정확도를 달성한다.
  • 정보 엔트로피 기반 표본 중요도 통합은 소수 클래스에서 성능 향상을 크게 개선하여 불균형 설정에서의 오분류를 줄인다.
  • 하이브리드 VSM과 단어 벡터 표현은 특징 차원을 감소시키고 희소성을 줄여 ELM에서 빠른 수렴과 더 나은 일반화를 이끈다.
  • AE1-WELM의 앙상블 특성과 비용 감수성 학습의 조합은 다양한 텍스트 분류 과제에서 더 안정적이고 신뢰할 수 있는 예측을 가능하게 한다.
  • 이 방법은 균형 잡힌 다중 클래스 텍스트 분류 문제와 불균형 문제 양쪽 모두에서 강건성을 보이며, 기준 모델을 일관되게 능가한다.
  • 실험 결과는 제안된 프레임워크가 전통적인 VSM 기반 ELM에서의 고차원적 희소 특징의 악영향을 효과적으로 완화함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.