Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Feature Selection techniques for Sentiment Analysis

Avinash Madasu, E. Sivasankar|arXiv (Cornell University)|2019. 11. 01.
Sentiment Analysis and Opinion Mining참고 문헌 43인용 수 8
한 줄 요약

이 논문은 TF-IDF 특징을 사용한 감성 분석에서 필터 기반 특징 선택 기법(卡-제곱 및 카운트 차이)과 앙상블 방법(Bagging 및 랜덤 서브스페이스)을 조합하여 평가한다. 이들 효율적이고 파rameter가 적은 접근 방식이 깊이 신경망보다 정확도, 학습 시간, OOV 처리에서 뛰어난 성능을 보이며, 특히 소규모 데이터셋에서 두각을 나타낸다.

ABSTRACT

Sentiment analysis is a domain of study that focuses on identifying and classifying the ideas expressed in the form of text into positive, negative and neutral polarities. Feature selection is a crucial process in machine learning. In this paper, we aim to study the performance of different feature selection techniques for sentiment analysis. Term Frequency Inverse Document Frequency (TF-IDF) is used as the feature extraction technique for creating feature vocabulary. Various Feature Selection (FS) techniques are experimented to select the best set of features from feature vocabulary. The selected features are trained using different machine learning classifiers Logistic Regression (LR), Support Vector Machines (SVM), Decision Tree (DT) and Naive Bayes (NB). Ensemble techniques Bagging and Random Subspace are applied on classifiers to enhance the performance on sentiment analysis. We show that, when the best FS techniques are trained using ensemble methods achieve remarkable results on sentiment analysis. We also compare the performance of FS methods trained using Bagging, Random Subspace with varied neural network architectures. We show that FS techniques trained using ensemble classifiers outperform neural networks requiring significantly less training time and parameters thereby eliminating the need for extensive hyper-parameter tuning.

연구 동기 및 목표

  • 감성 분석에 적용된 다양한 필터 기반 특징 선택 기법의 효과성을 평가하는 것.
  • 앙상블 학습 방법(Bagging 및 랜덤 서브스페이스)이 선택된 특징의 성능에 어떻게 기여하는지 조사하는 것.
  • 기본 벤치마크 감성 데이터셋에서 특징 선택 기반 모델과 딥 뉴럴 네트워크 아키텍처 간의 성능을 비교하는 것.
  • 특징 선택 기반 모델과 신경망 간의 학습 시간, 모델 파ram터, OOV(어휘 외 단어) 처리 능력 간의 상충 관계를 분석하는 것.
  • 감성 분류에 최적의 특징 선택 방법, 기저 분류기, 앙상블 기법 조합을 규명하는 것.

제안 방법

  • 텍스트 데이터로부터 고차원 특징 어휘를 생성하기 위해 TF-IDF를 사용한 특징 추출.
  • 필터 기반 특징 선택 기법 적용: 카-제곱, 카운트 차이(CD), 정보 양(Information Gain)을 통해 관련 특징을 선별.
  • 선택된 특징에 기반해 기저 분류기—로지스틱 회귀(LR), 다항 나이브 베이즈(MNB), 결정 트리(DT), 서포트 벡터 머신(SVM)을 학습.
  • 앙상블 기법 적용: Bagging 및 랜덤 서브스페이스를 통해 분류기 예측의 일반화 능력 향상 및 분산 감소.
  • 표준 데이터셋(MR, Books, DVD, Electronics, Kitchen)에서 최신 신경망 모델(LSTM, Bi-LSTM, CNN-Rand, CNN-Static, TF-DCNN/T-MCCNN)과의 비교.
  • 다섯 개의 벤치마크 데이터셋에서 정확도 및 F1-스코어를 평가하였으며, 신뢰성 확보를 위해 다섯 번의 반복 평균을 취함.

실험 결과

연구 질문

  • RQ1앙상블 방법과 조합했을 때, 카-제곱, CD, 정보 양 중 어떤 필터 기반 특징 선택 기법이 감성 분석에서 가장 높은 정확도를 달성하는가?
  • RQ2Bagging 및 랜덤 서브스페이스와 같은 앙상블 기법이 선택된 특징에 기반한 기계 학습 분류기의 성능을 어떻게 향상시키는가?
  • RQ3특징 선택 기반 모델이 정확도, 학습 시간, 파ram터 효율성 측면에서 딥 뉴럴 네트워크 아키텍처를 능가할 수 있는가?
  • RQ4특징 선택 모델은 사전에 학습된 워드 임베딩에 의존하는 신경망과 비교해 OOV(어휘 외 단어)를 어떻게 처리하는가?
  • RQ5특징 선택과 앙상블를 사용할 때와 딥 러닝 모델을 사용할 때의 모델 복잡도(파ram터 수)와 성능 간의 상충 관계는 어떠한가?

주요 결과

  • 카-제곱 및 카운트 차이 특징 선택 기법이 모든 데이터셋에서 가장 높은 정확도를 기록하였으며, 정보 양 및 기타 필터 기법을 능가했다.
  • 카-제곱 기반 다항 나이브 베이즈와 랜덤 서브스페이스 앙상블 조합이 Electronics 데이터셋에서 84.75%의 F1-스코어, Kitchen 데이터셋에서 84.5%의 F1-스코어를 기록했다.
  • 랜덤 서브스페이스를 사용한 특징 선택 모델이 배깅을 사용한 모델보다 성능이 뛰어났으며, 특히 Books 및 Electronics 데이터셋에서 두각을 나타냈다.
  • 최고 성능을 기록한 특징 선택 모델(Ca+MNB+RS)이 Electronics에서 84.75%, Kitchen에서 84.5%의 F1-스코어를 기록하여, TF-MCCNN 및 TF-DCNN 신경망 모델조차도 능가했다.
  • 특징 선택 기반 앙상블 모델은 LSTMs(560만 개 이상의 파aram터)보다 훨씬 적은 학습 시간과 파aram터 수(예: LR 기준 8,001개)를 요구하여 하이퍼파ram터 튜닝의 필요성을 크게 감소시켰다.
  • 특징 선택 기법은 OOV 단어에 대해 강건했으며, 사전에 학습된 임베딩에 의존하는 신경망과 달리 희귀 또는 미리보지 않은 단어 처리에 어려움을 겪지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.