Skip to main content
QUICK REVIEW

[논문 리뷰] Performance Investigation of Feature Selection Methods

Anuj Sharma, Shubhamoy Dey|arXiv (Cornell University)|2013. 09. 16.
Sentiment Analysis and Opinion Mining참고 문헌 29인용 수 5
한 줄 요약

이 논문은 2000건의 영화 리뷰 코퍼스를 대상으로 문서 빈도, 정보 양, 성과 비율, 카이제곱, 리ليف-에프의 다섯 가지 특성 선택 방법을 평가하여 감성 분류 성능에 미치는 영향을 분석한다. 정보 양은 일관된 성능을 보였고, 성과 비율이 전체적으로 가장 뛰어난 성능을 기록하였다. 감성 어휘집(HM, GI, Opinion Lexicon)은 낮은 성능을 보였으며, 최적의 분류기 성능은 적절한 수의 대표적 특성 선택에 따라 달라졌다.

ABSTRACT

Sentiment analysis or opinion mining has become an open research domain after proliferation of Internet and Web 2.0 social media. People express their attitudes and opinions on social media including blogs, discussion forums, tweets, etc. and, sentiment analysis concerns about detecting and extracting sentiment or opinion from online text. Sentiment based text classification is different from topical text classification since it involves discrimination based on expressed opinion on a topic. Feature selection is significant for sentiment analysis as the opinionated text may have high dimensions, which can adversely affect the performance of sentiment analysis classifier. This paper explores applicability of feature selection methods for sentiment analysis and investigates their performance for classification in term of recall, precision and accuracy. Five feature selection methods (Document Frequency, Information Gain, Gain Ratio, Chi Squared, and Relief-F) and three popular sentiment feature lexicons (HM, GI and Opinion Lexicon) are investigated on movie reviews corpus with a size of 2000 documents. The experimental results show that Information Gain gave consistent results and Gain Ratio performs overall best for sentimental feature selection while sentiment lexicons gave poor performance. Furthermore, we found that performance of the classifier depends on appropriate number of representative feature selected from text.

연구 동기 및 목표

  • 다양한 특성 선택 방법이 감성 분류 성능 향상에 미치는 영향을 조사하기 위해.
  • 다양한 감성 어휘집이 특성 선택 및 분류 정확도에 미치는 영향을 평가하기 위해.
  • 감성 분석에서 재현율, 정밀도, 정확도를 극대화하기 위해 최적의 특성 수를 규명하기 위해.
  • 실제 영화 리뷰 데이터셋에서 피터 기반 특성 선택 방법의 성능을 비교하기 위해.

제안 방법

  • 이 연구는 다섯 가지 피터 기반 특성 선택 방법—문서 빈도, 정보 양, 성과 비율, 카이제곱, 리ليف-에프—를 적용하였다.
  • 특성 선택은 TF-IDF 벡터화를 사용하여 2000건의 영화 리뷰 코퍼스에서 수행되었다.
  • 세 가지 감성 어휘집—HM, GI, Opinion Lexicon—을 사용하여 비교를 위한 감성 특성을 추출하였다.
  • 정밀도, 재현율, 정확도와 같은 표준 지표를 사용하여 지도 학습 분류기를 훈련하고 평가하였다.
  • 각 방법의 성능를 선택된 특성 수를 다양하게 변화시켜 평가하여 최적의 특성 수를 규명하였다.
  • 재현 가능성을 보장하고 방법 간 직접 비교를 위해 고정된 데이터셋을 사용하여 실험를 수행하였다.

실험 결과

연구 질문

  • RQ1감성 분류에서 가장 높은 정밀도, 재현율, 정확도를 달성하는 특성 선택 방법은 무엇인가?
  • RQ2특성 선택에 사용되었을 때 서로 다른 감성 어휘집 간의 성능는 어떻게 비교되는가?
  • RQ3분류 성능을 극대화하기 위해 선택할 최적의 특성 수는 얼마인가?
  • RQ4정보 양과 성과 비율과 같은 피터 기반 방법들이 다른 방법들에 비해 일관성과 강건성 측면에서 어떻게 비교되는가?

주요 결과

  • 정보 양은 다양한 특성 수에서 일관된 성능를 보였으며, 감성 특성 선택에 신뢰할 수 있는 선택지로 간주될 수 있다.
  • 성과 비율은 정밀도, 재현율, 정확도 측면에서 전체적으로 가장 뛰어난 성능를 기록하여 평가된 모든 방법들 중에서 승리하였다.
  • 세 가지 감성 어휘집(HM, GI, Opinion Lexicon)은 낮은 성능를 보였으며, 이는 특성 선택에 단독으로 사용했을 때 효율성이 떨어짐을 시사한다.
  • 분류기 성능는 선택된 특성 수에 매우 민감하였으며, 특정한 중간 수준의 특성 수에서 최적의 성능를 기록하였다.
  • 카이제곱과 리ليف-에프는 중간 수준의 성능를 보였지만, 정보 양과 성과 비율에 비해 효과가 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.