[논문 리뷰] A Study of Feature Extraction techniques for Sentiment Analysis
이 연구는 다섯 개의 벤치마크 데이터셋을 대상으로 TF-IDF와 Doc2Vec를 감성 분석에 적용하여 다양한 분류기와 비교한다. 대부분의 데이터셋에서 Doc2Vec가 TF-IDF를 능가했으며, 특히 소규모이자 도메인 특화된 리뷰에서 두드러진 성능을 보였다. Logistic Regression과 SVM-RBF가 가장 높은 정확도를 기록하여, 분산 문장 표현 기법이 전통적인 어간 빈도 기반 방법보다 감성 분류 성능을 향상시킨다는 것을 입증한다.
Sentiment Analysis refers to the study of systematically extracting the meaning of subjective text . When analysing sentiments from the subjective text using Machine Learning techniques,feature extraction becomes a significant part. We perform a study on the performance of feature extraction techniques TF-IDF(Term Frequency-Inverse Document Frequency) and Doc2vec (Document to Vector) using Cornell movie review datasets, UCI sentiment labeled datasets, stanford movie review datasets,effectively classifying the text into positive and negative polarities by using various pre-processing methods like eliminating StopWords and Tokenization which increases the performance of sentiment analysis in terms of accuracy and time taken by the classifier.The features obtained after applying feature extraction techniques on the text sentences are trained and tested using the classifiers Logistic Regression,Support Vector Machines,K-Nearest Neighbours , Decision Tree and Bernoulli Nave Bayes
연구 동기 및 목표
- TF-IDF와 Doc2Vec가 감성 분석에서 특징 추출 기법으로서 효과적인지 평가하는 것.
- 정규화 단계인 불용어 제거 및 토큰화가 분류 정확도에 미치는 영향을 평가하는 것.
- TF-IDF와 Doc2Vec를 각각 사용할 때, Logistic Regression, SVM, KNN, 의사결정트리, 베르누이 나이브 베이즈 등 다양한 분류기의 성능을 비교하는 것.
- 다양한 크기의 감성 데이터셋에서 어떤 특징 추출 기법이 더 높은 정확도를 낼 수 있는지 규명하는 것.
- 실세계 감성 분류 작업에 있어서 TF-IDF와 Doc2Vec의 적합성에 대한 경험적 통찰을 제공하는 것.
제안 방법
- 최대 문서 빈도(max_df), IDF 사용(use_idf), 하위선형 테이블(sublinear_tf), 불용어 필터링을 적용한 TF-IDF 적용.
- 최적화된 하이퍼파라미터를 사용한 Doc2Vec: min_count, 윈도우 크기(window size), 벡터 크기(vector size), 음성 샘플링(negative sampling), 작업자 수(works), dm(0은 CBOW, 1은 스킵그램), 반복 횟수(epochs).
- 특징 추출 이전에 토큰화 및 불용어 제거를 통해 텍스트 전처리 수행.
- Cornell 영화 리뷰, UCI 감성 레이블링 데이터, 스탠포드 영화 리뷰, 그리고 스탠포드와 Cornell에서 확보한 더 큰 데이터셋을 포함한 다섯 개의 벤치마크 데이터셋을 기반으로 분류기 학습 및 테스트.
- 정확도를 주요 평가 지표로 사용하며, 진짜 양성, 가짜 양성 등 2x2 교차표 기반으로 계산.
- 다양한 크기의 데이터셋 간 비교 분석을 통해 각 방법의 확장성과 견고성 평가.
실험 결과
연구 질문
- RQ1다양한 감성 데이터셋에서 TF-IDF와 Doc2Vec의 분류 정확도는 어떻게 비교되는가?
- RQ2정규화와 특징 추출의 조합 중 어느 것이 가장 높은 감성 분류 정확도를 낼 수 있는가?
- RQ3다양한 데이터셋 크기에서 TF-IDF와 Doc2Vec를 사용할 때 어떤 분류기가 가장 잘 작동하는가?
- RQ4특히 자원이 제한된 또는 도메인 특화된 환경에서 Doc2Vec가 TF-IDF를 일관되게 능가하는가?
- RQ5TF-IDF와 Doc2Vec의 하이퍼파라미터 설정이 최종 감성 예측 성능에 어떤 영향을 미치는가?
주요 결과
- Doc2Vec는 다섯 개의 데이터셋 중 네 개에서 TF-IDF를 뛰어넘는 높은 정확도를 기록했으며, 특히 소규모이자 도메인 특화된 데이터셋인 Dataset-4에서는 Logistic Regression을 사용해 99.98%의 정확도를 달성했다.
- Dataset-1(1,500개 리뷰)에서는 모든 분류기에서 Doc2Vec가 TF-IDF를 능가했으며, SVM-RBF는 86.86%의 정확도를 기록한 반면 TF-IDF는 75.14%에 머물렀다.
- Dataset-5(대규모 영화 리뷰 데이터셋)에서는 TF-IDF가 약간 더 높은 성능을 보였으며, Logistic Regression은 88.46%의 정확도를 기록한 반면 Doc2Vec는 86.49%였다.
- Logistic Regression과 RBF 및 선형 커널을 사용한 SVM는 두 특징 추출 기법 모두에서 일관되게 가장 높은 정확도를 기록하여 감성 분류에 있어 뛰어난 견고성을 보였다.
- Dataset-2(2,000개 리뷰)에서는 TF-IDF가 Doc2Vec를 앞서며, SVM-RBF는 82.35%의 정확도를 기록했고, Doc2Vec는 77.40%에 머물렀다.
- 메서드 간 성능 격차는 데이터셋 크기와 도메인에 따라 달라졌으며, 이는 Doc2Vec가 미세한 문맥이나 감성에 민감한 분석에 더 효과적임을 시사하며, TF-IDF는 더 큰 일반 목적의 데이터셋에서는 여전히 경쟁력이 있음을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.