[논문 리뷰] Sentiment analysis on electricity twitter posts
이 연구는 영어로 된 약 10,000건의 영국 및 인도 전기 요금 인상에 관한 트위터 트윗을 대상으로 TF-IDF 특성 추출 및 다수의 기계학습 분류기들을 사용하여 정서 분석을 수행한다. 랜덤 포레스트가 가장 높은 정확도(84%)를 기록하여 나이브 베이즈(66%)를 압도했으며, TF-IDF 단어 수준 특성은 N-gram 특성보다 우수한 성능을 보였다.
In today's world, everyone is expressive in some way, and the focus of this project is on people's opinions about rising electricity prices in United Kingdom and India using data from Twitter, a micro-blogging platform on which people post messages, known as tweets. Because many people's incomes are not good and they have to pay so many taxes and bills, maintaining a home has become a disputed issue these days. Despite the fact that Government offered subsidy schemes to compensate people electricity bills but it is not welcomed by people. In this project, the aim is to perform sentiment analysis on people's expressions and opinions expressed on Twitter. In order to grasp the electricity prices opinion, it is necessary to carry out sentiment analysis for the government and consumers in energy market. Furthermore, text present on these medias are unstructured in nature, so to process them we firstly need to pre-process the data. There are so many feature extraction techniques such as Bag of Words, TF-IDF (Term Frequency-Inverse Document Frequency), word embedding, NLP based features like word count. In this project, we analysed the impact of feature TF-IDF word level on electricity bills dataset of sentiment analysis. We found that by using TF-IDF word level performance of sentiment analysis is 3-4 higher than using N-gram features. Analysis is done using four classification algorithms including Naive Bayes, Decision Tree, Random Forest, and Logistic Regression and considering F-Score, Accuracy, Precision, and Recall performance parameters.
연구 동기 및 목표
- 영국 및 인도의 전기 요금 인상에 대한 공적 정서를 트위터 데이터를 활용하여 분석한다.
- 특히 TF-IDF 단어 수준 특성과 N-gram 특성 간의 차이를 고려하여 다양한 특성 추출 기법의 정서 분류 성능에 대한 효과성을 평가한다.
- 다양한 기계학습 분류기(Naive Bayes, 결정 트리, 랜덤 포레스트, 로지스틱 회귀)의 정서 분류 작업에서의 성능을 비교한다.
- 정부 및 에너지 시장 이해관계자들이 활용할 수 있도록 에너지 요금 인상에 대한 공적 여론과 정책 반응에 대한 통찰을 제공한다.
제안 방법
- 파이썬을 사용하여 트위터 API를 통해 전기 요금 인상 관련 약 10,000건의 영어 트윗을 수집하였다.
- 표준 자연어 처리 기법을 통해 텍스트 데이터를 전처리하였으며, 이는 토큰화 및 불용어 제거를 포함한다.
- TF-IDF(Term Frequency-Inverse Document Frequency)를 단어 수준에서 적용하여 특성 추출하고, N-gram 특성과 비교하였다.
- 정서 극성 예측을 위해 네 가지 분류 알고리즘(Naive Bayes, 결정 트리, 랜덤 포레스트, 로지스틱 회귀)을 적용하였다.
- 표준 평가 지표인 F-Score, 정확도, 정밀도, 재현율을 사용하여 모델 성능을 평가하였다.
- 모델의 분리 능력과 종합 성능 평가를 위해 ROC 곡선과 AUC 점수를 생성하였다.
실험 결과
연구 질문
- RQ1TF-IDF 단어 수준 특성과 N-gram 특성 중 어느 것이 전기 요금 관련 트윗의 정서 분류 성능에서 더 우수한가?
- RQ2다양한 기계학습 모델(Naive Bayes, 결정 트리, 랜덤 포레스트, 로지스틱 회귀)은 전기 요금 관련 트위터 데이터의 정서 분류에서 어떻게 성능을 비교하는가?
- RQ3영국 및 인도의 전기 요금 관련 트윗을 담은 다국어 실세계 데이터셋에 대해 정서 분류 모델의 총합 정확도와 F-Score는 얼마인가?
- RQ4이 맥락에서 TF-IDF 특성은 다른 특성 세트에 비해 정서 분류 성능 향상에 얼마나 기여하는가?
주요 결과
- 랜덤 포레스트가 84%의 가장 높은 정확도를 기록하여 나이브 베이즈(66%)를 뚜렷이 앞섰다.
- TF-IDF 단어 수준 특성이 N-gram 특성 대비 정서 분류 성능에서 3~4% 향상된 결과를 보였다.
- 결정 트리와 랜덤 포레스트는 정밀도가 가장 높았으며, 이는 긍정 정서를 분류하는 데 뛰어난 신뢰성을 보였음을 시사한다.
- 랜덤 포레스트와 로지스틱 회귀는 재현율이 가장 높았으며, 이는 실제 긍정 정서 사례를 더 잘 탐지할 수 있음을 의미한다.
- 모든 모델의 AUC 점수는 양호한 분리 능력을 보였으며, 결정 트리와 랜덤 포레스트는 0.7 이상의 값을 기록하여 강력한 모델 구분 능력을 확인하였다.
- 데이터셋 크기 및 언어 범위의 한계가 존재하나, 모델들은 높은 성능을 보였으며, 특히 랜덤 포레스트가 이 작업에서 가장 효과적인 분류기로 뚜렷이 부각되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.