Skip to main content
QUICK REVIEW

[논문 리뷰] On voting intentions inference from Twitter content: a case study on UK 2010 General Election

Vasileios Lampos|arXiv (Cornell University)|2012. 04. 02.
Sentiment Analysis and Opinion Mining참고 문헌 17인용 수 15
한 줄 요약

이 연구는 영국 2010년 총선 기간 동안 트위터 콘텐츠에서 정서 분석과 지도 학습 모델을 활용하여 투표 의도를 추론하는 방법을 제안한다. 의미 해석을 향상시키기 위해 트윗에 동의어를 보완함으로써, 이 접근법은 평균 절대 오차 4.34% ± 2.13%를 달성하여 보수당, 노동당, 자유민주당의 여론조사 비율을 통계적으로 유의미하게 예측함을 보여준다.

ABSTRACT

This is a report, where preliminary work regarding the topic of voting intention inference from Social Media - such as Twitter - is presented. Our case study is the UK 2010 General Election and we are focusing on predicting the percentages of voting intention polls (conducted by YouGov) for the three major political parties - Conservatives, Labours and Liberal Democrats - during a 5-month period before the election date (May 6, 2010). We form three methodologies for extracting positive or negative sentiment from tweets, which build on each other, and then propose two supervised models for turning sentiment into voting intention percentages. Interestingly, when the content of tweets is enriched by attaching synonymous words, a significant improvement on inference performance is achieved reaching a mean absolute error of 4.34% +/- 2.13%; in that case, the predictions are also shown to be statistically significant. The presented methods should be considered as work-in-progress; limitations and suggestions for future work appear in the final section of this script.

연구 동기 및 목표

  • 트위터 콘텐츠가 실제 투표 의도 추세를 추론하는 데 사용될 수 있는가를 조사하기 위해.
  • 정서 분석 기법이 정치적 예측을 위한 비공식적인 소셜 미디어 텍스트에 얼마나 효과적인가를 평가하기 위해.
  • 의미 표현을 향상시키기 위해 동의어를 통합함으로써 정서 추론을 개선하기 위해.
  • 트위터 데이터를 활용하여 영국 주요 정당의 공식 여론조사 비율을 모델링하고 예측하기 위해.
  • 제안된 추론 방법의 통계적 유의성과 강건성을 평가하기 위해.

제안 방법

  • 세 가지 정서 추출 방법이 개발됨: SnPOS(품사 태깅 없음), SPOS(품사 태깅 있음), SPOSW(동의어 보완 있음).
  • 각 정당 전용 키워드(예: 정당 이름, 주요 정치인)를 사용하여 5개월 간의 기간(2010년 1월~5월) 동안 관련 트윗을 검색함.
  • SentiWordNet 3.0을 사용해 단어에 정서 점수를 할당하며, 어형을 처리하기 위해 Porter의 알고리즘을 적용함.
  • 품사 태깅은 Stanford POS Tagger를 사용해 품사 맥락에 따라 정서 할당을 정밀화함.
  • SPOSW에서 동의어 보완은 의미적으로 관련된 단어로 각 트윗의 어휘적 내용을 확장하여 신호 탐지 능력을 향상시킴.
  • 두 가지 지도 학습 모델이 정서 점수를 예측된 투표 의도 비율로 매핑하며, 기준값으로 YouGov의 공개 여론조사 데이터를 사용함.

실험 결과

연구 질문

  • RQ1트위터 정서는 국가적 투표 의도 추세를 신뢰성 있게 추론하는 데 사용될 수 있는가?
  • RQ2동의어 보완이 소셜 미디어에서의 투표 의도 추론 정확도에 미치는 영향은 어떠한가?
  • RQ3품사 태깅을 고려한 정서 분석 방법이 고려하지 않은 방법보다 성능이 뛰어나지 않는가?
  • RQ4예측된 투표 의도 비율이 실제 여론조사와 비교해 통계적으로 유의미한가?
  • RQ5다양한 정서 추출 기법 간 평균 절대 오차(MAE) 측면에서의 성능 비교는 어떠한가?

주요 결과

  • 동의어를 트윗에 보완하는 SPOSW 방법이 가장 낮은 평균 절대 오차 4.34% ± 2.13%를 기록함.
  • 이 성능은 통계적으로 유의미하여 모델이 공식 여론조사 추세를 신뢰성 있게 예측함을 시사함.
  • SnPOS 및 SPOS 방법은 성능이 열악했으며 통계적으로 유의미하지 않았음.
  • 동의어 보완을 통합함으로써 추론 정확도가 크게 향상되어 의미 해석의 향상이 트윗 내 정치적 신호를 증폭시킴을 시사함.
  • 임계값 설정은 일부 경우에서 성능 향상을 가져왔지만 일관되지 않은 영향을 미쳐 보편적으로 유익하지 않을 수 있음.
  • 결과는 소셜 미디어 콘텐츠가 의미의 풍부함이 증가할수록 정치적 의견 신호를 함축하고 있음을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.