Skip to main content
QUICK REVIEW

[논문 리뷰] Stance Detection on Tweets: An SVM-based Approach

Dilek Küçük, Fazlı Can|arXiv (Cornell University)|2018. 03. 23.
Sentiment Analysis and Opinion Mining참고 문헌 16인용 수 16
한 줄 요약

이 논문은 터키어 스포츠 관련 트윗을 대상으로 한 새로운 공개된 입장 주석이 달린 데이터셋을 제시하며, 유니그램, 해시태그, 명명된 실체 특징을 사용한 SVM 기반 분류기의 성능을 평가한다. 주요 발견은 유니그램, 해시태그, 명명된 실체를 조합할 경우 가장 높은 F1 스코어(두 가지 확장된 데이터 버전에서 각각 84.2% 및 82.8%)를 기록하며, 터키어 소셜미디어 텍스트에서의 입장 검출에 강력한 베이스라인을 확립한다.

ABSTRACT

Stance detection is a subproblem of sentiment analysis where the stance of the author of a piece of natural language text for a particular target (either explicitly stated in the text or not) is explored. The stance output is usually given as Favor, Against, or Neither. In this paper, we target at stance detection on sports-related tweets and present the performance results of our SVM-based stance classifiers on such tweets. First, we describe three versions of our proprietary tweet data set annotated with stance information, all of which are made publicly available for research purposes. Next, we evaluate SVM classifiers using different feature sets for stance detection on this data set. The employed features are based on unigrams, bigrams, hashtags, external links, emoticons, and lastly, named entities. The results indicate that joint use of the features based on unigrams, hashtags, and named entities by SVM classifiers is a plausible approach for stance detection problem on sports-related tweets.

연구 동기 및 목표

  • 비영어권 언어에서의 주석이 달린 입장 데이터셋 부족 문제를 해결하기 위해, 두 개의 주요 축구클럽을 대상으로 한 터키어 스포츠 전용 입장 주석이 달린 트윗 데이터셋을 제작하고 공개한다.
  • SVM 분류기를 사용하여 유니그램, 바이그램, 해시태그, 링크, 이모티콘, 명명된 실체 등의 다양한 특징 세트가 입장 검출에 얼마나 효과적인지 평가한다.
  • 특히 스포츠 관련 논의의 맥락에서, 터키어 트윗에 대한 입장 검출에 강력한 베이스라인을 확립한다.
  • 터키어와 같이 자원이 적은 언어에서, 명명된 실체와 해시태그가 입장 분류에 어떻게 향상 기능을 하는지 탐색한다.

제안 방법

  • 단일 주석자 레이블이 있는 버전과 이중 주석자 합의를 반영한 두 가지 버전을 포함하여, 크기와 주석 품질이 점차 향상된 세 가지 버전의 터키어 트윗 데이터셋을 제작하였다. 모든 데이터셋은 두 축구클럽을 대상으로 한다.
  • 각 데이터셋 버전에 대해 10겹 교차검증을 사용하여 SVM 분류기를 훈련하였으며, 특징 세트로는 유니그램, 바이그램, 해시태그, 외부 링크, 이모티콘, 명명된 실체를 포함하였다.
  • 명명된 실체는 정확도와 재현율을 높이기 위해 수동으로 검증된 답변 키를 사용하여 추출하였으며, 이들의 포함 여부를 특징 세트로 평가하였다.
  • 특징 조합을 체계적으로 테스트하였으며, 각 입장 클래스(Favor, Against, Neither)에 대해 정밀도, 재현도, F1 스코어로 성능을 측정하였다.
  • 표준 자연어 처리 기법인 토큰화, 불용어 제거, 정규화를 적용하였으며, 이모티콘 특징은 사전 정의된 사전에서 유도하였다.
  • 최종 모델 구성은 유니그램, 해시태그 사용, 명명된 실체를 입력 특징으로 사용하였으며, 모든 데이터셋 버전에서 최고의 성능을 기록하였다.

실험 결과

연구 질문

  • RQ1고품질의 공개된 터키어 트윗 입장 주석 데이터셋을 제작하고 공개하여 자연어 처리 연구를 지원할 수 있는가?
  • RQ2유니그램, 바이그램, 해시태그, 링크, 이모티콘, 명명된 실체 등의 언어적 특징 조합 중에서 터키어 스포츠 트윗의 입장 검출에서 가장 높은 성능을 내는 조합은 무엇인가?
  • RQ3명명된 실체와 해시태그가 터키어 소셜미디어 텍스트에서의 입장 검출 성능 향상에 어느 정도 기여하는가?
  • RQ4데이터셋의 크기와 주석 신뢰도가 증가함에 따라, SVM 기반 분류기의 성능은 어떻게 변화하는가?

주요 결과

  • 유니그램 특징, 해시태그 사용, 명명된 실체의 조합이 세 번째 데이터셋 버전에서 가장 높은 F1 스코어 84.2%를 기록하였으며, 다른 모든 특징 조합보다 뛰어난 성능을 보였다.
  • 최적의 특징 세트를 사용할 경우, 세 번째 데이터셋 버전에서 Favor 클래스의 F1 스코어는 85.8%에 도달했고, Against 클래스는 82.6%였다.
  • 명명된 실체의 포함으로 성능이 크게 향상되었으며, 명명된 실체 없이 81.5%였던 F1 스코어가 명명된 실체를 포함시킨 후 84.2%로 상승하여 강력한 분류 능력을 보였다.
  • 해시태그를 특징으로 사용함으로써 성능 향상이 있었으며, 이는 터키어 트윗에서 해시태그 내용이 입장과 관련된 의미 있는 신호를 담고 있음을 시사한다.
  • 특히 이중 주석자 합의와 1,500건 이상의 트윗을 포함한 세 번째 데이터셋 버전는 향후 터키어 입장 검출 연구를 위한 신뢰할 수 있고 확장 가능한 벤치마크를 제공한다.
  • 이 연구는 터키어 입장 검출에 강력한 베이스라인을 확립하였으며, 최종 데이터셋 버전에서 SVM 기반 모델이 F1 스코어 80% 이상을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.