Skip to main content
QUICK REVIEW

[논문 리뷰] Stance Detection in Turkish Tweets

Dilek Küçük|arXiv (Cornell University)|2017. 06. 21.
Sentiment Analysis and Opinion Mining참고 문헌 6인용 수 9
한 줄 요약

이 논문은 터키어 트윗을 대상으로 한 첫 번째 공개된 입장 탐지 데이터셋을 제시하며, 두 개의 주요 스포츠 클럽에 대한 입장(지지, 반대, 중립)을 주제로 annotation하였다. 유니그램, 바이그램, 해시태그 특징을 사용한 SVM 분류기로 두 타겟에 대해 각각 80.1%와 74.0%의 F-measure 점수를 기록하여, 향후 터키어 입장 탐지 연구를 위한 기초 성과를 확립하였다.

ABSTRACT

Stance detection is a classification problem in natural language processing where for a text and target pair, a class result from the set {Favor, Against, Neither} is expected. It is similar to the sentiment analysis problem but instead of the sentiment of the text author, the stance expressed for a particular target is investigated in stance detection. In this paper, we present a stance detection tweet data set for Turkish comprising stance annotations of these tweets for two popular sports clubs as targets. Additionally, we provide the evaluation results of SVM classifiers for each target on this data set, where the classifiers use unigram, bigram, and hashtag features. This study is significant as it presents one of the initial stance detection data sets proposed so far and the first one for Turkish language, to the best of our knowledge. The data set and the evaluation results of the corresponding SVM-based approaches will form plausible baselines for the comparison of future studies on stance detection.

연구 동기 및 목표

  • 스포츠 클럽에 대한 대중의 감정을 중심으로 한 첫 번째 터키어 트윗 입장 annotation 데이터셋을 구축하기.
  • 이 데이터셋에서 유니그램, 바이그램, 해시태그 특징을 사용한 SVM 분류기의 성능을 평가하기.
  • 향후 터키어 입장 탐지 연구를 위한 기초 성과를 수립하기.
  • 저자원 언어인 터키어와 같은 언어에서 해시태그 특징이 입장 탐지에 어떻게 활용될 수 있는지 탐색하기.

제안 방법

  • 두 스포츠 클럽 대상으로 터키어 트윗을 입장 레이블(지지, 반대, 중립)로 annotation하기.
  • 각 타겟에 대해 유니그램, 바이그램, 해시태그 유무를 특징으로 사용하여 별도의 SVM 분류기 학습하기.
  • 정밀도, 재현율, F-measure를 평가하기 위해 10겹 교차검증 적용하기.
  • 유니그램만, 유니그램 + 해시태그 등 다양한 특징 세트의 분류 성능에 미치는 영향 비교하기.
  • 초기 데이터 생성을 위해 단일 annotator를 활용하며, 향후 커뮤니티 기반 캐논을 통해 데이터 품질 향상 계획 수립.
  • 기존 영어 및 기타 언어의 입장 탐지 시스템과의 성능 비교를 통해 벤치마크 설정하기.

실험 결과

연구 질문

  • RQ1터키어 트윗에서 유니그램, 바이그램, 해시태그 특징은 입장 탐지에 얼마나 효과적인가?
  • RQ2작은 도메인 특화 터키어 트윗 데이터셋으로 학습된 SVM 분류기는 신뢰할 수 있는 입장 탐지 성능을 달성할 수 있는가?
  • RQ3해시태그 존재 여부를 특징으로 포함시키면 터키어 소셜 미디어 텍스트의 입장 탐지 성능이 향상되는가?
  • RQ4이 저자원 터키어 데이터셋에서 유니그램 기반 모델과 바이그램 기반 모델의 성능는 어떻게 비교되는가?
  • RQ5이 데이터셋이 향후 터키어 입장 탐지 연구를 위한 기초 자료로 얼마나 유용한가?

주요 결과

  • 유니그램 특징을 사용한 SVM 분류기는 Target-1에 대해 80.1%의 F-measure, Target-2에 대해 74.0%의 F-measure를 기록하여 터키어 입장 탐지에 강력한 기초 성과를 확립하였다.
  • 해시태그 존재 여부를 특징으로 포함시켰을 때 Target-2의 F-measure가 1.8% 향상되어, 입장 탐지에 잠재적인 유용성을 시사하였다.
  • 바이그램 특징만을 사용한 경우 성능이 뚜렷이 열등했으며, 이는 데이터셋 크기가 작기 때문으로 보인다.
  • 이 데이터셋은 스포츠 관련 트윗에 특화된 첫 번째 공개된 터키어 입장 annotation 자료이다.
  • 본 연구는 터키어에서 SVM 기반 입장 탐지의 첫 번째 체계적 평가를 제공하며, 향후 다국어 및 다언어 연구의 기초를 마련하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.