Skip to main content
QUICK REVIEW

[논문 리뷰] Performing Stance Detection on Twitter Data using Computational Linguistics Techniques

Gourav Ganesh Shenoy, Erika Helda Dsouza|arXiv (Cornell University)|2017. 03. 06.
Sentiment Analysis and Opinion Mining참고 문헌 5인용 수 3
한 줄 요약

이 논문은 자연어 처리 기법을 활용하여 트위터 데이터에서 감성 태도 검출을 위한 지도 학습 접근법을 제시한다. 이는 단어 집합(bag-of-words), 어휘 기반 특징(Argument 및 MPQA), MALT를 통한 의존성 파싱, Random Forest 분류기를 조합하여 구현된다. 문법적 구조와 어휘적 특징을 통합함으로써 정확도를 향상시키며, 이는 구조화된 언어 분석이 기본 텍스트 특징을 넘어서 태도 검출 성능을 향상시킬 수 있음을 보여준다.

ABSTRACT

As humans, we can often detect from a persons utterances if he or she is in favor of or against a given target entity (topic, product, another person, etc). But from the perspective of a computer, we need means to automatically deduce the stance of the tweeter, given just the tweet text. In this paper, we present our results of performing stance detection on twitter data using a supervised approach. We begin by extracting bag-of-words to perform classification using TIMBL, then try and optimize the features to improve stance detection accuracy, followed by extending the dataset with two sets of lexicons - arguing, and MPQA subjectivity; next we explore the MALT parser and construct features using its dependency triples, finally we perform analysis using Scikit-learn Random Forest implementation.

연구 동기 및 목표

  • 주어진 대상에 대해 트위터 게시물에서 태도(지지, 반대, 중립)를 자동으로 탐지하는 방법을 개발하는 것.
  • 단어 집합, 감성 어휘, 문법적 의존성과 같은 다양한 계산적 언어학적 특징이 태도 검출 성능 향상에 기여하는지 평가하는 것.
  • 의존성 파싱을 통해 추출한 언어적 구조를 통합할 경우, 기존의 표면 기반 텍스트 특징에 비해 분류 정확도가 향상되는지 조사하는 것.
  • 특히 Random Forest를 포함한 다양한 특징 세트와 기계 학습 모델의 성능을 비교하여 지도 학습 기반 태도 검출 프레임워크에서의 성능을 평가하는 것.

제안 방법

  • 저자는 초기 분류를 위해 TIMBL을 사용하여 단어 집합 특징을 기반으로 지도 학습 접근법을 적용한다.
  • 두 개의 어휘를 통합하여 특징 표현을 향상시킨다: 태도 관련 용어를 위한 Arguing 어휘와 감성 신호를 위한 MPQA 주관성 어휘.
  • MALT 파서를 적용하여 의존성 삼중항을 추출하고, 이를 통해 문장 내 문법적 관계를 반영한 구조적 특징을 생성한다.
  • 특징 세트를 통합하고 Scikit-learn의 Random Forest 분류기를 사용하여 성능을 평가한다.
  • 모델은 트위터 태도 검출 데이터셋을 기반으로 학습 및 테스트되며, 다양한 특징 조합에 따른 정확도가 측정된다.
  • 모델 성능 최적화를 위해 초모수 튜닝과 교차 검증이 적용된다.

실험 결과

연구 질문

  • RQ1도메인 특화 어휘(Argument 및 MPQA)의 통합이 트위터 데이터에서 태도 검출 정확도에 미치는 영향은 어떠한가?
  • RQ2의존성 파싱을 통해 유도된 문법적 특징이 표면 기반 텍스트 특징을 넘어서 태도 분류 성능을 얼마나 향상시키는가?
  • RQ3다양한 언어학적 특징 세트를 활용할 경우, Random Forest 분류기가 간단한 모델보다 성능이 뛰어나게 작용하는가?
  • RQ4단어 집합, 어휘 기반, 문법적 특징의 다양한 조합이 종합적인 분류 성능에 미치는 영향은 어떠한가?

주요 결과

  • Arguing 어휘의 통합은 기존의 단어 집합 특징만을 사용한 기준 모델에 비해 태도 검출 정확도를 뚜렷이 향상시켰다.
  • MPQA 주관성 어휘의 추가로 중립 태도 및 감성 기반 태도를 보다 잘 탐지할 수 있었다.
  • MALT 파서를 통해 추출한 의존성 기반 특징은 특히 미묘한 태도 표현을 포착하는 데 있어 측정 가능한 성능 향상을 제공하였다.
  • Random Forest 분류기는 테스트된 모델들 중에서 가장 높은 정확도를 기록하였으며, 통합된 특징 세트에 대해 강력한 일반화 능력을 보였다.
  • 최고 성능을 기록한 모델은 단어 집합, 어휘 기반 특징, 의존성 삼중항을 모두 조합하여 개별 특징 세트에 비해 F1 점수에서 뚜렷한 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.