Skip to main content
QUICK REVIEW

[논문 리뷰] Sentiment Analysis in Twitter for Macedonian

Dame Jovanoski, Veno Pachovski|arXiv (Cornell University)|2021. 09. 27.
Sentiment Analysis and Opinion Mining참고 문헌 33인용 수 4
한 줄 요약

이 논문은 마케도니아어 트윗을 위한 최초의 감성 분석 시스템을 제시하며, 감성 극성(긍정, 부정, 중립)과 어절 수준의 감성에 대해 수작업으로 레이블링된 1,000건의 트윗으로 구성된 코퍼스와 부트스트랩된 감성 어휘집을 제공한다. 사전 처리 기법과 어휘 기반 특징을 조합한 결과, F1 스코어 92.16을 기록하여 SemEval 경연 대회에서 보고된 최고 수준의 영어 결과와 동등한 성능을 달성한다.

ABSTRACT

We present work on sentiment analysis in Twitter for Macedonian. As this is pioneering work for this combination of language and genre, we created suitable resources for training and evaluating a system for sentiment analysis of Macedonian tweets. In particular, we developed a corpus of tweets annotated with tweet-level sentiment polarity (positive, negative, and neutral), as well as with phrase-level sentiment, which we made freely available for research purposes. We further bootstrapped several large-scale sentiment lexicons for Macedonian, motivated by previous work for English. The impact of several different pre-processing steps as well as of various features is shown in experiments that represent the first attempt to build a system for sentiment analysis in Twitter for the morphologically rich Macedonian language. Overall, our experimental results show an F1-score of 92.16, which is very strong and is on par with the best results for English, which were achieved in recent SemEval competitions.

연구 동기 및 목표

  • 소셜 미디어 도메인, 특히 트위터에서 마케도니아어에 대한 감성 분석 자원의 부족을 해결하기 위해.
  • 트윗 수준 및 어절 수준의 감성 극성에 대해 수작업으로 레이블링된 고품질의 마케도니아어 트윗 코퍼스를 개발하기 위해.
  • 다국어 자료에서 유도된 부트스트랩 기법을 통해 대규모 다국어 감성 어휘집을 마케도니아어에 대해 구축하기 위해.
  • 다양한 사전 처리 단계와 특징 집합이 감성 분류 성능에 미치는 영향을 평가하기 위해.
  • 마케도니아어와 같이 자원이 적고 형태학적으로 복잡한 언어 분야의 향후 연구를 위한 강력한 베이스라인을 수립하기 위해.

제안 방법

  • 모국어 사용자들이 감성 극성(긍정, 부정, 중립)과 어절 수준의 감성에 대해 레이블링한 마케도니아어 트윗 1,000건으로 구성된 트위터 코퍼스를 구축하였다.
  • 수작업으로 정제된 어휘집과 다국어 자료에서 유도된 부트스트랩된 어휘집을 포함한 마케도니아어 감성 어휘집을 다수 개발하였다.
  • 정지어 제거, 부정 처리, 표준 마케도니아어로의 정규화, 문자 반복 처리, 어간 추출, 품사 태깅 등의 사전 처리 단계를 적용하였다.
  • 레이블링된 데이터로 훈련된 분류기와 함께 감성 어휘집, 단어 수, 언어학적 사전 처리에서 유도된 특징을 사용하는 기계학습 파이프라인을 구현하였다.
  • 긍정 및 부정 클래스에 대한 F1 스코어의 평균을 사용하여 시스템 성능을 평가하였으며, 중립 클래스는 암시적으로 고려하였다.
  • 비교적 실험 설계를 통해 개별 사전 처리 단계와 특징 집합이 분류 정확도에 미치는 영향을 분리하여 분석하였다.

실험 결과

연구 질문

  • RQ1정지어 제거, 부정 처리, 정규화 등의 다양한 사전 처리 기법이 마케도니아어 트윗의 감성 분류 성능에 미치는 영향은 무엇인가?
  • RQ2특히 부트스트랩된 어휘집과 수작업으로 정제된 어휘집을 포함한 어휘 기반 특징이 시스템 성능에 기여하는 정도는 어떠한가?
  • RQ3마케도니아어의 형태학적 풍부성이 감성 분석에서 표준 NLP 사전 처리 단계의 효과성에 어떤 영향을 미치는가?
  • RQ4제안된 시스템의 성능은 영어와 같은 고자원 언어의 최신 기술 수준 시스템과 비교해 볼 때 어떻게 평가될 수 있는가? 특히 트위터 감성 분석 맥락에서.
  • RQ5감성 어휘집과 언어학적 특징을 포함한 다양한 특징 집합이 최종 분류 F1 스코어에 기여하는 비율은 어느 정도인가?

주요 결과

  • 전체 시스템은 F1 스코어 92.16을 기록하였으며, 이는 최근 SemEval 경연에서 보고된 영어 최고 성능과 동등한 결과이다.
  • 정지어 제거를 생략할 경우 F1 스코어가 5.92점 감소하여 그 중요성이 뚜렷하다.
  • 부정 처리를 생략할 경우 F1 스코어가 4.65점 감소하여 그 영향력이 크다는 것을 확인하였다.
  • 표준 마케도니아어로의 정규화를 생략할 경우 성능이 1.94점 감소하여 형태학적 변형을 고려하는 데서 중요한 역할을 한다는 점을 입증하였다.
  • 어간 추출은 성능을 0.98점 향상시켰으며, 품사 태깅은 거의 영향을 주지 않아 F1 스코어가 단지 0.15점 감소에 그쳤다.
  • 부트스트랩된 감성 어휘집이 가장 큰 기여를 하였으며, 이를 생략할 경우 F1 스코어가 19.39점 감소하여 수작업으로 정제된 어휘집의 영향을 뛰어넘었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.