Skip to main content
QUICK REVIEW

[논문 리뷰] Opinion mining of text documents written in Macedonian language

Andrej Gajduk, Ljupčo Kocarev|arXiv (Cornell University)|2014. 11. 17.
Sentiment Analysis and Opinion Mining참고 문헌 32인용 수 4
한 줄 요약

이 논문은 마케도니아어 포럼 게시물의 의견 탐지에 대해 기계학습 기반 접근법을 제안하며, unigram frequency-inverse document frequency (tf-idf) 특징과 지지벡터기계(SVM)를 사용하여 감성을 긍정, 부정, 객관적 중 하나로 분류한다. 전체 정확도 92%를 달성하여 자동화된 의견 탐지가 마케도니아어 텍스트에서 인간 수준의 성능을 달성할 수 있음을 보여주며, 어순 분석 및 불용어 제거와 같은 사전 처리 과정은 언어 특성상 정확도를 떨어뜨리는 경향이 있다.

ABSTRACT

The ability to extract public opinion from web portals such as review sites, social networks and blogs will enable companies and individuals to form a view, an attitude and make decisions without having to do lengthy and costly researches and surveys. In this paper machine learning techniques are used for determining the polarity of forum posts on kajgana which are written in Macedonian language. The posts are classified as being positive, negative or neutral. We test different feature metrics and classifiers and provide detailed evaluation of their participation in improving the overall performance on a manually generated dataset. By achieving 92% accuracy, we show that the performance of systems for automated opinion mining is comparable to a human evaluator, thus making it a viable option for text data analysis. Finally, we present a few statistics derived from the forum posts using the developed system.

연구 동기 및 목표

  • 마케도니아어 포럼 게시물의 공개 의견을 긍정, 부정, 객관적 중 하나로 자동 분류하는 시스템을 개발하는 것.
  • 마케도니아어 감성 분류에 있어 다양한 특징 표현 방식과 분류기의 효과성을 평가하는 것.
  • 불용어 제거 및 어간 추출과 같은 텍스트 사전 처리 기법이 저자원 NLP 환경에서 분류 성능에 미치는 영향을 조사하는 것.
  • 자동화된 의견 탐지 시스템이 마케도니아어 텍스트에서 인간 평가 수준의 정확도를 달성할 수 있음을 입증하는 것.

제안 방법

  • 텍스트 데이터는 네 가지 특징 메트릭을 사용하여 표현된다: n-gram 존재, 카운트, 빈도, 및 빈도-역문서빈도제거(tf-idf).
  • 연구는 두 가지 분류기인 지지벡터기계(SVM)와 나이브 베이즈(NB)를 사용하며, 10겹 교차검증을 통해 평가된다.
  • 특징 사전은 유니그램과 바이그램에서 구축되며, 최적의 성능을 위해 유니그램 기반 표현에 중점을 둔다.
  • 의미적 맥락에 민감한 표현 탐지 향상을 위해 규칙 기반 바이그램(예: 부정 및 강조 패턴)을 테스트한다.
  • 사전 처리 단계로는 불용어 필터링과 어간 추출이 포함되며, 이들의 영향은 경험적으로 평가된다.
  • 시스템은 먼저 주관성 분류를 수행한 후, 주관적인 게시물에 대해 극성 분류(긍정/부정)를 수행한다.

실험 결과

연구 질문

  • RQ1마케도니아어 감성 분류에 있어 최적의 특징 표현 방식과 분류기 조합은 무엇인가?
  • RQ2어간 추출 및 불용어 제거와 같은 일반적인 사전 처리 기법이 마케도니아어 의견 탐지에서 성능에 어떤 영향을 미치는가?
  • RQ3특히 규칙 기반 바이그램을 포함한 바이그램은 얼마나 감성 분류 정확도를 향상시키는가?
  • RQ4자동화된 의견 탐지 시스템이 마케도니아어 텍스트에서 인간 평가 수준의 정확도를 달성할 수 있는가?

주요 결과

  • tf-idf 특징 표현 방식과 SVM 분류기를 조합하여 전체 정확도 92%를 달성하였으며, 이는 인간 평가 수준의 성능과 유사함을 보여준다.
  • 모든 특징 표현 방식에서 SVM가 나이브 베이즈를 앞서며, 특히 tf-idf 표현 방식에서 최고의 성능을 보였다(주관성 분류 94%, 극성 분류 96%).
  • 어간 추출 및 불용어 제거와 같은 사전 처리 단계는 정확도를 떨어뜨렸으며, 마케도니아어 언어 특성상 어간 추출 알고리즘이 잘 작동하지 않기 때문일 것이다.
  • 단독으로 바이그램을 사용한 경우 성능이 열악했지만, 유니그램과 바이그램을 조합하면 정확도가 약간 향상되었으며, 특히 존재 기반 특징에서 최대 79%까지 상승(예: SVM 기준).
  • 규칙 기반 바이그램(예: 부정 패턴)은 영향이 미미했으며, 존재 기반 특징 사용 시 정확도가 약간 향상되어 SVM 기준 76%에서 78%로 상승하였다.
  • 공공 여론 분석 결과, 음식과 패션 주제는 가장 긍정적인 분위기를 유도하는 반면, 세계사건 및 경제 주제는 가장 부정적인 감성 반응을 유도하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.