[논문 리뷰] Corpora Preparation and Stopword List Generation for Arabic data in Social Network
이 논문은 소셜 미디어에서 아랍어 코퍼스를 구축하고 Egyptians colloquial Arabic에 특화된 불용어 목록을 생성하기 위한 방법론을 제안하며, 기존의 현대 표준 아랍어(MSA) 기반 불용어 목록보다 당사자 기반 불용어 목록을 사용할 경우 정서 분석 성능이 향상됨을 입증한다. 나이브 베이즈 및 결정 트리 분류기로 수행한 실험 결과, MSA와 이집트 방언 불용어 목록을 병합한 경우가 MSA 전용 목록을 사용하는 것보다 분류 정확도가 높았다.
This paper proposes a methodology to prepare corpora in Arabic language from online social network (OSN) and review site for Sentiment Analysis (SA) task. The paper also proposes a methodology for generating a stopword list from the prepared corpora. The aim of the paper is to investigate the effect of removing stopwords on the SA task. The problem is that the stopwords lists generated before were on Modern Standard Arabic (MSA) which is not the common language used in OSN. We have generated a stopword list of Egyptian dialect and a corpus-based list to be used with the OSN corpora. We compare the efficiency of text classification when using the generated lists along with previously generated lists of MSA and combining the Egyptian dialect list with the MSA list. The text classification was performed using Naïve Bayes and Decision Tree classifiers and two feature selection approaches, unigrams and bigram. The experiments show that the general lists containing the Egyptian dialects words give better performance than using lists of MSA stopwords only.
연구 동기 및 목표
- 아랍 소셜 네트워크 텍스트가 주로 이집트 방언을 사용함에도 불구하고, 이를 고려하지 않은 기존의 MSA 기반 불용어 목록의 부족을 보완하기 위함.
- 정서 분석 작업에 적합한 아랍어 소셜 미디어 데이터를 위한 코퍼스 준비 파이프라인을 개발하기 위함.
- 실제 소셜 미디어 코퍼스에서 유래한 이집트 아랍어에 특화된 방언 기반 불용어 목록을 생성하기 위함.
- MSA, 이집트 방언, 병합된 목록 등 다양한 불용어 목록이 정서 분류 성능에 미치는 영향을 평가하기 위함.
- 다양한 분류기로 unigram 및 bigram 특징 선택의 효과를 비교하기 위함.
제안 방법
- 소셜 네트워크 및 리뷰 사이트에서 수집한 아랍어 소셜 미디어 데이터를 전처리하여 도메인 특화 코퍼스를 구성함.
- 이집트 방언 형태를 포함한 아랍어 방언에 특화된 텍스트 정규화 및 토큰화 기법을 적용함.
- 코퍼스에서 고빈도 기능어를 추출하여 이집트 아랍어 전용 방언 기반 불용어 목록을 구성함.
- 이집트 방언 목록과 기존의 MSA 불용어 목록을 병합하여 통합 불용어 목록을 생성함.
- unigram 및 bigram 특징을 사용하여 감성 레이블이 부여된 데이터로 나이브 베이즈 및 결정 트리 분류기를 훈련함.
- 정확도 지표를 사용하여 다양한 불용어 목록 설정 간의 분류 성능을 평가함.
실험 결과
연구 질문
- RQ1이집트 방언 아랍어에서 유도된 불용어 목록을 사용할 경우, 단순히 MSA 기반 불용어 목록을 사용하는 것보다 정서 분류 성능이 향상되는가?
- RQ2MSA와 이집트 방언 불용어 목록을 병합할 경우 아랍어 소셜 미디어 텍스트의 분류 정확도에 어떤 영향을 미치는가?
- RQ3다양한 불용어 목록을 사용할 때, 정서 분류 성능은 특징 표현 방식(uni-gram 대비 bi-gram)의 선택에 따라 달라지는가?
- RQ4소셜 미디어 데이터에서 유도된 코퍼스 기반 불용어 목록이 기존의 MSA 기반 불용어 목록보다 정서 분석 작업에서 더 우수한 성능을 보일 수 있는가?
주요 결과
- 이집트 아랍어에 특화된 방언 기반 불용어 목록을 사용할 경우, 단순히 MSA 기반 불용어 목록을 사용하는 것보다 정서 분류 정확도가 뚜렷이 향상됨.
- 이집트 방언 불용어 목록과 MSA 목록을 병합한 경우, 각각의 목록을 별도로 사용하는 것보다 더 높은 성능을 기록함.
- 이러한 향상은 나이브 베이즈 및 결정 트리 분류기 모두에서 일관되게 관찰되어, 이 방법론의 강건성을 입증함.
- 일반적으로 bigram 특징 사용이 성능 향상에 기여했지만, MSA와 이집트 방언 불용어 목록을 병합한 경우 그 효과가 가장 두드러짐.
- 소셜 미디어 데이터에서 유도된 이집트 아랍어 코퍼스 기반 불용어 목록이 기존의 MSA 기반 목록보다 더 효과적이었으며, 이는 소셜 미디어 NLP에서 방언 기반 사전 처리의 중요성을 강조함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.