Skip to main content
QUICK REVIEW

[논문 리뷰] Pars-ABSA: an Aspect-based Sentiment Analysis dataset for Persian

Taha Shangipour ataei, Kamyar Darvishi|arXiv (Cornell University)|2019. 07. 26.
Sentiment Analysis and Opinion Mining참고 문헌 20인용 수 9
한 줄 요약

이 논문은 10,004건의 리뷰(양성 5,114건, 음성 3,061건, 중립 1,827건)를 포함하는 수작업로 코딩된 페르시아어 기반의 감성 분석 데이터셋인 Pars-ABSA를 소개한다. 이 데이터셋은 5,602건의 고유 리뷰에서 유래했으며, 세 명의 모국어 페르시아어 사용자가 검토하여 품질을 확보했다. 이 데이터셋을 바탕으로 최신 딥러닝 모델의 기준 성능을 수립하였으며, 유사한 영어 기반 모델들과 비교해도 경쟁 가능한 성능을 기록하였다.

ABSTRACT

Due to the increased availability of online reviews, sentiment analysis had been witnessed a booming interest from the researchers. Sentiment analysis is a computational treatment of sentiment used to extract and understand the opinions of authors. While many systems were built to predict the sentiment of a document or a sentence, many others provide the necessary detail on various aspects of the entity (i.e. aspect-based sentiment analysis). Most of the available data resources were tailored to English and the other popular European languages. Although Persian is a language with more than 110 million speakers, to the best of our knowledge, there is a lack of public dataset on aspect-based sentiment analysis for Persian. This paper provides a manually annotated Persian dataset, Pars-ABSA, which is verified by 3 native Persian speakers. The dataset consists of 5,114 positive, 3,061 negative and 1,827 neutral data samples from 5,602 unique reviews. Moreover, as a baseline, this paper reports the performance of some state-of-the-art aspect-based sentiment analysis methods with a focus on deep learning, on Pars-ABSA. The obtained results are impressive compared to similar English state-of-the-art.

연구 동기 및 목표

  • 110만 명 이상이 사용하는 언어인 페르시아어에 대해 공개된 감성 분석 데이터셋의 부족을 해결하기 위해.
  • 언어적 정확성과 신뢰성을 확보한 고품질의 수작업 애너테이션된 페르시아어 기반 감성 분석 데이터셋을 구축하기 위해.
  • 페르시아어와 같이 자원이 적고 유럽어계가 아닌 언어에 대해 최신 딥러닝 모델을 평가하기 위한 기준을 제공하기 위해.
  • 표준화되고 검증된 데이터셋을 공개함으로써 향후 저자원, 비영어 기반 감성 분석 연구를 가능하게 하기 위해.

제안 방법

  • 품질과 일관성을 확보하기 위해 세 명의 모국어 페르시아어 사용자가 5,602건의 고유한 페르시아어 리뷰를 수작업으로 애너테이션하여 데이터셋을 구축하였다.
  • 표준화된 애너테이션 체계를 사용하여 각 리뷰의 요소어(아이템)와 그에 해당하는 감성 극성(양성, 음성, 중립)을 애너테이션하였다.
  • 최종 데이터셋은 세 가지 감성 클래스에 걸쳐 총 10,004개의 애너테이션 샘플을 포함하며, 요소어와 감성 유형 간 균형 잡힌 표현을 보였다.
  • 최신 딥러닝 아키텍처를 기반으로 한 기준 모델을 Pars-ABSA 데이터셋에 맞추어 미세조정하고 평가하였다.
  • 테스트 세트에서 모델 성능을 평가하기 위해 F1 점수, 정밀도, 재현율 등의 평가 지표를 사용하였다.
  • 애너테이션 과정에서 이면자 간 일치도 검사를 포함하여 레이블링의 신뢰성과 주관성을 줄였다.

실험 결과

연구 질문

  • RQ1기존 최신 딥러닝 모델이 저자원, 비영어 언어인 페르시아어에 적용되었을 때 얼마나 효과적인가?
  • RQ2수작업으로 애너테이션된 페르시아어 데이터셋의 품질과 구조가 감성 분석 모델 성능에 얼마나 영향을 미치는가?
  • RQ3제안된 Pars-ABSA 데이터셋이 향후 페르시아어 NLP 및 감성 분석 연구의 신뢰할 수 있는 기준이 될 수 있는가?
  • RQ4Pars-ABSA에서의 모델 성능은 비슷한 영어 기반 데이터셋에서의 성능과 비교해 볼 때 어떻게 다른가?

주요 결과

  • Pars-ABSA 데이터셋은 5,602건의 고유한 페르시아어 리뷰에서 유래한 10,004개의 고품질 수작업 애너테이션 샘플을 포함하며, 양성 5,114건, 음성 3,061건, 중립 1,827건의 감성 인스턴스를 포함한다.
  • 세 명의 모국어 페르시아어 사용자가 검토하여 높은 이면자 간 일치도와 언어적 정확성을 확보하였다.
  • 기준 딥러닝 모델은 Pars-ABSA에서 경쟁 가능한 성능을 기록하였으며, 적절한 미세조정을 통해 최신 기술이 페르시아어에 효과적으로 일반화됨을 보여주었다.
  • 결과는 제안된 데이터셋이 저자원 환경에서 감성 분석 모델의 훈련 및 평가에 적합하다는 것을 시사한다.
  • Pars-ABSA에서의 모델 성능은 영어 기반 기준 데이터셋에서의 유사 모델 성능과 유사하여, 데이터셋의 신뢰성과 유용성을 시사한다.
  • Pars-ABSA의 가용성은 향후 페르시아어 NLP 및 감성 분석 연구, 특히 저자원 및 비유럽어 언어 환경에서의 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.