Skip to main content
QUICK REVIEW

[논문 리뷰] Sentiment Analysis of Persian Language: Review of Algorithms, Approaches and Datasets

Ali Nazarizadeh, Touraj Banirostam|arXiv (Cornell University)|2022. 11. 09.
Sentiment Analysis and Opinion Mining인용 수 7
한 줄 요약

이 종합 논문은 2018–2022년 사이에 발표된 40개의 최신 감성 분석 접근법을 종합적으로 분석하며, 페르시아어 텍스트에 대해 기계 학습 및 딥 러닝 모델(예: BERT, LSTM, Bi-LSTM)을 12개의 벤치마크 데이터셋에서 평가한다. 트랜스포머 기반 모델인 BERT와 RNN 유형인 Bi-LSTM가 가장 높은 정확도를 보이며, 페르시아어 NLP 연구를 위한 방법, 데이터셋, 성능 메트릭에 대한 종합적인 분석을 제공한다.

ABSTRACT

Sentiment analysis aims to extract people's emotions and opinion from their comments on the web. It widely used in businesses to detect sentiment in social data, gauge brand reputation, and understand customers. Most of articles in this area have concentrated on the English language whereas there are limited resources for Persian language. In this review paper, recent published articles between 2018 and 2022 in sentiment analysis in Persian Language have been collected and their methods, approach and dataset will be explained and analyzed. Almost all the methods used to solve sentiment analysis are machine learning and deep learning. The purpose of this paper is to examine 40 different approach sentiment analysis in the Persian Language, analysis datasets along with the accuracy of the algorithms applied to them and also review strengths and weaknesses of each. Among all the methods, transformers such as BERT and RNN Neural Networks such as LSTM and Bi-LSTM have achieved higher accuracy in the sentiment analysis. In addition to the methods and approaches, the datasets reviewed are listed between 2018 and 2022 and information about each dataset and its details are provided.

연구 동기 및 목표

  • 2018년부터 2022년까지 페르시아어 감성 분석 분야의 최근 발전을 체계적으로 검토하고 분석하는 것.
  • 페르시아어 텍스트에서 다양한 기계 학습 및 딥 러닝 알고리즘의 성능을 평가하는 것.
  • 페르시아어 감성 분석을 위한 공개된 데이터셋을 체계적으로 정리하고 비교하는 것.
  • 연구들 간의 방법론 및 데이터 정제 전략에서의 강점, 약점 및 추세를 규명하는 것.
  • 특히 페르시아어를 포함한 저자원 언어 감성 분석 분야의 향후 연구를 위한 기준 틀을 제공하는 것.

제안 방법

  • 2018년부터 2022년까지 발표된 40篇의 페르시아어 감성 분석 분야의 동료 심사 논문을 체계적으로 검토한다.
  • 모델을 기계 학습 및 딥 러닝 파라다임으로 분류하며, 특히 트랜스포머 모델(BERT 등)과 순환 신경망(LSTM, Bi-LSTM 등)에 중점을 둔다.
  • 데이터셋은 크기, 출처, 주석 품질, 도메인 특이성 기준으로 분석한다.
  • 정확도, 정밀도, 재현율, F1 점수 등 성능 메트릭을 추출하여 각 모델 간 비교 분석을 수행한다.
  • 각 연구에서 사용된 모델 아키텍처, 전처리 기법, 데이터 증강 전략을 평가한다.
  • 가장 효과적인 알고리즘과 데이터셋 특성 파악을 위해 비교 분석을 수행한다.

실험 결과

연구 질문

  • RQ12018년부터 2022년까지 페르시아어 감성 분석 작업에서 어떤 기계 학습 및 딥 러닝 모델이 가장 높은 정확도를 달성했는가?
  • RQ2BERT와 같은 트랜스포머 기반 모델과 LSTM, Bi-LSTM와 같은 RNN 기반 모델 간에 페르시아어 텍스트에서 성능 측면에서 어떻게 비교되는가?
  • RQ32018년부터 2022년까지 공개된 페르시아어 감성 분석 데이터셋의 주요 특성과 한계는 무엇인가?
  • RQ4페르시아어 감성 분석 연구에서 가장 흔히 사용되는 전처리 및 특징 공학 기법은 무엇인가?
  • RQ5현재 페르시아어 NLP 분야, 특히 감성 분석 분야에서의 연구 환경에서 나타나는 주요 추세와 격차는 무엇인가?

주요 결과

  • 트랜스포머 기반 모델, 특히 BERT가 페르시아어 텍스트에서 감성 분류 작업에서 가장 높은 정확도를 기록했다.
  • 순환 신경망, 특히 Bi-LSTM가 강력한 성능을 보이며 상위 성능 모델 중 하나로 나타났다.
  • 2018년부터 2022년 사이에 12개의 별도된 페르시아어 감성 분석 데이터셋을 식별하였으며, 크기와 도메인 커버리지에서 다양성을 보였다.
  • 대부분의 연구가 수동 주석이 부여된 데이터셋을 기반으로 한 지도 학습에 의존하여 인간 주석 데이터에 대한 의존도가 높음을 시사했다.
  • 진전이 있었음에도 불구하고, 대규모, 다양한 종류의, 공개 가능한 페르시아어 감성 분석 데이터셋이 여전히 부족한 상황이다.
  • 이 리뷰는 딥 러닝 모델, 특히 미세조정된 사전 학습된 트랜스포머를 활용한 추세가 끊임없이 지속되고 있음을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.