Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment Analysis of Persian Language: Review of Algorithms, Approaches and Datasets

Ali Nazarizadeh, Touraj Banirostam|arXiv (Cornell University)|Nov 9, 2022
Sentiment Analysis and Opinion Mining被引用数 7
ひとこと要約

このレビュー論文は、2018年から2022年までの40件の最近のペルシャ語センチメント分析手法を統合し、12のベンチマークデータセットを用いて機械学習およびディープラーニングモデル(Bert、LSTM、Bi-LSTMを含む)の性能を評価している。トランスフォーマーに基づくモデル(例:Bert)とRNNの変種(例:Bi-LSTM)が最も高い正確性を示しており、ペルシャ語NLP研究における手法、データセット、性能指標について包括的な分析がなされている。

ABSTRACT

Sentiment analysis aims to extract people's emotions and opinion from their comments on the web. It widely used in businesses to detect sentiment in social data, gauge brand reputation, and understand customers. Most of articles in this area have concentrated on the English language whereas there are limited resources for Persian language. In this review paper, recent published articles between 2018 and 2022 in sentiment analysis in Persian Language have been collected and their methods, approach and dataset will be explained and analyzed. Almost all the methods used to solve sentiment analysis are machine learning and deep learning. The purpose of this paper is to examine 40 different approach sentiment analysis in the Persian Language, analysis datasets along with the accuracy of the algorithms applied to them and also review strengths and weaknesses of each. Among all the methods, transformers such as BERT and RNN Neural Networks such as LSTM and Bi-LSTM have achieved higher accuracy in the sentiment analysis. In addition to the methods and approaches, the datasets reviewed are listed between 2018 and 2022 and information about each dataset and its details are provided.

研究の動機と目的

  • 2018年から2022年までのペルシャ語センチメント分析分野における最近の進展を体系的にレビューおよび分析すること。
  • ペルシャ語テキスト上で、さまざまな機械学習およびディープラーニングアルゴリズムの性能を評価すること。
  • 利用可能な公開データセットをリスト化し、それらを比較すること。
  • 研究間での手法とデータキュレーションにおける強み、弱み、トレンドを特定すること。
  • とりわけペルシャ語のような低リソース言語のセンチメント分析分野における今後の研究のための基盤フレームワークを提供すること。

提案手法

  • 本研究は、2018年から2022年までの間に発表された40編のペルシャ語センチメント分析に関する査読付き論文を体系的にレビューした。
  • 手法は機械学習とディープラーニングのパラダイムに分類され、特にトランスフォーマー・モデル(例:Bert)と再帰的ネットワーク(例:LSTM、Bi-LSTM)に焦点を当てた。
  • データセットは、サイズ、出典、アノテーション品質、ドメイン固有性に基づいて分析された。
  • 性能指標として、正確性、適合率、再現率、F1スコアが抽出され、モデル間で比較された。
  • 各研究で用いられたモデルアーキテクチャ、前処理技術、データ拡張戦略が評価された。
  • 最も効果的なアルゴリズムおよびデータセットの特徴を特定するために、比較分析が実施された。

実験結果

リサーチクエスチョン

  • RQ12018年から2022年までのペルシャ語センチメント分析タスクにおいて、どの機械学習およびディープラーニングモデルが最も高い正確性を達成したか?
  • RQ2Bertのようなトランスフォーマー基盤モデルは、LSTM や Bi-LSTM などのRNN基盤モデルと比較して、ペルシャ語テキスト処理においてどの程度の性能を示したか?
  • RQ32018年から2022年までの間に公開されたペルシャ語センチメント分析データセットの主な特徴と制限とは何か?
  • RQ4ペルシャ語センチメント分析研究で一般的に用いられている前処理および特徴工学の技術は何か?
  • RQ5現在のペルシャ語NLP研究の動向とギャップ、とりわけセンチメント分析分野においては何か?

主な発見

  • トランスフォーマー基盤モデル(例:Bert)が、ペルシャ語テキストにおけるセンチメント分類タスクで最も高い正確性を達成した。
  • 再帰的ニューラルネットワーク(特にBi-LSTM)は強力な性能を示し、上位にランクされたモデルの一つであった。
  • 2018年から2022年の間に12の異なるペルシャ語センチメント分析データセットが同定され、サイズやドメインカバレッジにばらつきがあった。
  • 多くの研究が、手動でアノテートされたデータセットに依存する教師あり学習に依存しており、人為的アノテーションデータへの依存が顕著であった。
  • 進展は見られたが、依然として大規模で多様性に富み、公開可能なペルシャ語センチメント分析データセットが不足している。
  • 本レビューでは、特にファインチューニングされた事前学習済みトランスフォーマーを用いる傾向が一貫して見られ、性能向上に寄与していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。