Skip to main content
QUICK REVIEW

[論文レビュー] Corpora Preparation and Stopword List Generation for Arabic data in Social Network

Walaa Medhat, Ahmed H. Yousef|arXiv (Cornell University)|Oct 5, 2014
Sentiment Analysis and Opinion Mining参考文献 22被引用数 5
ひとこと要約

本稿では、ソーシャルメディアからアラビア語コーパスを構築する手法と、エジプト・コロケーションのための方言特化ストップワードリストの生成を提案し、伝統的な現代標準アラビア語(MSA)用リストよりも、方言ベースのストップワードリストを用いることで感情分析のパフォーランスが向上することを実証している。ナイーブベイズおよび意思決定木分類器を用いた実験では、MSAとエジプト方言のストップワードリストを併用することで、MSA専用リストを使用する場合よりも分類精度が向上することが示された。

ABSTRACT

This paper proposes a methodology to prepare corpora in Arabic language from online social network (OSN) and review site for Sentiment Analysis (SA) task. The paper also proposes a methodology for generating a stopword list from the prepared corpora. The aim of the paper is to investigate the effect of removing stopwords on the SA task. The problem is that the stopwords lists generated before were on Modern Standard Arabic (MSA) which is not the common language used in OSN. We have generated a stopword list of Egyptian dialect and a corpus-based list to be used with the OSN corpora. We compare the efficiency of text classification when using the generated lists along with previously generated lists of MSA and combining the Egyptian dialect list with the MSA list. The text classification was performed using Naïve Bayes and Decision Tree classifiers and two feature selection approaches, unigrams and bigram. The experiments show that the general lists containing the Egyptian dialects words give better performance than using lists of MSA stopwords only.

研究の動機と目的

  • アラビア語ソーシャルネットワークのテキストが主にエジプト方言を用いているのに対し、それらのテキストに特化したストップワードリストの不足を埋めるため。
  • 感情分析タスクに適した、アラビア語ソーシャルメディアデータ用のコーパス準備パイプラインを開発するため。
  • 実際のソーシャルメディアコーパスから抽出したエジプトアラビア語のための方言特化ストップワードリストを生成するため。
  • MSA、エジプト方言、および併合されたストップワードリストの違いが、感情分類パフォーマンスに与える影響を評価するため。
  • 複数の分類器を用いて、ユニグラムとバイグラムの特徴選択の有効性を、さまざまなストップワードセットと比較するため。

提案手法

  • オンラインのソーシャルネットワークおよびレビューサイトからアラビア語ソーシャルメディアデータを収集・前処理し、ドメイン特化コーパスを構築した。
  • エジプト口語形態を含む、アラビア語方言に特化したテキスト正規化およびトークン化手法を適用した。
  • コーパスから高頻度の機能語を抽出し、エジプトアラビア語に特化したストップワードリストを構築した。
  • エジプト方言ストップワードリストと既存のMSAストップワードリストを統合して、併合ストップワードリストを生成した。
  • ユニグラムおよびバイグラム特徴を用いて、感情ラベル付きデータに対してナイーブベイズおよび意思決定木分類器を学習させた。
  • 分類パフォーランスを正解率指標を用いて評価し、さまざまなストップワードリスト設定の結果を比較した。

実験結果

リサーチクエスチョン

  • RQ1エジプト方言アラビア語由来のストップワードリストを用いることで、MSAベースのストップワードリストのみを使用する場合と比較して、感情分類パフォーマンスが向上するか?
  • RQ2MSAとエジプト方言ストップワードリストを併用することで、アラビア語ソーシャルメディアテキストの分類精度にどのような影響を与えるか?
  • RQ3異なるストップワードリストを用いる場合、特徴表現(ユニグラム対バイグラム)の選択が、感情分類パフォーマンスに与える依存性は何か?
  • RQ4ソーシャルメディアデータから抽出したコーパスベースのストップワードリストは、従来のMSAベースのストップワードリストを上回る性能を示せるか?

主な発見

  • エジプトアラビア語に特化したストップワードリストの使用は、MSAベースのストップワードリストのみを使用する場合と比較して、感情分類の正解率を顕著に向上させた。
  • エジプト方言ストップワードリストとMSAリストを併用することで、単独で使用する場合よりも優れたパフォーマンスが得られた。
  • この向上効果は、ナイーブベイズおよび意思決定木分類器の両方で一貫して観察され、本手法の堅牢性を示している。
  • バイグラム特徴の使用は一般的にパフォーマンスを向上させたが、特にMSAとエジプト方言ストップワードリストを併用した場合にその恩恵が顕著に現れた。
  • エジプトアラビア語用のコーパスベースのストップワードリストは、既存のMSAベースのリストを上回る有効性を示しており、ソーシャルメディアNLPにおける方言特化前処理の重要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。