[論文レビュー] Opinion mining of text documents written in Macedonian language
本稿では、マケドニア語のフォーラム投稿における意見抽出のための機械学習的手法を提案する。tf-idf特徴量とサポートベクターマシン(SVM)を用いて、肯定的、否定的、客観的の3つの感情分類を実施。92%の全体精度を達成し、自動化された意見抽出がマケドニア語テキストにおいて人間水準の性能に達することを示した。一方、語幹取り出しやストップワード除去といった前処理は、言語固有の課題のため精度を低下させる要因となった。
The ability to extract public opinion from web portals such as review sites, social networks and blogs will enable companies and individuals to form a view, an attitude and make decisions without having to do lengthy and costly researches and surveys. In this paper machine learning techniques are used for determining the polarity of forum posts on kajgana which are written in Macedonian language. The posts are classified as being positive, negative or neutral. We test different feature metrics and classifiers and provide detailed evaluation of their participation in improving the overall performance on a manually generated dataset. By achieving 92% accuracy, we show that the performance of systems for automated opinion mining is comparable to a human evaluator, thus making it a viable option for text data analysis. Finally, we present a few statistics derived from the forum posts using the developed system.
研究の動機と目的
- マケドニア語のフォーラム投稿における公的意見を、肯定的、否定的、または客観的として分類する自動システムの開発。
- マケドニア語における感情分類において、さまざまな特徴表現と分類器の有効性を評価すること。
- ストップワード除去や語幹取り出しといったテキスト前処理技術が、低リソースNLP環境下での分類性能に与える影響を調査すること。
- 自動化された意見抽出が、マケドニア語テキストにおいて人間の評価と同等の精度に達することを実証し、大規模な公的意見分析を可能にすること。
提案手法
- テキストデータは4つの特徴量指標で表現される:n-gramの存在、カウント、頻度、および頻度逆文書頻度(tf-idf)。
- 2つの分類器(サポートベクターマシン(SVM)とナイーブベイズ(NB))を用い、10分割交差検証で評価した。
- 特徴語彙は単語形(unigram)と二語連接(bigram)から構築され、最適なパフォーマンスを得るために単語形ベースの表現に焦点を当てた。
- 文脈に敏感な表現の検出を向上させるために、規則に基づく二語連接(例:否定や強調のパターン)をテストした。
- ストップワードフィルタリングと語幹取り出しといった前処理ステップを実施したが、その影響は実証的に評価された。
- まず主題性分類を実施し、その後、主題的な投稿に対して感情極性分類(肯定的/否定的)を実施した。
実験結果
リサーチクエスチョン
- RQ1マケドニア語における感情分類において、最適な特徴表現と分類器の組み合わせは何か?
- RQ2語幹取り出しやストップワード除去といった一般的な前処理技術は、マケドニア語の意見抽出にどのように影響を与えるか?
- RQ3特に規則に基づく二語連接は、感情分類の精度をどの程度向上させるか?
- RQ4自動化された意見抽出システムは、マケドニア語テキストにおいて人間の評価と同等の精度に達することができるか?
主な発見
- tf-idf特徴量表現とSVM分類器を組み合わせた場合、92%の最高全体精度を達成し、人間評価と同等の強力なパフォーマンスを示した。
- SVMは全特徴量表現においてナイーブベイズを上回り、特にtf-idfが最良の結果(主題性分類で94%、極性分類で96%)をもたらした。
- 語幹取り出しやストップワード除去といった前処理は、マケドニア語における語幹取り出しアルゴリズムの性能が低いことが原因で、精度を低下させた。
- 二語連接単体では性能が低かったが、単語形と組み合わせることでわずかに精度が向上し、特に存在ベースの特徴量ではSVMで最大79%の精度を記録した。
- 規則に基づく二語連接(例:否定パターン)はほとんど影響がなく、存在ベースの特徴量を用いた場合、SVMでわずかに精度が向上(76%から78%に)したにとどまった。
- 公的意見分析の結果、食事やファッションといったトピックは肯定的な感情を最も引き出す一方、国際的問題や経済分野は否定的な感情を最も引き出す傾向が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。