Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment Analysis for Sinhala Language using Deep Learning Techniques

Lahiru Senevirathne, Piyumal Demotte|arXiv (Cornell University)|Nov 14, 2020
Sentiment Analysis and Opinion Mining参考文献 29被引用数 11
ひとこと要約

本稿では、RNN、LSTM、Bi-LSTM、階層的アテンションネットワーク、キャプセルネットワークを含む深層学習モデルを用いて、低リソースな僧伽語(Sinhala)におけるマルチクラスセンチメント分析について包括的な研究を提示する。本研究では、4つのクラス(POSITIVE、NEGATIVE、NEUTRAL、CONFLICT)にラベル付けされた15,059件のコメントを含む、公開可能な最大の僧伽語センチメントデータセットを紹介し、10-fold交差検証を用いたキャプセル-Bアーキテクチャで最高の重み付きF1スコア59.11%を達成した。

ABSTRACT

Due to the high impact of the fast-evolving fields of machine learning and deep learning, Natural Language Processing (NLP) tasks have further obtained comprehensive performances for highly resourced languages such as English and Chinese. However Sinhala, which is an under-resourced language with a rich morphology, has not experienced these advancements. For sentiment analysis, there exists only two previous research with deep learning approaches, which focused only on document-level sentiment analysis for the binary case. They experimented with only three types of deep learning models. In contrast, this paper presents a much comprehensive study on the use of standard sequence models such as RNN, LSTM, Bi-LSTM, as well as more recent state-of-the-art models such as hierarchical attention hybrid neural networks, and capsule networks. Classification is done at document-level but with more granularity by considering POSITIVE, NEGATIVE, NEUTRAL, and CONFLICT classes. A data set of 15059 Sinhala news comments, annotated with these four classes and a corpus consists of 9.48 million tokens are publicly released. This is the largest sentiment annotated data set for Sinhala so far.

研究の動機と目的

  • 僧伽語のセンチメント分析において、特に二値分類を超えた大規模でマルチクラスのアノテート済みデータセットが不足しているという問題に対処すること。
  • 標準的なRNNから最先端のキャプセルネットワークに至るまで、広範な深層学習アーキテクチャの文書レベルのセンチメント分類における性能を検証すること。
  • 語彙的に豊富な言語である僧伽語のような低リソースNLPタスクにおいて、言語に依存しない単語埋め込み(Word2Vec、fastText)の有効性を調査すること。
  • 将来的な僧伽語NLP研究を支援するため、公開可能なコードベース、事前学習済み埋め込み、および大規模なアノテート済みデータセットを提供すること。

提案手法

  • GossipLankaとLankadeepaの2つのオンライン新聞から、15,059件の僧伽語ニュースコメントを収集し、POSITIVE、NEGATIVE、NEUTRAL、CONFLICTの4つのセンチメントクラスにラベル付けした新しいデータセットを構築した。
  • モデル学習前のノイズ低減のため、トークン化、正規化、非僧伽語文字の削除を含むテキスト前処理を実施した。
  • 948万トークンのアノテート済みでないコーパスを用いて、Word2VecおよびfastTextによる事前学習済み単語埋め込みを採用し、表現学習を向上させた。
  • RNN、LSTM、GRU、Bi-LSTM、スタックドバージョン、CNN+GRU/LSTM/BiLSTM、HAHNN、およびキャプセルネットワーク(capsule-Aおよびcapsule-B)を含む複数の深層学習モデルを訓練・比較した。
  • モデル性能の評価に10-fold交差検証とホールアウト検証を適用し、主な指標として重み付き精度とF1スコアを用いた。
  • HAHNNではアテンション機構を、キャプセルネットワークではポーズ共変性ルーティングを採用し、テキスト内の階層的および構造的依存関係をよりよく捉えるようにした。

実験結果

リサーチクエスチョン

  • RQ1低リソースで語彙的に豊富な言語(例:僧伽語)におけるマルチクラスセンチメント分類において、どの深層学習アーキテクチャが最も優れた性能を示すか?
  • RQ2NEUTRALおよびCONFLICTを含むマルチクラスのセンチメントラベルの導入は、二値分類と比較して、感情分析の粒度と現実性をどのように向上させるか?
  • RQ3言語に依存しない単語埋め込み(Word2Vec、fastText)は、僧伽語のような低リソースNLPタスクにおいて、どの程度性能を向上させるか?
  • RQ4アテンション機構とキャプセルネットワークは、僧伽語のテキストにおける長距離依存関係や感情の構成的性質を、どのようにモデル化できるか?
  • RQ5僧伽語センチメント分類における主な誤分類要因は何か。また、それらはクラス不均衡や言語的複雑さとどのように関連しているか?

主な発見

  • キャプセル-Bモデルが10-fold交差検証下で最高の性能を示し、重み付きF1スコア59.11%、重み付き精度63.23%を達成した。
  • Bi-LSTMおよびスタックドBi-LSTMモデルが、標準的なRNNやLSTMを上回った。これは、僧伽語における双方向的文脈モデリングの利点を示している。
  • HAHNNモデルは重み付きF1スコア59.25%を達成し、階層的アテンション機構が文と語のレベルのセンチメントサインを効果的にモデル化できることを示した。
  • 特にキャプセル-Bが、RNNや基本的なLSTMよりも優れた性能を示した。これは、低リソース言語における複雑な句構造的および意味的関係をモデル化するキャプセルネットワークの潜在的可能性を示唆している。
  • 混同行列の結果、NEUTRALおよびCONFLICTクラスが主にNEGATIVEに誤分類されていることが判明した。これは、主にクラス不均衡と混合感情表現の存在に起因していた。
  • 全体的な性能は低かったが、本研究は深層学習モデルの明確なベンチマークと比較分析を提供し、僧伽語センチメント分類においてキャプセル-BおよびスタックドBi-LSTMが最も優れた性能を示すことが同定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。