Skip to main content
QUICK REVIEW

[論文レビュー] Robust Sentiment Analysis for Low Resource languages Using Data Augmentation Approaches: A Case Study in Marathi

Aabha Pingle, Aditya Vyawahare|arXiv (Cornell University)|Oct 1, 2023
Sentiment Analysis and Opinion MiningComputer Science被引用数 3
ひとこと要約

本稿では、自然言語処理における低資源言語、特にマーラチ語の感情分析の性能向上を目的として、4つのデータ拡張技術—言い換え、バックトランスレーション、BERTベースのトークン置換(固有表現およびランダムマスキングを含む)、GPTベースのテキスト/ラベル生成—を提案する。これらの手法により顕著な性能向上が達成され、GPTベースのラベル生成手法はドメイン内MahaSentデータセットで84.35%の正確性に達し、ドメイン間での頑健性と一般化性能が向上していることを示している。

ABSTRACT

Sentiment analysis plays a crucial role in understanding the sentiment expressed in text data. While sentiment analysis research has been extensively conducted in English and other Western languages, there exists a significant gap in research efforts for sentiment analysis in low-resource languages. Limited resources, including datasets and NLP research, hinder the progress in this area. In this work, we present an exhaustive study of data augmentation approaches for the low-resource Indic language Marathi. Although domain-specific datasets for sentiment analysis in Marathi exist, they often fall short when applied to generalized and variable-length inputs. To address this challenge, this research paper proposes four data augmentation techniques for sentiment analysis in Marathi. The paper focuses on augmenting existing datasets to compensate for the lack of sufficient resources. The primary objective is to enhance sentiment analysis model performance in both in-domain and cross-domain scenarios by leveraging data augmentation strategies. The data augmentation approaches proposed showed a significant performance improvement for cross-domain accuracies. The augmentation methods include paraphrasing, back-translation; BERT-based random token replacement, named entity replacement, and pseudo-label generation; GPT-based text and label generation. Furthermore, these techniques can be extended to other low-resource languages and for general text classification tasks.

研究の動機と目的

  • 低資源のインディク言語、特にマーラチ語における感情分析のためのラベル付きデータセットの不足に対処すること。
  • 既存のマーラチ語データセットに合成データを追加することで、感情分類におけるモデルの一般化性能と頑健性を向上させること。
  • ドメイン内およびドメイン間の感情分析シナリオにおいて、データ拡張技術の有効性を評価すること。
  • 限られたマーラチ語のアノテート済みデータがある中で、データ拡張がモデル性能を顕著に向上させられることを示すこと。
  • 他の低資源言語およびテキスト分類タスクに適用可能な再利用可能なフレームワークを提供すること。

提案手法

  • 構文的に多様だが感情を保持する文を生成するために、BERTベースのランダムトークン置換および固有表現置換を採用した。
  • 感情を保持したまま多様な言い換え文を生成するために、英語を中間言語として用いたバックトランスレーションを適用した。
  • GPTベースのモデルを用いて、合成テキストと対応する感情ラベルの両方を生成し、データの多様性とラベルの一貫性を向上させた。
  • BERTを用いて順次マスキング戦略を実装し、トークンをマスクまたはマスク済みトークンに置換することで、意味構造を保持した。
  • 拡張されたデータセット上でBERTおよびGPTモデルを微調整し、ドメイン内およびドメイン間の設定における性能を評価した。
  • モデルの性能を比較するために、混同行列と標準指標(正確性、F1スコア)を用いた。

実験結果

リサーチクエスチョン

  • RQ1データ拡張技術は、低資源のマーラチ語NLPタスクにおける感情分類の正確性を顕著に向上させることができるか?
  • RQ2バックトランスレーション、BERTマスキング、GPT生成などの異なるデータ拡張戦略は、ドメイン間でのモデル一般化性能向上においてどのように比較されるか?
  • RQ3例えば、GoEmotionsで学習し、MahaSentでテストするようなドメイン間の知識移譲は、マーラチ語の感情分析においてどの程度性能を向上させるか?
  • RQ4どの拡張手法がMahaSentデータセットにおけるドメイン内正確性を最も高めるか?
  • RQ5合成データ生成は、感情極性を保持しつつ、データセットの多様性とモデルの頑健性を向上させることができるか?

主な発見

  • GPTベースのラベル生成手法が、MahaSentテストセットで最高のドメイン内正確性84.35%を達成し、他のすべての手法を上回った。
  • BERTベースのランダムマスキング戦略は、MahaSentデータセットにおける正確性をベースラインの83.67%から84.30%まで向上させ、データ拡張の有効性を示した。
  • ドメイン間性能が顕著に向上し、GoEmotionsで微調整したモデルがMahaSentテストセットで73.62%の正確性を達成した。これは、成功した知識移譲を示している。
  • BERTベースの固有表現置換手法は、入力分布の変化に応じたドメイン間一般化性能の向上に顕著な効果を示し、モデルの頑健性を高めた。
  • GPTベースのアプローチ1(ラベル生成)は、GoEmotionsテストセットで63.20%の正確性を達成し、ターゲットドメインにおける優れた性能を示した。
  • 混同行列から、すべての拡張手法において、特に不均衡な感情ラベルに対するクラスごとの適合率と再現率が一貫して向上していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。