[論文レビュー] Anubhuti -- An annotated dataset for emotional analysis of Bengali short stories
本稿では、言語的スキルを持つアノテーターによる厳密な手動アノテーションを通じて作成された、ベンガル語の短編小説における感情分析のための、初めての大規模なアノテート済みデータセットAnubhutiを紹介する。このデータセットは、高いアノテーター間一致度を達成しており、従来の機械学習およびディープラーニングモデルを用いた高精度な感情分類を可能にし、低リソース言語におけるNLP、言語学、および文学的感情分析の分野において貴重な知見を提供する。
Thousands of short stories and articles are being written in many different languages all around the world today. Bengali, or Bangla, is the second highest spoken language in India after Hindi and is the national language of the country of Bangladesh. This work reports in detail the creation of Anubhuti -- the first and largest text corpus for analyzing emotions expressed by writers of Bengali short stories. We explain the data collection methods, the manual annotation process and the resulting high inter-annotator agreement of the dataset due to the linguistic expertise of the annotators and the clear methodology of labelling followed. We also address some of the challenges faced in the collection of raw data and annotation process of a low resource language like Bengali. We have verified the performance of our dataset with baseline Machine Learning as well as a Deep Learning model for emotion classification and have found that these standard models have a high accuracy and relevant feature selection on Anubhuti. In addition, we also explain how this dataset can be of interest to linguists and data analysts to study the flow of emotions as expressed by writers of Bengali literature.
研究の動機と目的
- ベンガル語の短編小説における感情分析のための、初めての大規模かつ高品質なアノテート済みデータセットの構築を目的とする。
- ベンガル語のような低リソース言語におけるテキストデータの収集およびアノテーションの課題に対処することを目的とする。
- 専門的なアノテーターと明確に定義されたラベル付け手法を用いることで、高いアノテーター間一致度を確保することを目的とする。
- 標準的な機械学習およびディープラーニングモデルを用いて、データセットの有効性を評価することを目的とする。
- NLP、計算言語学、および文学的感情フロー分析の分野における横断的で統合的な研究を支援することを目的とする。
提案手法
- データ収集は、言語的およびテーマ的多様性を確保するため、多様な文学的出典からベンガル語の短編小説を収集することで行った。
- 手動アノテーションは、標準化されたラベル付けフレームワークを用いて、言語的訓練を受けたアノテーターが実施した。
- アノテーター間一致度は測定され、感情ラベル付けの整合性と信頼性が裏付けられた。
- ベースラインモデルとして、従来の機械学習およびディープラーニングアーキテクチャが、Anubhutiデータセット上で訓練および評価された。
- 感情分類に適した言語的手がかりを特定するために、特徴選択が実施された。
- 感情分類タスクにおける性能評価を通じて、データセットの妥当性が検証され、高いモデル精度が示された。
実験結果
リサーチクエスチョン
- RQ1ベンガル語のような低リソース言語において、高品質で大規模な感情アノテート済みデータセットをどのように構築できるか。
- RQ2ベンガル語において、専門的なアノテーターと標準化されたラベル付けプロトコルを用いることで、どの程度のアノテーター間一致度を達成できるか。
- RQ3標準的な機械学習およびディープラーニングモデルは、Anubhutiデータセットを用いて感情分類タスクでどの程度の性能を示すか。
- RQ4ベンガル語の文学的テキストにおいて、感情を予測するのに最も有用な言語的特徴は何か。
- RQ5このデータセットは、NLP、言語学、および文学分析の分野における横断的で統合的な研究を、どのような形で支援できるか。
主な発見
- Anubhutiデータセットは高いアノテーター間一致度を達成しており、アノテーションプロセスの信頼性が裏付けられた。
- 標準的な機械学習およびディープラーニングモデルは、Anubhutiデータセット上で感情分類において高い精度を達成した。
- このデータセットは、ベンガル語の物語的文脈における感情検出に特化した顕著な言語的手がかりを特定するための効果的な特徴選択を可能にした。
- このコーパスは、ベンガル語の短編小説における感情分析の分野で、初めてかつ最大規模のリソースであり、低リソースNLP分野における重要な空白を埋めた。
- このデータセットはNLPタスクにとどまらず、ベンガル文学における感情の流れを分析する言語学的および文学的研究に対しても価値がある。
- このデータセット作成プロセスは、他の低リソース言語においても同様のリソースを構築するための再現可能なフレームワークを提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。