Skip to main content
QUICK REVIEW

[论文解读] BHAAV (भव) - A Text Corpus for Emotion Analysis from Hindi Stories

Yaman Kumar, Debanjan Mahata|arXiv (Cornell University)|Sep 22, 2019
Sentiment Analysis and Opinion Mining参考文献 44被引用 10
一句话总结

本论文介绍了BHAAV,这是首个且规模最大的用于情感分析的印地语文本语料库,包含来自18个体裁的230篇印地语文短篇小说中的20,304个句子。由三位母语为印地语的标注员将每个句子标注为五种类别的感情——愤怒、喜悦、悬念、悲伤和中性。该语料库支持情感分类器的稳健训练,逻辑回归模型在中性类别上达到78.5%的F1分数,在悬念类别上达到62.1%,凸显其在印度低资源语言自然语言处理中的实用性。

ABSTRACT

The first and largest Hindi text corpus, named BHAAV (भाव), which means emotions in Hindi, for analyzing emotions that a writer expresses through his characters in a story, as perceived by a narrator/reader. The corpus consists of 20,304 sentences collected from 230 different short stories spanning across 18 genres such as प्रेरणादायक (Inspirational) and रहस्यमयी (Mystery). Each sentence has been annotated into one of the five emotion categories anger, joy, suspense, sad, and neutral) by three native Hindi speakers with at least ten years of formal education in Hindi.

研究动机与目标

  • 解决低资源印度语言(如印地语)缺乏大规模、高质量情感标注资源的问题。
  • 开发一个公开可用、语言学信息丰富的语料库,以捕捉印地语文短篇小说中人物和叙事语境所表达的情感。
  • 通过提供具有时间顺序的、包含情感动态的数据集,支持计算语言学、文本转语音系统和自动叙事研究。
  • 为印地语情感分类建立基线模型,并在涵盖多种体裁的多样化数据集上评估其性能。
  • 通过严谨的多标注员流程,探索在低资源语言(特别是印地语)中进行情感标注的可行性与挑战。

提出的方法

  • 从涵盖励志、悬疑、道德和农村生活等18个体裁的230篇印地语文短篇小说中收集了20,304个句子。
  • 由三位至少拥有十年印地语正规教育背景的母语印地语标注员,将每个句子标注为五种类别情感之一——愤怒、喜悦、悬念、悲伤和中性。
  • 通过标注者间一致性检查确保标注一致性,并通过讨论解决分歧,确保高质量标注。
  • 保留故事中原始的句子顺序,以支持时间序列和叙事语境分析,助力序列感知模型的构建。
  • 使用词袋模型和上下文嵌入(如基于BERT的模型)训练了多种基线分类器,包括逻辑回归和深度学习模型。
  • 利用逻辑回归进行特征重要性分析,识别出各类情感的关键词特征,例如‘खुश’(快乐)是喜悦的强指示词,‘रो’(哭泣)是悲伤的关键特征。

实验结果

研究问题

  • RQ1能否利用叙事文本为印地语这一低资源语言构建大规模、高质量的情感标注语料库?
  • RQ2在印地语文本中进行情感标注面临哪些关键挑战,特别是对于悬念等微妙或依赖语境的情感?
  • RQ3印地语文短篇小说中不同情感类别在语言线索和体裁分布上存在哪些差异?
  • RQ4基于该语料库,基线机器学习模型在印地语文本情感分类任务中能实现多高的性能?
  • RQ5该语料库能否支持对故事中情感弧线的时间分析?又能为叙事情感动态提供哪些洞见?

主要发现

  • BHAAV是首个且规模最大的公开可用印地语情感分析语料库,包含来自18个体裁的230篇短篇小说中的20,304个句子。
  • 中性类别在基线模型中取得了最高的F1分数78.5%,反映出其在数据集中的主导地位以及分类的相对容易性。
  • 悬念类别的性能最低,F1分数仅为62.1%,可能由于线索微妙以及识别悬念性语言的标注挑战所致。
  • 识别出具有情感特异性的单字词特征:例如‘खुश’(快乐)、‘हँस’(笑)和‘संगीत’(音乐)是喜悦的强指标,而‘रो’(哭泣)和‘आँसू’(眼泪)则是悲伤的关键特征。
  • 由于保留了句子的原始顺序,该语料库支持时间维度的情感分析,可实现对叙事序列中情感弧线的建模。
  • 该数据集在训练融合情感语调的文本转语音系统方面展现出巨大潜力,尤其适用于有声读物和叙事应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。