Skip to main content
QUICK REVIEW

[论文解读] DENS: A Dataset for Multi-class Emotion Analysis

Chen Liu, Muhammad Osama|arXiv (Cornell University)|Oct 25, 2019
Sentiment Analysis and Opinion Mining参考文献 19被引用 4
一句话总结

本文介绍了 DENS,一个从经典文学和现代在线故事中提取的长篇叙事文本数据集,通过 Amazon Mechanical Turk 对九种情绪类别(喜悦、悲伤、愤怒、恐惧、期待、惊讶、爱、厌恶、中性)进行标注。该研究对多种模型进行了基准测试,发现微调预训练 BERT 模型的性能最高,微 F1 得分为 60.4%,表明该数据集在推动超越句子级别和二元情绪任务的多类别情绪分析方面具有重要价值。

ABSTRACT

We introduce a new dataset for multi-class emotion analysis from long-form narratives in English. The Dataset for Emotions of Narrative Sequences (DENS) was collected from both classic literature available on Project Gutenberg and modern online narratives available on Wattpad, annotated using Amazon Mechanical Turk. A number of statistics and baseline benchmarks are provided for the dataset. Of the tested techniques, we find that the fine-tuning of a pre-trained BERT model achieves the best results, with an average micro-F1 score of 60.4%. Our results show that the dataset provides a novel opportunity in emotion analysis that requires moving beyond existing sentence-level techniques.

研究动机与目标

  • 为英语长篇叙事中缺乏大规模、多类别情绪数据集的问题提供解决方案。
  • 提供一个基准数据集,以捕捉超越二元或短文本情绪分类的复杂情感弧线。
  • 支持在情绪层层叠加且依赖上下文的叙事语境中进行情绪分析研究。
  • 支持开发能够理解长篇连贯段落中情绪内容的模型。

提出的方法

  • 数据集从 Project Gutenberg 和 Wattpad 中选取的 40–200 个词的段落构建,重点聚焦于情感丰富的文本内容。
  • 情绪标注基于修改后的 Plutchik 情绪轮,将“信任”替换为“爱”,并增加“中性”类别,形成九种类别情绪。
  • 通过 Amazon Mechanical Turk 的众包工作者为每个段落标注主导情绪,要求多数意见一致(Fleiss’s κ > 0.4)方可纳入。
  • 对于标注一致性较低的段落,由内部专家标注员进行人工复核,以确保标签质量。
  • 评估了多种模型,包括 TF-IDF 与 SVM、基于词典的方法、Doc2Vec、RNN、自注意力机制、ELMo 和微调 BERT。
  • 以未经过大小写处理的 BERT-Large 模型微调作为最先进基线,报告了交叉验证后的微 F1 得分。

实验结果

研究问题

  • RQ1是否可以在长篇叙事段落而非孤立的简短文本上有效执行多类别情绪分类?
  • RQ2预训练语言模型(如 BERT)与传统的词袋模型和基于词典的方法在叙事情绪分类上的表现如何比较?
  • RQ3注意力机制和上下文嵌入在叙事语境下对情绪分类性能的提升程度如何?
  • RQ4叙事上下文和段落长度对情绪标注一致性及模型性能有何影响?

主要发现

  • 微调预训练 BERT 模型在 DENS 数据集上表现最佳,平均微 F1 得分为 60.4%。
  • 词袋模型和基于词典的方法(如 TF-IDF + SVM、NRC + SVM)表现较差,微 F1 得分低于 0.46。
  • 神经序列模型(如带自注意力机制的 BiRNN 和基于 ELMo 的模型)表现出中等程度的改进,微 F1 得分在 0.487 到 0.516 之间。
  • 使用上下文嵌入(ELMo 和 BERT)显著优于静态词嵌入和基于词典的方法。
  • 该数据集表明,叙事情绪通常复杂且依赖上下文,需要能够捕捉长距离依赖关系和语义细微差别的模型。
  • 结果表明,当前模型在低频情绪类别上仍存在困难,提示未来研究需关注少样本学习和知识注入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。