Skip to main content
QUICK REVIEW

[论文解读] Sarcasm Detection in a Disaster Context

Tiberiu Sosea, Junyi Jessy Li|arXiv (Cornell University)|Aug 16, 2023
Sentiment Analysis and Opinion MiningComputer Science被引用 3
一句话总结

本文提出了HurricaneSARC,一个包含15,000条与灾难相关的推文的讽刺识别数据集,这些推文已标注讽刺与非讽刺。研究评估了使用BERTweet等预训练语言模型进行讽刺检测的效果。结果表明,采用不确定性感知的自训练(UST)的半监督学习方法在该数据集上实现了0.70的F1分数,同时将标注成本降低了高达75%,且性能与使用全部标注数据训练的模型相当。

ABSTRACT

During natural disasters, people often use social media platforms such as Twitter to ask for help, to provide information about the disaster situation, or to express contempt about the unfolding event or public policies and guidelines. This contempt is in some cases expressed as sarcasm or irony. Understanding this form of speech in a disaster-centric context is essential to improving natural language understanding of disaster-related tweets. In this paper, we introduce HurricaneSARC, a dataset of 15,000 tweets annotated for intended sarcasm, and provide a comprehensive investigation of sarcasm detection using pre-trained language models. Our best model is able to obtain as much as 0.70 F1 on our dataset. We also demonstrate that the performance on HurricaneSARC can be improved by leveraging intermediate task transfer learning. We release our data and code at https://github.com/tsosea2/HurricaneSarc.

研究动机与目标

  • 为解决缺乏聚焦于飓风等灾难情境的讽刺识别数据集的问题。
  • 评估如BERTweet等预训练语言模型在灾难相关推文中的讽刺检测性能。
  • 探究在低资源灾难场景下,中间任务迁移学习或半监督学习是否能提升讽刺检测效果。
  • 通过利用未标注数据,降低标注成本并加速时间敏感的灾难事件中的模型训练。

提出的方法

  • 通过众包方式对来自哈维、伊尔玛和玛丽亚飓风的15,000条英文推文进行讽刺与非讽刺的标注。
  • 以HurricaneSARC数据集为基础,微调BERTweet、CNN和BiLSTM模型作为讽刺检测的基线模型。
  • 通过情感与情绪分析等中间任务迁移学习,提升讽刺检测性能。
  • 实施不确定性感知的自训练(UST),并通过同义词替换和反向翻译进行数据噪声处理,以利用未标注的灾难相关推文。
  • 在UST中使用蒙特卡洛Dropout进行不确定性估计,并在噪声学生训练中应用知识蒸馏以提升泛化能力。
  • 仅使用每类100或200个标注样本进行模型训练,并与全监督基线模型进行性能对比。

实验结果

研究问题

  • RQ1如BERTweet等预训练语言模型能否有效检测灾难相关推文中的讽刺?还是由于领域差异而表现不佳?
  • RQ2从相关任务(如情感或情绪分析)进行中间任务迁移学习,是否能提升在HurricaneSARC数据集上的讽刺检测性能?
  • RQ3半监督学习技术(如UST和噪声学生训练)是否能显著减少灾难情境下讽刺检测对人工标注数据的需求?
  • RQ4当仅使用25%的标注数据,通过半监督方法训练时,模型性能与稳定性如何变化,相较于全监督方法?

主要发现

  • 表现最佳的模型——基于BERTweet的不确定性感知自训练(UST)模型,在HurricaneSARC数据集上实现了0.70的F1分数。
  • 仅使用每类200个标注样本,UST模型的F1分数与使用四倍数据的全监督BERTweet模型相比,仅低1%以内。
  • 半监督学习方法将标注成本降低了高达75%,同时保持了与使用完整标注数据集训练的模型相当的性能。
  • UST模型在多次随机运行中的F1分数方差显著低于原始BERTweet模型,表明其模型稳定性更高。
  • 从通用领域讽刺数据集(如Twitter或Reddit)进行迁移学习使性能下降了15%的F1分数,凸显了领域差异问题。
  • 结合不确定性估计的噪声学生训练(通过反向翻译和同义词替换实现)显著提升了模型的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。