Skip to main content
QUICK REVIEW

[论文解读] News Headlines Dataset For Sarcasm Detection

Rishabh Misra|arXiv (Cornell University)|Sep 17, 2022
Sentiment Analysis and Opinion Mining被引用 8
一句话总结

本论文提出了一项新的新闻标题数据集,用于讽刺检测,数据源自TheOnion(讽刺性内容)和HuffPost(真实新闻),包含约28,000条标题,其中13,000条为讽刺性标题。与基于Twitter的数据集相比,该数据集通过采用专业撰写、语境丰富的标题,显著降低了噪声,从而提升了讽刺检测的可靠性,并拓展了在讽刺检测之外的自然语言处理应用范围。

ABSTRACT

Past studies in Sarcasm Detection mostly make use of Twitter datasets collected using hashtag-based supervision but such datasets are noisy in terms of labels and language. Furthermore, many tweets are replies to other tweets, and detecting sarcasm in these requires the availability of contextual tweets. To overcome the limitations related to noise in Twitter datasets, we curate News Headlines Dataset from two news websites: TheOnion aims at producing sarcastic versions of current events, whereas HuffPost publishes real news. The dataset contains about 28K headlines out of which 13K are sarcastic. To make it more useful, we have included the source links of the news articles so that more data can be extracted as needed. In this paper, we describe various details about the dataset and potential use cases apart from Sarcasm Detection.

研究动机与目标

  • 解决以往讽刺检测研究中所用基于Twitter的数据集存在的噪声和语境限制问题。
  • 利用真实新闻和讽刺新闻来源,创建一个更可靠、专业撰写且语境充分的数据集,以支持讽刺检测任务。
  • 为所有标题提供来源链接,以支持数据增强和语境分析。
  • 不仅支持讽刺检测,还支持更广泛的自然语言处理任务,如反语检测、情感分析和文本生成。
  • 通过使用高质量、非用户生成的内容并具备明确语言意图,提升模型的泛化能力。

提出的方法

  • 从两个不同新闻来源精心筛选标题:TheOnion(旨在表达讽刺)和HuffPost(真实新闻),以构建一个平衡的数据集。
  • 共收集约28,000条标题,其中13,000条被标记为讽刺性(来自TheOnion),15,000条为非讽刺性(来自HuffPost)。
  • 为每条标题提供来源URL,以支持完整文章的获取和语境信息的补充。
  • 设计数据集以减少基于标签的Twitter数据收集中常见的标注噪声。
  • 结构化设计该数据集,以支持二元分类(讽刺 vs. 非讽刺)及下游自然语言处理任务。
  • 以公开可访问的格式提供该数据集,以确保可复现性并促进社区使用。

实验结果

研究问题

  • RQ1与基于Twitter的讽刺数据集相比,通过专业筛选的新闻标题数据集是否能有效降低标注噪声?
  • RQ2与现有嘈杂基准相比,该数据集在提升讽刺检测性能方面效果如何?
  • RQ3包含来源URL在多大程度上能增强讽刺检测模型的语境理解能力?
  • RQ4该数据集是否能支持讽刺检测之外的应用,如反语检测或情感分析?
  • RQ5与用户生成的推文相比,新闻标题在语言质量与一致性方面,在讽刺检测任务中的表现如何?

主要发现

  • 该数据集包含28,000条标题,其中13,000条来自TheOnion的讽刺性标题,15,000条来自HuffPost的非讽刺性标题。
  • 来源URL的引入使研究人员能够提取完整语境,从而提升模型的可解释性与性能。
  • 由于专业撰写和编辑审核,该数据集相比基于Twitter的讽刺数据集噪声更少。
  • 高质量且语境充分的标题使该数据集更适合用于训练和评估讽刺检测模型,从而提升可靠性。
  • 该数据集支持多种自然语言处理应用,不仅限于讽刺检测,还包括反语检测和文本生成。
  • 该数据集可通过arXiv公开获取,有助于研究复现和社区采纳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。