Skip to main content
QUICK REVIEW

[论文解读] Duluth at SemEval-2017 Task 6: Language Models in Humor Detection

Xinru Yan, Ted Pedersen|arXiv (Cornell University)|Apr 27, 2017
Humor Studies and Applications参考文献 5被引用 3
一句话总结

本文提出了一种基于语言模型的社交媒体幽默检测方法,利用在推文和新闻语料上训练的N-gram模型对幽默可能性进行排序。该系统表现优异,尤其在事后评估中,使用新闻数据训练的三元语言模型表现最佳,优于基于推文训练的模型,表明语料选择对幽默检测准确率有显著影响。

ABSTRACT

This paper describes the Duluth system that participated in SemEval-2017 Task 6 #HashtagWars: Learning a Sense of Humor. The system participated in Subtasks A and B using N-gram language models, ranking highly in the task evaluation. This paper discusses the results of our system in the development and evaluation stages and from two post-evaluation runs.

研究动机与目标

  • 开发一种通过统计语言模型从社交媒体数据中学习幽默感的系统。
  • 探究在多样化语料上训练的语言模型是否能有效检测短文本中的幽默内容。
  • 比较在推文数据和通用新闻数据上训练的N-gram语言模型(二元、三元)在幽默检测中的性能。
  • 评估预处理策略(如过滤、分词和大小写敏感性)对模型性能的影响。
  • 理解为何某些话题标签(特别是#BreakUpIn5Words)显著优于其他标签。

提出的方法

  • 使用KenLM在两个语料上训练二元和三元语言模型:来自#HashtagWars的幽默推文和来自News Commentary与News Crawl语料的通用新闻数据。
  • 采用改进的Kneser-Ney平滑方法,包含回退机制且不进行剪枝,以改善OOV(未登录词)的处理。
  • 通过过滤URL、@提及和#话题标签,并按空白字符和标点符号进行分词,对推文进行预处理。
  • 使用推文训练和新闻训练的语言模型,为每条推文计算对数概率得分,以评估其与“常规语言”的偏离程度。
  • 将新闻语言模型的较低概率得分作为幽默的代理指标,基于幽默内容偏离标准语言模式的假设。
  • 根据语言模型的对数概率得分,对子任务B的推文进行排序,并基于得分比较子任务A中的推文对。

实验结果

研究问题

  • RQ1N-gram语言模型在检测短社交媒体文本中的幽默方面效果如何?
  • RQ2在通用新闻语料上训练的语言模型是否优于在幽默推文语料上训练的模型用于幽默检测?
  • RQ3不同的预处理策略(如过滤@提及和#话题标签、分词方式、大小写敏感性)如何影响模型性能?
  • RQ4为何系统在#BreakUpIn5Words话题标签上的表现显著优于其他标签?
  • RQ5在二元与三元语言模型之间选择是否显著影响幽默检测性能?

主要发现

  • 在开发阶段,基于推文数据训练的三元语言模型在子任务B中取得了最高的F1分数0.887,而二元语言模型在子任务A中表现略优,准确率达到0.548。
  • 在正式评估中,基于新闻数据训练的模型优于基于推文数据训练的模型,尤其在事后评估中,基于新闻数据的三元语言模型取得了最佳结果。
  • 与开发阶段结果相反,二元语言模型在评估和事后评估阶段的表现优于三元语言模型,表明更简单的模型可能在未见数据上泛化得更好。
  • 在#BreakUpIn5Words话题标签上,系统在子任务A中取得了0.913的准确率,在子任务B中取得了0.636的距离得分,优于所有其他系统。
  • 基于推文和新闻数据训练的模型之间性能差距表明,训练语料的规模和多样性显著影响模型有效性,尽管新闻语料与幽默内容的领域相似度较低,但其更大的规模带来了更好的结果。
  • 研究表明,语料选择和模型复杂度(二元与三元)比模型类型更具影响力,未来工作应探索一元和字符级模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。