Skip to main content
QUICK REVIEW

[论文解读] Convolutional Neural Network for Humor Recognition.

Lei Chen, Chongmin Lee|arXiv (Cornell University)|Feb 8, 2017
Humor Studies and ApplicationsPsychology被引用 19
一句话总结

本文提出一种基于卷积神经网络(CNN)的方法,用于自动识别口语语料中的幽默,使用一个新创建的、公开的且多样化的TED演讲语料库。与基于传统语言学特征的方法相比,该CNN方法在准确率上表现更优,并能从原始文本中自动学习相关的幽默线索。

ABSTRACT

For the purpose of automatically evaluating speakers' humor usage, we build a presentation corpus containing humorous utterances based on TED talks. Compared to previous data resources supporting humor recognition research, ours has several advantages, including (a) both positive and negative instances coming from a homogeneous data set, (b) containing a large number of speakers, and (c) being open. Focusing on using lexical cues for humor recognition, we systematically compare a newly emerging text classification method based on Convolutional Neural Networks (CNNs) with a well-established conventional method using linguistic knowledge. The CNN method shows its advantages on both higher recognition accuracies and being able to learn essential features automatically.

研究动机与目标

  • 开发一种自动评估口语演讲中幽默使用情况的方法。
  • 解决现有研究中缺乏平衡、多样化且开源的幽默数据集的问题。
  • 比较深度学习(CNN)与传统基于语言学特征的方法在幽默识别中的表现。
  • 探究CNN是否能够直接从文本中学习有效的幽默特征,而无需人工特征工程。

提出的方法

  • 作者从TED演讲中构建了一个新的演讲语料库,包含来自大量演讲者的幽默和非幽默语句。
  • 该语料库设计为同质、平衡且公开可用,以支持可复现的研究。
  • 使用原始文本序列训练CNN模型,通过词嵌入作为输入,将语句分类为幽默或非幽默。
  • CNN采用多种卷积核大小,以捕捉输入句子中的局部n-gram模式。
  • 模型在特征图上使用最大池化操作,提取最显著的表征。
  • 将CNN的性能与依赖于人工设计语言学特征(如词汇和句法线索)的传统方法进行比较。

实验结果

研究问题

  • RQ1基于CNN的模型是否能实现比传统语言学特征方法更高的幽默识别准确率?
  • RQ2CNN模型是否能有效直接从原始文本中学习幽默相关特征,而无需显式特征工程?
  • RQ3当在多样、演讲者平衡且公开的语料库上训练时,CNN模型的性能如何?
  • RQ4CNN在自然口语语言中,对不同演讲者和说话风格的泛化能力如何?

主要发现

  • 基于CNN的方法在幽默识别准确率上优于传统的语言学特征方法。
  • CNN模型展示了能够从原始文本中自动学习关键幽默相关特征的能力,从而减少对人工特征工程的依赖。
  • 所提出的语料库提供了一个平衡、多样且公开的资源,适用于训练和评估幽默识别系统。
  • 使用包含正负样本的同质数据源,提升了模型的泛化能力和可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。