[论文解读] Humor Detection: A Transformer Gets the Last Laugh
本文提出了一种基于Transformer的幽默检测模型,利用Reddit的点赞数作为弱监督信号,将笑话分类为幽默或非幽默。在约16,000个Reddit标注的笑话上进行训练,该模型在Short Jokes数据集上达到98.6%的F1分数,在Puns数据集上达到93.1%,性能优于先前的CNN模型,并在Reddit特定幽默类型上接近人类标注者的一致性水平。
Much previous work has been done in attempting to identify humor in text. In this paper we extend that capability by proposing a new task: assessing whether or not a joke is humorous. We present a novel way of approaching this problem by building a model that learns to identify humorous jokes based on ratings gleaned from Reddit pages, consisting of almost 16,000 labeled instances. Using these ratings to determine the level of humor, we then employ a Transformer architecture for its advantages in learning from sentence context. We demonstrate the effectiveness of this approach and show results that are comparable to human performance. We further demonstrate our model's increased capabilities on humor identification problems, such as the previously created datasets for short jokes and puns. These experiments show that this method outperforms all previous work done on these tasks, with an F-measure of 93.1% for the Puns dataset and 98.6% on the Short Jokes dataset.
研究动机与目标
- 开发一种机器学习模型,利用Reddit用户上传的真实评分数据识别幽默笑话。
- 探究Transformer架构是否能在幽默检测任务中超越先前的神经网络模型。
- 评估模型在多种笑话类型(包括双关语和简短单口段子)上的泛化能力。
- 将模型预测结果与人类对幽默的共识进行比较,尤其区分Reddit用户与普通受众之间的差异。
- 证明自注意力机制在捕捉幽默所依赖的细微语言线索方面的有效性。
提出的方法
- 该模型使用在15,984个Reddit笑话上微调的预训练BERT-based Transformer编码器,这些笑话根据点赞数进行标注。
- 点赞数≥200的笑话被分类为幽默;点赞数<200的笑话被标记为非幽默,形成二分类任务。
- 模型在三种变体上进行训练和评估:仅笑话正文、仅笑点、完整笑话(正文+笑点)。
- 通过在三个基准数据集上进行迁移学习:Short Jokes(231k个笑话)、Pun of the Day(16k个双关语)以及Reddit自身的笑话数据集。
- 通过Amazon Mechanical Turk进行人工评估,199名参与者每人对30个笑话进行评分,采用多数投票确定真实标签。
- 将模型性能与带有高速公路层的CNN模型以及人类在相同任务上的表现进行比较。
实验结果
研究问题
- RQ1基于Transformer的模型能否有效利用Reddit点赞数作为弱监督信号学习幽默检测?
- RQ2该模型在幽默检测任务中的表现与先前最先进模型相比如何,特别是与基于CNN的方法相比?
- RQ3该模型在双关语和简短单口段子等多样化笑话类型上的泛化能力如何?
- RQ4模型预测结果与人类共识相比如何,尤其是在区分Reddit用户与普通受众时?
- RQ5在笑话中,哪一部分——正文还是笑点——对幽默感知具有更大的决定性权重?
主要发现
- 该Transformer模型在Short Jokes数据集上达到98.6%的F1分数,较之前最佳的CNN模型提升8个百分点。
- 在Pun of the Day数据集上,模型准确率达到93.1%,较最佳先前CNN模型提升4个百分点。
- 在Reddit测试集上,模型准确率达到72.4%,优于CNN基线模型(高60多分),并接近普通人类评分者66.3%的一致率。
- 所有模型(包括人类)在幽默分类中更依赖笑点而非正文,表明笑点具有更高的预测权重。
- 模型在Reddit数据集上的表现表明其学习到了r/Jokes社区特有的幽默偏好,说明针对特定受众的幽默检测是可行的。
- 结果表明,Transformer中的自注意力机制在捕捉定义幽默的细微语言特征方面极为有效,尤其适用于短篇、依赖语境的笑话。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。