[论文解读] Predicting Audience's Laughter Using Convolutional Neural Network
本文提出了一种基于卷积神经网络(CNN)的方法,用于预测TED演讲文稿中的观众笑声,利用自动学习的文本特征,其性能优于传统的手工设计语言特征方法。该CNN模型在双关语数据集上达到86.1%的准确率,在更大、更丰富的TED演讲语料库上达到58.9%的准确率,展现出更优的性能并显著减少了对手动特征工程的依赖。
For the purpose of automatically evaluating speakers' humor usage, we build a presentation corpus containing humorous utterances based on TED talks. Compared to previous data resources supporting humor recognition research, ours has several advantages, including (a) both positive and negative instances coming from a homogeneous data set, (b) containing a large number of speakers, and (c) being open. Focusing on using lexical cues for humor recognition, we systematically compare a newly emerging text classification method based on Convolutional Neural Networks (CNNs) with a well-established conventional method using linguistic knowledge. The advantages of the CNN method are both getting higher detection accuracies and being able to learn essential features automatically.
研究动机与目标
- 开发一种基于观众笑声作为幽默代理指标的、适用于真实世界演讲的说话人无关幽默识别系统。
- 解决现有数据集在研究口语演讲中的幽默时缺乏公开、真实且多样化的语料问题,因为现有数据集多限于剧本化笑话或电视喜剧。
- 比较基于深度学习的CNN模型与使用手工设计语言特征的传统机器学习模型的性能。
- 评估CNN是否能够自动学习有效的幽默相关表征,从而减少对专家设计特征的依赖。
- 基于大规模、公开的TED演讲文稿语料,建立自然非剧本化口语话语中幽默识别的基准。
提出的方法
- 构建了一个包含1,192篇TED演讲文稿的新语料库,若某句后跟'(Laughter)'标记,则将其标注为幽默。
- 将语料库划分为训练集(CV集)和开发集(Dev集),同时确保同一演讲中的所有语句均归属于同一分区,以保证说话人独立性。
- 采用词嵌入的CNN模型,使用多种卷积核大小(5、6、7),ReLU激活函数,以及dropout正则化(0.7和0.35)以增强正则化效果。
- 使用Adam优化器,并基于10%的验证集划分实施早停策略,以防止训练过程中的过拟合。
- 将CNN模型与基于手工设计语言特征(包括语义不一致、歧义性和语音风格等)训练的常规随机森林分类器进行对比。
- 通过200次迭代的Tree Parzen Estimation(TPE)优化超参数,以在开发集上最大化模型性能。
实验结果
研究问题
- RQ1基于CNN的模型是否能在从口语演讲中检测幽默方面,优于使用手工设计语言特征的传统机器学习模型?
- RQ2在准确率、精确率和召回率方面,基于TED演讲文稿训练的CNN模型与传统模型相比表现如何?
- RQ3与传统方法相比,CNN模型自动学习表征的能力在多大程度上减少了对手动特征工程的需求?
- RQ4该模型在真实演讲中多样化的说话人和自然语言模式下的泛化能力如何?
- RQ5卷积核大小、dropout率和优化策略等网络架构选择对CNN幽默检测性能有何影响?
主要发现
- 在双关语数据集上,CNN模型达到86.1%的准确率,显著优于传统方法的78.3%准确率。
- 在TED演讲数据集上,CNN模型达到58.9%的准确率,较传统方法的52.0%准确率有明显提升。
- 在TED数据集上,CNN模型的精确率从传统方法的0.515提升至0.582,表明其对真实幽默实例的判别能力更强。
- CNN模型的F1分数(0.606 vs. 0.595)和召回率(0.632 vs. 0.705)也更高,表明其在各项指标上表现更均衡。
- CNN模型显著减少了对手动特征工程的依赖,因其能从原始文本输入中自动学习相关表征。
- 尽管性能有所提升,但CNN在TED数据集上的表现仍相对较低(准确率为58.9%),表明当前模型在真实演讲中的幽默识别任务中仍具挑战性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。