[论文解读] Annotation and Detection of Emotion in Text-based Dialogue Systems with CNN
该论文提出EmoNet,一种基于深度卷积神经网络(CNN)的中文文本对话情绪检测模型,通过跳过传统预处理步骤(如分词和关键词提取)来保留语言顺序与上下文信息。通过采用带有残差连接的深层CNN架构并实现端到端学习,EmoNet在12,000条对话的数据集上实现了72.8%的top-1准确率,在多类别情绪检测任务中优于当前最先进方法。
Knowledge of users' emotion states helps improve human-computer interaction. In this work, we presented EmoNet, an emotion detector of Chinese daily dialogues based on deep convolutional neural networks. In order to maintain the original linguistic features, such as the order, commonly used methods like segmentation and keywords extraction were not adopted, instead we increased the depth of CNN and tried to let CNN learn inner linguistic relationships. Our main contribution is that we presented a new model and a new pipeline which can be used in multi-language environment to solve sentimental problems. Experimental results shows EmoNet has a great capacity in learning the emotion of dialogues and achieves a better result than other state of art detectors do.
研究动机与目标
- 开发一种鲁棒的中文对话情绪检测系统,以保持语言结构与上下文信息。
- 克服传统预处理方法(如分词、关键词提取)导致的词序扭曲与情感细微差别的丢失。
- 评估深度CNN在无需人工特征工程的端到端情绪分类任务中的有效性。
- 将EmoNet的性能与现有最先进的中文文本情绪检测模型进行对比。
提出的方法
- EmoNet采用9层深层CNN,包含32、64、128和256维的卷积核,随后接最大池化层与全连接层。
- 模型直接处理原始UTF-8编码的中文字符,避免分词与词干化,以保留词序与句法上下文。
- 从输入序列中移除停用词以减少噪声并提升训练效率,同时保持序列顺序。
- 采用重采样技术标准化输入长度,替代传统的基于查找表的词频编码向量化方法。
- 通过网格搜索优化学习率(γ = 5×10⁻⁶)与L2正则化(L = 1.5×10⁻⁴)等超参数,以获得最佳性能。
- 网络使用ReLU激活函数,通过Dropout进行正则化,输出层采用Softmax实现多分类(积极、消极、好奇、中性)。
实验结果
研究问题
- RQ1深度CNN模型是否能在不进行分词或关键词提取的前提下,有效检测中文对话中的情绪,同时保持语言顺序?
- RQ2EmoNet在中文文本对话系统中的情绪检测性能与现有最先进检测器相比如何?
- RQ3省略预处理步骤对情绪检测准确率与模型泛化能力有何影响?
- RQ4为何积极情绪的准确率低于其他类别?这与训练数据中讽刺与模糊表达的关系是什么?
主要发现
- 经过100轮训练后,EmoNet在12,000条对话的测试集上实现了72.8%的top-1准确率,优于Multi-Modal Net(65.48%)与ESiN的整体准确率。
- 模型在‘好奇’情绪类别上达到最高准确率(85%),归因于问号与疑问词等明确标记的存在。
- 中性情绪检测的准确率最高(73%),但许多误分类源于缺乏明显的情感线索。
- 积极情绪检测准确率最低(57%),可能由于训练数据中存在讽刺与模糊表达,即使对人类也难以区分。
- 模型在中性状态上的表现(73%)优于Multi-Modal Net(71.37%),并接近ESiN的峰值性能(超过80%)。
- 优化后的超参数(γ = 5×10⁻⁶,L = 1.5×10⁻⁴)取得了最佳结果,损失值在第一轮训练中持续下降,如训练曲线所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。