Skip to main content
QUICK REVIEW

[论文解读] Auto Analysis of Customer Feedback using CNN and GRU Network

Deepak Gupta, Pabitra Lenka|arXiv (Cornell University)|Oct 12, 2017
Sentiment Analysis and Opinion Mining参考文献 12被引用 3
一句话总结

本文提出一种结合卷积神经网络(CNN)与门控循环单元(GRU)的深度学习方法,用于在无需人工特征工程的情况下,对英语、法语、西班牙语和日语四种语言的客户反馈进行自动分类。该模型在IJCNLP共享任务中,法语分类准确率达71.75%,排名第二,其他语言亦进入前三名,展现出在类别不平衡和短反馈挑战下仍具优异的多语言性能。

ABSTRACT

Analyzing customer feedback is the best way to channelize the data into new marketing strategies that benefit entrepreneurs as well as customers. Therefore an automated system which can analyze the customer behavior is in great demand. Users may write feedbacks in any language, and hence mining appropriate information often becomes intractable. Especially in a traditional feature-based supervised model, it is difficult to build a generic system as one has to understand the concerned language for finding the relevant features. In order to overcome this, we propose deep Convolutional Neural Network (CNN) and Recurrent Neural Network (RNN) based approaches that do not require handcrafting of features. We evaluate these techniques for analyzing customer feedback sentences in four languages, namely English, French, Japanese and Spanish. Our empirical analysis shows that our models perform well in all the four languages on the setups of IJCNLP Shared Task on Customer Feedback Analysis. Our model achieved the second rank in French, with an accuracy of 71.75% and third ranks for all the other languages.

研究动机与目标

  • 开发一种通用的、自动化的系统,将客户反馈分类为六个预定义类别:评论、请求、错误、投诉、无意义和未确定。
  • 克服传统监督模型在每种语言和领域中均需进行语言特定特征工程的局限性。
  • 评估深度学习模型(特别是CNN与CNN+GRU)在无需手工特征的情况下,对多语言客户反馈数据的分类性能。
  • 研究语言特定预训练词嵌入与数据翻译对模型在不同语言间泛化能力的影响。
  • 分析误分类案例,识别关键挑战,如模糊、简短或不完整的反馈句子。

提出的方法

  • 作者采用基于CNN的架构,从句子嵌入中提取局部n-gram特征,随后通过最大池化层降低维度。
  • 第二个模型将CNN与门控循环单元(GRU)结合,以捕捉反馈句子中的序列依赖关系,提升上下文建模能力。
  • 词嵌入使用预训练的Google Word2Vec初始化英语,其他语言则因缺乏可用预训练嵌入而采用随机初始化。
  • 系统在英语反馈数据上进行训练,并在原始语言测试集以及非英语测试集的英文翻译版本上进行评估。
  • 模型通过交叉熵损失和Softmax分类对六个反馈类别进行微调。
  • 对误分类实例进行错误分析,分为模糊反馈、目标实体缺失和句子过短三类。

实验结果

研究问题

  • RQ1基于CNN与GRU的深度学习模型是否能在无需语言特定特征工程的情况下,有效实现多语言客户反馈分类?
  • RQ2在低资源语言(如日语和西班牙语)中,使用翻译后的测试数据与原始语言测试数据时,性能差异如何?
  • RQ3模型在分类简短、模糊或不完整反馈句子时的主要失败模式是什么?
  • RQ4训练数据中的类别不平衡在多大程度上影响模型对少数类别(如'bug')的检测能力?
  • RQ5使用语言特定的预训练词嵌入能否进一步提升性能?

主要发现

  • CNN+GRU模型在法语中取得第二名(71.75%准确率),在英语、西班牙语和日语中排名第三,表现优异。
  • 当使用英文翻译的测试数据时,CNN模型在西班牙语中达到85.62%准确率,在日语中为63.00%,显示出中等程度的跨语言迁移能力。
  • 由于类别不平衡,模型在'bug'类别上表现最差,训练数据中投诉远多于错误。
  • 错误分析显示,误分类的主要原因包括模糊反馈、目标实体缺失以及句子过短。
  • 缺乏非英语语言的预训练词嵌入限制了性能,表明未来若采用语言特定嵌入,性能有望进一步提升。
  • 基于3-gram特征与SVM的基线系统准确率显著较低(如英语中为48.8%),证实了深度学习方法的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。