[论文解读] A Dual-Attention Hierarchical Recurrent Neural Network for Dialogue Act Classification
本文提出了一种带有CRF的双注意力层次RNN(DAH-CRF),通过将对话行为(DA)和话语主题作为辅助任务进行联合建模,以提升对话行为分类性能。通过利用LDA获取的主题信息以及双注意力机制,模型捕捉了对话行为与主题之间的交互关系,在三个公开数据集上实现了最先进或更优的性能表现。
Recognising dialogue acts (DA) is important for many natural language processing tasks such as dialogue generation and intention recognition. In this paper, we propose a dual-attention hierarchical recurrent neural network for DA classification. Our model is partially inspired by the observation that conversational utterances are normally associated with both a DA and a topic, where the former captures the social act and the latter describes the subject matter. However, such a dependency between DAs and topics has not been utilised by most existing systems for DA classification. With a novel dual task-specific attention mechanism, our model is able, for utterances, to capture information about both DAs and topics, as well as information about the interactions between them. Experimental results show that by modelling topic as an auxiliary task, our model can significantly improve DA classification, yielding better or comparable performance to the state-of-the-art method on three public datasets.
研究动机与目标
- 通过引入话语级别的主题信息作为上下文先验,以提升对话行为分类性能,而现有深度学习模型对这一信息的利用尚不充分。
- 通过在字符、词、话语和对话四个层次上对对话进行层次化建模,以克服平面神经网络架构的局限性。
- 开发一种任务特定的双注意力机制,以捕捉对话行为与主题之间的依赖关系及其交互作用。
- 通过使用无监督LDA自动进行话语级别的主题标注,减少对昂贵的人工标注主题的依赖,从而提升模型泛化能力。
- 在多个公开的对话行为分类基准上,实现优于或相当的性能表现,相较当前最先进方法。
提出的方法
- 设计一种层次化循环神经网络,从字符、词、话语到对话多个层次处理输入,以保留对话的自然结构。
- 引入双注意力机制,分别关注每个话语中与对话行为相关和与主题相关的表征。
- 使用LDA自动推断话语级别的主题标签,无需人工标注,从而增强模型的泛化能力。
- 在层次化RNN之上集成条件随机场(CRF)层,以建模对话行为之间的序列依赖关系。
- 采用多任务学习目标进行端到端训练:主任务为对话行为分类,辅助任务为主题预测。
- 应用任务特定的注意力头,动态加权对对话行为和主题预测有贡献的关键词,从而提升表征学习效果。
实验结果
研究问题
- RQ1与忽略主题上下文的模型相比,将话语主题作为辅助任务是否能提升对话行为分类的性能?
- RQ2同时建模对话行为与主题的双注意力机制如何影响表征学习与分类准确率?
- RQ3在语义相似的对话行为之间(如'bk'与'b'),引入主题信息在多大程度上能减少误分类?
- RQ4与平面RNN或CNN模型相比,层次化架构是否能更好地捕捉对话中的长距离依赖?
- RQ5通过LDA进行无监督主题建模,能否有效替代人工标注的主题上下文?
主要发现
- 将主题信息作为辅助任务显著提升了在SWDA、DyDA和MRDA三个数据集上的对话行为分类准确率。
- 该模型在所有数据集上的分类准确率均优于或相当於当前最先进方法(Raheja和Tetreault,2019)。
- 性能提升最大的是'bk'(回应确认)类别,准确率提升了11.7%,主要归因于将'bk'误分类为'b'(回应话轮)的情况显著减少。
- 通过利用主题线索,模型有效减少了'bk'与'b'之间的混淆——'bk'话语更常与音乐、锻炼等个人休闲主题相关。
- 对于'qo'(开放问题)和'qw'(wh-疑问句)类别,模型表现劣於基线,可能是因为这两类的主题分布相似,降低了可区分性。
- 注意力可视化结果表明,DAH-CRF+LDA utt能更准确识别与对话行为相关的关键词(如'please'、'tell'、'if'、'reasonable'),而基线模型则过度强调'because'或'uh-huh'等填充词。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。