[论文解读] Directed Acyclic Graph Network for Conversational Emotion Recognition
本文提出DAG-ERC,一种基于有向无环图(DAG)的新型神经网络,用于对话情感识别,通过将说话人和位置约束的边编码为DAG来建模上下文。通过结合循环机制与基于图的消息传递,DAG-ERC在不产生过度平滑的情况下捕捉长距离依赖关系,在四个基准数据集上达到最先进性能,尤其在强调说话人身份的多说话人场景中表现优异。
The modeling of conversational context plays a vital role in emotion recognition from conversation (ERC). In this paper, we put forward a novel idea of encoding the utterances with a directed acyclic graph (DAG) to better model the intrinsic structure within a conversation, and design a directed acyclic neural network, namely DAG-ERC, to implement this idea. In an attempt to combine the strengths of conventional graph-based neural models and recurrence-based neural models, DAG-ERC provides a more intuitive way to model the information flow between long-distance conversation background and nearby context. Extensive experiments are conducted on four ERC benchmarks with state-of-the-art models employed as baselines for comparison. The empirical results demonstrate the superiority of this new model and confirm the motivation of the directed acyclic graph architecture for ERC.
研究动机与目标
- 解决现有基于图和基于循环的模型在建模对话情感识别上下文方面的局限性。
- 提出一种新型DAG架构,整合图模型与序列建模的优势,以实现更优的上下文表征。
- 探究说话人身份与位置约束是否能提升多说话人对话中上下文建模的效果。
- 评估DAG-ERC在防止过度平滑方面的鲁棒性及其在处理情感转变和相似情感误分类问题上的有效性。
提出的方法
- 利用说话人身份和话语位置作为约束,从对话中构建有向无环图(DAG),以定义有向边。
- 采用DAGNN作为主干网络,实现在单层内对前驱节点进行循环式消息传递,避免过度平滑。
- 引入关系感知的特征变换,编码说话人身份,以区分说话人之间的消息流与说话人内部的消息流。
- 引入上下文信息单元,增强每个话语的历史上下文表征。
- 采用单层消息传递机制,聚合所有前驱节点的信息,实现在不堆叠深层网络的情况下编码长距离上下文。
- 使用RoBERTa进行话语编码,并在四个公开的ERC基准数据集上端到端微调整个DAG-ERC模型。
实验结果
研究问题
- RQ1与传统的图模型或RNN方法相比,有向无环图(DAG)结构是否能更有效地建模对话上下文?
- RQ2引入说话人身份和位置约束对DAG构建及模型性能有何影响?
- RQ3与标准GNN相比,DAG-ERC在层数增加时是否能有效缓解过度平滑问题?
- RQ4DAG-ERC在处理情感转变和相似情感误分类方面是否有效?
- RQ5关系感知特征变换与上下文信息单元对整体性能的贡献如何?
主要发现
- 在IEMOCAP和DailyDialog数据集上,DAG-ERC达到最先进性能,无情感转变测试样本准确率达74.25%,有情感转变样本准确率达57.98%。
- 在MELD和EmoryNLP数据集上,尽管性能略低于最先进方法,DAG-ERC仍表现出色,表明其在多说话人场景中的有效性。
- 结合说话人与位置约束的DAG结构显著优于无这些约束的变体,证明了其重要性。
- 即使在层数增加时,DAG-ERC也未出现过度平滑问题,IEMOCAP数据集上1–12层的性能保持稳定。
- 消融实验表明,节点信息单元与上下文信息单元均对性能有显著贡献,两者结合使用效果最佳。
- 模型在区分相似情感(如“沮丧”与“愤怒”、“高兴”与“兴奋”)时表现最弱,且在中性样本比例较高的数据集中,常将非中性情感误分类为中性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。