[论文解读] TSAM: A Two-Stream Attention Model for Causal Emotion Entailment
本文提出 TSAM,一种双流注意力模型,通过联合建模对话历史中的情绪与说话人信息,以提升因果情绪蕴涵(CEE)任务的性能。通过将情绪注意力网络(EAN)与说话人注意力网络(SAN)结合,并引入相互的 BiAffine 交互模块,TSAM 能够捕捉说话人内部及说话人之间的感情影响,最终在 RECCON 基准测试中取得新的 SOTA 表现,宏 F1 达到 80.24%。
Causal Emotion Entailment (CEE) aims to discover the potential causes behind an emotion in a conversational utterance. Previous works formalize CEE as independent utterance pair classification problems, with emotion and speaker information neglected. From a new perspective, this paper considers CEE in a joint framework. We classify multiple utterances synchronously to capture the correlations between utterances in a global view and propose a Two-Stream Attention Model (TSAM) to effectively model the speaker's emotional influences in the conversational history. Specifically, the TSAM comprises three modules: Emotion Attention Network (EAN), Speaker Attention Network (SAN), and interaction module. The EAN and SAN incorporate emotion and speaker information in parallel, and the subsequent interaction module effectively interchanges relevant information between the EAN and SAN via a mutual BiAffine transformation. Extensive experimental results demonstrate that our model achieves new State-Of-The-Art (SOTA) performance and outperforms baselines remarkably.
研究动机与目标
- 解决先前 CEE 方法将话语对独立处理、忽略全局上下文与说话人特异性情绪影响的局限性。
- 捕捉对话历史中多个话语之间的相关性,以提升因果情绪蕴涵预测性能。
- 在统一框架中显式建模说话人内部(自我引发)与说话人之间(他人引发)的情绪影响。
- 通过引入情绪与说话人动态,提升情感对话系统的可解释性与性能。
- 证明联合建模情绪与说话人信息在 CEE 任务中的必要性与有效性。
提出的方法
- 在将话语输入 TSAM 模型前,使用 RoBERTa 将其编码为上下文表征。
- 实现情绪注意力网络(EAN),通过在情绪嵌入上执行注意力机制,以建模话语到情绪的交互。
- 构建说话人注意力网络(SAN),通过基于图的注意力机制建模说话人关系,以捕捉话语到话语的交互。
- 在交互模块中引入相互的 BiAffine 变换,以实现 EAN 与 SAN 之间的双向信息交换。
- 堆叠多层 TSAM,以在各层间迭代地优化与交换情绪与说话人信息。
- 使用最终的因果预测模块,基于增强后的表征输出预测的因果话语。
实验结果
研究问题
- RQ1与独立对分类相比,联合建模对话历史中多个话语是否能提升因果情绪蕴涵的性能?
- RQ2所提出的 TSAM 在捕捉说话人内部情绪影响(如先前话语引发的情绪持续性)方面有多有效?
- RQ3建模说话人之间的情绪影响(如由另一说话人话语引发的情绪)在多大程度上提升了预测准确率?
- RQ4情绪与说话人表征之间的交互机制对整体模型性能有多关键?
- RQ5TSAM 层的最优数量是多少,以在信息优化与冗余之间取得平衡?
主要发现
- 所提出的 TSAM 模型在 RECCON-DD 基准上取得了 80.24% 的宏 F1 分数,显著优于之前的 SOTA 模型。
- 在 SAN 中引入说话人信息使宏 F1 提升了 1.53 个百分点(从 78.71 提升至 80.24),证明了说话人信息在性能中的关键作用。
- 移除交互模块后,宏 F1 降至 78.56,证实 EAN 与 SAN 之间的信息交换对高性能至关重要。
- 与无 TSAM 的变体相比,TSAM 在说话人内部影响上的预测准确率提升了 1.76 个百分点,在说话人之间影响上提升了 2.14 个百分点。
- 三层 TSAM 层次达到最佳性能,使用更少或更多的层数均导致性能下降,表明存在最优的深度以实现信息优化。
- 模型在包含三个或以上因果话语的样本上表现不佳,宏 F1 下降约 6 个百分点,且在需要常识推理的潜在因果关系上表现较差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。