[论文解读] ANA at SemEval-2019 Task 3: Contextual Emotion detection in Conversations through hierarchical LSTMs and BERT
该论文提出 HRLCE 模型,一种具有多头自注意力机制的分层 LSTM 架构,用于对话中的上下文情感检测,在 SemEval-2019 Task 3 数据集上表现优于 BERT。HRLCE 与 BERT 的集成模型在测试集上取得 0.7709 的宏平均 F1 分数,位列 165 支队伍中的第 5 名。
This paper describes the system submitted by ANA Team for the SemEval-2019 Task 3: EmoContext. We propose a novel Hierarchical LSTMs for Contextual Emotion Detection (HRLCE) model. It classifies the emotion of an utterance given its conversational context. The results show that, in this task, our HRCLE outperforms the most recent state-of-the-art text classification framework: BERT. We combine the results generated by BERT and HRCLE to achieve an overall score of 0.7709 which ranked 5th on the final leader board of the competition among 165 Teams.
研究动机与目标
- 通过有效建模多轮对话上下文,提升对话文本中的上下文情感检测性能。
- 解决在包含隐喻语言、表情符号和类别不平衡的简短非正式社交媒体文本中进行情感检测的挑战。
- 开发一种能够从话语及其对话历史中捕捉语义与情感上下文的模型。
- 在对话情境的情感分类任务中,超越 BERT 等最先进模型的性能。
- 构建一个结合分层 LSTM 与 BERT 的稳健集成系统,以在 EmoContext 任务上实现更优性能。
提出的方法
- 采用分层 LSTM(HRED)架构,使用两层 RNN 模型对话语进行编码(话语编码器)和对对话上下文进行编码(上下文编码器),实现话语级与上下文级的表示学习。
- 在上下文级别隐藏状态上引入多头自注意力机制,以优化上下文表示并捕捉长距离依赖关系。
- 使用预训练词嵌入(包括 BERT、ELMo、GloVe 和 DeepMoji)以增强词级语义与情感表征。
- 通过将上下文(u1, u2)作为第一句、目标话语(u3)作为第二句的输入对 BERT 进行微调,以强化上下文与目标之间的关系建模。
- 采用基于经验标签分布估计的类别加权交叉熵损失,以缓解类别不平衡问题。
- 在 9 折交叉验证设置下,通过多数投票方式集成 HRLCE 与 BERT 的预测结果,以提升模型稳定性和集成性能。
实验结果
研究问题
- RQ1具有自注意力机制的分层 LSTM 架构是否能在对话文本的上下文情感检测任务中超越 BERT?
- RQ2整合多种预训练嵌入(BERT、ELMo、GloVe、DeepMoji)在捕捉语义与情感特征方面的有效性如何?
- RQ3与单序列模型相比,通过分层 RNN 建模对话上下文在多大程度上能提升情感分类的准确率?
- RQ4类别不平衡与隐喻语言对社交媒体文本中情感检测性能的影响如何?
- RQ5HRLCE 与 BERT 的集成模型是否能在 EmoContext 基准上实现优于单个模型的性能?
主要发现
- HRLCE 模型在开发集上取得了最高的单模型宏平均 F1 分数,优于 BERT 和简单的 LSTM 基线模型。
- HRLCE 与 BERT 的集成模型在测试集上取得 0.7709 的宏平均 F1 分数,在 SemEval-2019 Task 3 竞赛中位列 165 支队伍中的第 5 名。
- 所有模型中,情感 'Sad' 的分类准确率最高,而 'Happy' 是最常被误分类的,尤其容易被误判为 'Others' 类别。
- 误分类主要发生在 'Others' 类别与三个主要情绪(Happy、Angry、Sad)之间,表明在区分中性或模糊情感表达时存在困难。
- 模型在测试集上的表现略低于开发集,表明可能存在领域偏移或过拟合倾向。
- 混淆矩阵显示,'Happy'、'Angry' 和 'Sad' 之间的跨类别分类极少,表明在与 'Others' 类别结合时,模型对主要情绪具有较强的判别能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。