Skip to main content
QUICK REVIEW

[论文解读] Transformer-based Context-aware Sarcasm Detection in Conversation Threads from Social Media

Xiangjue Dong, Changmao Li|arXiv (Cornell University)|May 22, 2020
Sentiment Analysis and Opinion Mining参考文献 15被引用 4
一句话总结

本文提出了一种基于Transformer的上下文感知讽刺检测模型,通过在目标话语及其完整对话线程上应用多头注意力机制,提升讽刺预测性能。通过引入上下文话语特征,该模型在Twitter和Reddit上的F1分数分别达到79.0%和75.0%,相较于仅使用目标话语的基线模型,分别提升了3.1%和7.0%。

ABSTRACT

We present a transformer-based sarcasm detection model that accounts for the context from the entire conversation thread for more robust predictions. Our model uses deep transformer layers to perform multi-head attentions among the target utterance and the relevant context in the thread. The context-aware models are evaluated on two datasets from social media, Twitter and Reddit, and show 3.1% and 7.0% improvements over their baselines. Our best models give the F1-scores of 79.0% and 75.0% for the Twitter and Reddit datasets respectively, becoming one of the highest performing systems among 36 participants in this shared task.

研究动机与目标

  • 为解决社交媒体中表面积极情绪掩盖负面情感的讽刺检测挑战。
  • 克服仅基于目标话语的模型在捕捉讽刺检测所必需的上下文细微差别的局限性。
  • 使用最先进的Transformer架构,评估完整对话线程上下文对讽刺检测性能的影响。
  • 证明上下文感知建模能显著提升检测准确率,尤其在长而复杂的对话线程中表现更优。
  • 建立强有力的基线并公开发布资源,以促进未来在讽刺检测领域的研究。

提出的方法

  • 该模型使用Transformer编码器,通过多头自注意力机制联合编码目标话语及其周围对话上下文。
  • 通过在对话线程的所有话语间进行注意力计算,学习上下文表征,使模型能够捕捉话语层面的不一致性。
  • 对三种预训练的Transformer模型——RoBERTa-Large、BERT-Large和ALBERT-xxLarge进行微调,以完成讽刺检测任务。
  • 输入结构为[CLS] + 上下文话语 + [SEP] + 目标话语 + [SEP],保持话语的顺序。
  • 模型训练采用二元交叉熵损失函数,并使用Sigmoid激活函数进行多标签分类(讽刺 vs. 非讽刺)。
  • 在两个社交媒体数据集上进行评估:Twitter(使用#sarcasm标签)和Reddit(来自Self-Annotated Reddit Corpus)。

实验结果

研究问题

  • RQ1与仅使用目标话语的模型相比,引入完整对话线程是否能显著提升讽刺检测性能?
  • RQ2当扩展到上下文感知讽刺检测时,不同预训练Transformer架构(RoBERTa、BERT、ALBERT)的表现如何?
  • RQ3上下文感知能力是否有助于识别在孤立状态下模糊不清但结合上下文话语后变得清晰的微妙讽刺?
  • RQ4在对话线程和话语长度分布不同的数据集(如Reddit的测试集线程明显更长)上,模型性能如何变化?
  • RQ5与仅关注目标的模型相比,使用上下文感知建模会引入或缓解哪些类型的错误?

主要发现

  • 与仅关注目标的基线模型相比,上下文感知模型在Reddit数据集上的F1分数绝对提升了7.0%,最终达到75.0%。
  • 在Twitter数据集上,上下文感知模型相比基线F1分数提升了3.1%,达到79.0%,在共享任务中排名第二。
  • 错误分析显示,上下文感知模型能100%正确分类那些因缺乏上下文线索而被仅关注目标的模型误判的案例。
  • 在上下文感知模型出现错误的情况下,问题通常源于噪声过大或上下文过长,表明上下文丰富性与模型鲁棒性之间存在权衡。
  • 该模型在共享任务中超越了36名其他参赛者,成为表现最优异的系统之一。
  • 性能提升在Reddit上最为显著,其测试集对话线程长度远超训练集,凸显了在长篇对话中使用上下文的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。