[论文解读] Joint Named Entity Recognition and Stance Detection in Tweets
本文提出了一种联合方法,用于在土耳其语推文中进行命名实体识别(NER)与立场检测,采用扩展的基于规则的NER系统提取实体,并将这些实体作为额外特征输入SVM-based立场分类器。结果表明,整合NER输出可显著提升立场检测性能,尤其在使用高质量、人工标注的实体时更为明显,证明了命名实体在提升社交媒体文本立场分类中的价值。
Named entity recognition (NER) is a well-established task of information extraction which has been studied for decades. More recently, studies reporting NER experiments on social media texts have emerged. On the other hand, stance detection is a considerably new research topic usually considered within the scope of sentiment analysis. Stance detection studies are mostly applied to texts of online debates where the stance of the text owner for a particular target, either explicitly or implicitly mentioned in text, is explored. In this study, we investigate the possible contribution of named entities to the stance detection task in tweets. We report the evaluation results of NER experiments as well as that of the subsequent stance detection experiments using named entities, on a publicly-available stance-annotated data set of tweets. Our results indicate that named entities obtained with a high-performance NER system can contribute to stance detection performance on tweets.
研究动机与目标
- 调查从推文中提取的命名实体是否能提升立场检测性能。
- 评估NER质量对使用SVM分类器进行后续立场检测的影响。
- 比较基于基于规则的NER系统与人工标注命名实体在立场检测性能上的差异。
- 分析将一元语法、命名实体与话题标签作为特征组合在立场检测模型中的影响。
- 评估命名实体对不同立场目标(如Target-1与Target-2)的贡献是否有所不同。
提出的方法
- 在公开可用的、已标注立场的土耳其语推文数据集上应用了扩展的基于规则的NER系统,对社交媒体文本中常见的小写形式和变音符号进行了修改以增强处理能力。
- 从每条推文中提取命名实体(人名、地名、组织名),并将其作为额外特征与一元语法特征一同输入SVM分类器。
- 使用SVM分类器进行立场检测,采用两种特征集:仅使用一元语法,以及一元语法与命名实体特征的组合。
- 第三个特征集包含一元语法、命名实体与话题标签特征,以评估其联合贡献。
- 通过精确率、召回率与F1值进行性能评估,并将NER输出结果与人工标注的参考答案进行对比。
- 本研究使用了700条与两个体育俱乐部相关的平衡数据集,每条推文针对每个目标均有立场标签(支持/反对)。
实验结果
研究问题
- RQ1从推文中提取的命名实体是否能提升立场检测系统的性能?
- RQ2NER输出质量如何影响立场检测的准确性?
- RQ3命名实体的引入是否在不同立场目标(如Target-1与Target-2)上均带来一致的性能提升?
- RQ4将一元语法、命名实体与话题标签作为特征组合使用,其综合效果如何?
- RQ5在立场分类中,使用人工标注命名实体与NER工具提取的命名实体之间是否存在性能差距?
主要发现
- 将命名实体作为额外特征使用,平均使立场检测的F1值提升0.5–1.5个百分点,其中Target-2的提升最为显著(使用人工标注实体时,F1值从76.6%提升至79.7%)。
- 人工标注的命名实体始终优于NER提取的实体,平均F1值提升1.2–1.5个百分点,表明NER错误会降低立场检测性能。
- 对于Target-1,添加命名实体使F1值略有提升(加入话题标签后从79.8%提升至80.4%);而对于Target-2,性能略有下降(从76.6%降至75.5%),表明特征之间存在复杂交互作用。
- 在所有设置中,支持类(Favor)的F1值始终高于反对类(Against),表明可能存在类别不平衡或模型对积极立场存在偏向。
- NER系统在该数据集上的宏F1值为76.6%,但存在显著的实体识别错误(如遗漏或误分类实体),直接影响了下游立场检测的性能。
- 结果证实,高质量的NER输出对实现有效的联合NER与立场检测至关重要,即使中等程度的NER错误也会削弱引入命名实体的收益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。