Skip to main content
QUICK REVIEW

[论文解读] Stance Detection on Tweets: An SVM-based Approach

Dilek Küçük, Fazlı Can|arXiv (Cornell University)|Mar 23, 2018
Sentiment Analysis and Opinion Mining参考文献 16被引用 16
一句话总结

本文提出了一种新颖的、公开可用的土耳其语体育相关推文立场标注数据集,针对两大足球俱乐部进行标注,并使用独元特征、话题标签和命名实体特征评估了基于SVM的分类器。主要发现是,将独元特征、话题标签和命名实体结合使用可获得最高的F1分数(在两个扩展数据版本上分别为84.2%和82.8%),为土耳其语社交媒体文本中的立场检测建立了强有力的基线。

ABSTRACT

Stance detection is a subproblem of sentiment analysis where the stance of the author of a piece of natural language text for a particular target (either explicitly stated in the text or not) is explored. The stance output is usually given as Favor, Against, or Neither. In this paper, we target at stance detection on sports-related tweets and present the performance results of our SVM-based stance classifiers on such tweets. First, we describe three versions of our proprietary tweet data set annotated with stance information, all of which are made publicly available for research purposes. Next, we evaluate SVM classifiers using different feature sets for stance detection on this data set. The employed features are based on unigrams, bigrams, hashtags, external links, emoticons, and lastly, named entities. The results indicate that joint use of the features based on unigrams, hashtags, and named entities by SVM classifiers is a plausible approach for stance detection problem on sports-related tweets.

研究动机与目标

  • 通过创建并发布一个针对土耳其语体育领域的立场标注推文数据集,以应对非英语语言中立场标注数据集稀缺的问题。
  • 评估各种特征集(独元特征、二元特征、话题标签、链接、表情符号和命名实体)在SVM分类器上进行立场检测的有效性。
  • 在体育相关话语背景下,为土耳其语推文的立场检测建立一个强有力的基线。
  • 探索命名实体和话题标签作为低资源语言(如土耳其语)立场分类中提升性能的特征的实用性。

提出的方法

  • 创建了三个版本的土耳其语推文数据集,其规模和标注质量逐步提升:一个采用单标注者标签,两个采用双标注者共识,所有数据均聚焦于两个足球俱乐部作为目标。
  • 在每个数据集版本上使用10折交叉验证训练SVM分类器,特征集包括独元特征、二元特征、话题标签、外部链接、表情符号和命名实体。
  • 使用手动验证的答案表提取命名实体,以确保高精确率和高召回率,并评估其作为特征集的贡献。
  • 系统性地测试了特征组合,并使用每个立场类别(支持、反对、中立)的精确率、召回率和F1分数来衡量性能。
  • 研究采用了标准的自然语言处理技术,如分词、停用词移除和归一化,表情符号特征则来自预定义字典。
  • 最终的模型配置使用独元特征、话题标签使用情况和命名实体作为输入特征,在所有数据集版本中均取得最佳性能。

实验结果

研究问题

  • RQ1能否构建并发布一个高质量、公开可用的土耳其语推文立场标注数据集,以支持自然语言处理研究?
  • RQ2在土耳其语体育推文中,独元特征、二元特征、话题标签、链接、表情符号和命名实体的哪种组合在立场检测中表现最佳?
  • RQ3命名实体和话题标签在多大程度上能提升土耳其语社交媒体文本中的立场检测性能?
  • RQ4SVM分类器在不同规模和标注可靠性逐步提升的数据集版本上的性能如何变化?

主要发现

  • 独元特征、话题标签使用情况和命名实体的组合在数据集第三版上实现了84.2%的最高F1分数,优于所有其他特征组合。
  • 在使用最优特征集时,第三版数据集中‘支持’类的F1分数达到85.8%,‘反对’类达到82.6%。
  • 引入命名实体显著提升了性能,F1分数从81.5%(不包含命名实体)提升至84.2%(包含命名实体),表明其具有强大的判别能力。
  • 将话题标签作为特征可提升性能,表明话题标签内容在土耳其语推文中携带了有意义的立场相关信号。
  • 特别是第三版数据集(采用双标注者共识且包含1,500多条推文),为未来土耳其语立场检测研究提供了可靠且可扩展的基准。
  • 本研究为土耳其语立场检测建立了强有力的基线,基于SVM的模型在最精细的数据集版本上F1分数超过80%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。