[论文解读] Performing Stance Detection on Twitter Data using Computational Linguistics Techniques
本文提出一种基于计算语言学技术的监督式立场检测方法,应用于推特数据,结合词袋模型、基于词典的特征(Arguing 和 MPQA)、通过 MALT 的依存句法分析,以及随机森林分类。该方法通过整合句法与词汇特征,提升了分类准确率,证明结构化的语言分析可超越基础文本特征,增强立场分类效果。
As humans, we can often detect from a persons utterances if he or she is in favor of or against a given target entity (topic, product, another person, etc). But from the perspective of a computer, we need means to automatically deduce the stance of the tweeter, given just the tweet text. In this paper, we present our results of performing stance detection on twitter data using a supervised approach. We begin by extracting bag-of-words to perform classification using TIMBL, then try and optimize the features to improve stance detection accuracy, followed by extending the dataset with two sets of lexicons - arguing, and MPQA subjectivity; next we explore the MALT parser and construct features using its dependency triples, finally we perform analysis using Scikit-learn Random Forest implementation.
研究动机与目标
- 开发一种自动化方法,用于检测针对特定目标的推文中的立场(支持、反对、中立)。
- 评估各种计算语言学特征(如词袋模型、情感词典和句法依赖关系)在提升立场检测性能方面的有效性。
- 探究通过依存句法分析整合语言结构是否能提升分类准确率,超越传统基于文本的特征。
- 在监督式立场检测框架下,比较不同特征集与机器学习模型(尤其是随机森林)的性能表现。
提出的方法
- 作者采用监督学习方法,使用 TIMBL 进行初始分类,基于词袋模型特征。
- 通过整合两个词典增强特征表示:Arguing 词典用于提取与立场相关的术语,MPQA 主观性词典用于捕捉情感线索。
- 应用 MALT 解析器提取依存三元组,用于生成捕捉推文中语法关系的句法特征。
- 将特征集进行组合,并使用 Scikit-learn 的随机森林分类器评估性能提升。
- 在推特立场检测数据集上训练和测试模型,通过不同特征组合测量准确率。
- 应用超参数调优与交叉验证以优化模型性能。
实验结果
研究问题
- RQ1领域特定词典(Arguing 和 MPQA)的引入在推特数据上的立场检测准确率方面有何影响?
- RQ2通过依存句法分析提取的句法特征,在超越表面文本特征的基础上,能在多大程度上提升立场分类性能?
- RQ3当应用于丰富语言特征集时,随机森林分类器是否能优于简单模型?
- RQ4词袋模型、基于词典的特征与句法特征的不同组合,对整体分类性能有何影响?
主要发现
- 与仅使用基线词袋模型特征相比,Arguing 词典的整合显著提升了立场检测准确率。
- MPQA 主观性词典的加入有助于更好识别立场中立及受情感影响的推文。
- 通过 MALT 解析器提取的基于依存的特征带来了可测量的性能提升,尤其在捕捉细微立场表达方面表现突出。
- 随机森林分类器在所有测试模型中取得了最高准确率,展现出对组合特征集的强大泛化能力。
- 表现最佳的模型结合了词袋模型、词典特征与依存三元组,相较于单一特征集,F1 分数有显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。