[论文解读] A Piece of My Mind: A Sentiment Analysis Approach for Online Dispute Detection
本文提出了一种基于情感分析的方法,用于检测维基百科讨论页中的在线争议,通过将句子级情感序列(例如:负面、中性、正面)建模为争议分类模型的特征。使用等倾条件随机场进行情感标注,并在新创建的包含7,218个讨论的语料库上采用RBF核支持向量机,最佳模型的F1得分为0.78,准确率为0.80,表明情感动态显著提升了基线方法的争议检测性能。
We investigate the novel task of online dispute detection and propose a sentiment analysis solution to the problem: we aim to identify the sequence of sentence-level sentiments expressed during a discussion and to use them as features in a classifier that predicts the DISPUTE/NON-DISPUTE label for the discussion as a whole. We evaluate dispute detection approaches on a newly created corpus of Wikipedia Talk page disputes and find that classifiers that rely on our sentiment tagging features outperform those that do not. The best model achieves a very promising F1 score of 0.78 and an accuracy of 0.80.
研究动机与目标
- 探究将句子级情感序列作为特征用于协作环境中自动在线争议检测的可行性。
- 开发一种在非正式、动态在线讨论中具有鲁棒性的句子级情感标注方法,此类讨论中常见反讽和依赖语境的表达。
- 创建并发布一个大规模、人工标注的维基百科讨论页语料库,标注内容为是否存在争议。
- 评估情感动态(如情感转变和讨论各阶段的情感分布)是否能提升争议检测性能。
- 探讨话语结构和语言线索对争议检测的影响,特别是在涉及反讽或间接冲突的情况下。
提出的方法
- 作者提出一种基于等倾条件随机场(CRFs)的新型情感标注模型,通过引入情感词典约束,提升在非正式、对话式文本上的性能。
- 该模型为每个讨论中的句子预测五种类别情感——非常负面、负面、中性、正面、非常正面,以捕捉对话的情感轨迹。
- 该方法将每个讨论划分为三个等长阶段,并提取情感分布与转变特征,以建模时间上的情感动态。
- 结合多种特征——包括词汇特征、主题特征、讨论结构特征以及情感特征——并使用逻辑回归和线性/径向基函数(RBF)核的支持向量机分类器进行评估。
- 情感特征源自一系列句子级情感预测结果,作为争议检测分类器的输入。
- 采用五折交叉验证,进行标准化特征归一化,并使用精确率、召回率、F1和准确率评估性能。
实验结果
研究问题
- RQ1句子级情感序列能否有效预测维基百科讨论页上的讨论是否涉及争议?
- RQ2情感动态(如从中性转为负面或持续负面)与争议存在之间是否存在相关性?
- RQ3与传统特征(如主题或讨论结构)相比,情感特征在多大程度上提升了争议检测性能?
- RQ4话语层面现象(如反讽和间接表达)如何影响情感标注,进而影响争议检测?
- RQ5等倾CRF能否有效建模在语境和反讽普遍存在的非正式在线对话中的情感?
主要发现
- 表现最佳的模型为结合主题、讨论结构与情感特征的RBF核SVM,其F1得分为0.78,准确率为0.80,显著优于基线模型。
- 仅使用情感特征时,准确率提升至71.60%;当与主题和讨论结构特征结合时,准确率提升至80.00%。
- 当结合全局与局部情感特征(Senti g+l)以及主题和讨论结构特征时,F1得分达到最高(0.78)。
- 情感流动可视化显示,未解决的争议表现出持续的负面情感,而解决的争议在解决后则呈现向正面或中性情感转变的趋势。
- 错误分析表明,情感预测错误(尤其是由反讽或非字面表达引起)是争议检测误分类的主要原因。
- 已解决争议的召回率最高(0.86),而争议和RFC类讨论的召回率略低(分别为0.78和0.79),表明结构差异影响了可检测性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。