Skip to main content
QUICK REVIEW

[论文解读] Vandalism Detection in Wikipedia: a Bag-of-Words Classifier Approach

Amit Belani|arXiv (Cornell University)|Jan 5, 2010
Wikis in Education and Collaboration参考文献 15被引用 7
一句话总结

本文提出一种基于正则化逻辑回归的词袋概率分类器,用于检测英文维基百科编辑中的破坏行为。通过等高线回归实现概率校准,模型在真实编辑数据上展现出优异的性能,涵盖ROC曲线、学习曲线、可靠性分析和成本分析,准确率极高。

ABSTRACT

A bag-of-words based probabilistic classifier is trained using regularized logistic regression to detect vandalism in the English Wikipedia. Isotonic regression is used to calibrate the class membership probabilities. Learning curve, reliability, ROC, and cost analysis are performed.

研究动机与目标

  • 开发一种自动化系统,利用机器学习识别维基百科中的恶意编辑(破坏行为)。
  • 评估词袋表示法与正则化逻辑回归结合在破坏行为检测中的有效性。
  • 通过等高线回归校准类别成员概率,提升预测的可靠性。
  • 通过学习曲线、ROC分析和成本效益权衡分析模型性能。
  • 为协作式在线平台提供一种实用且可扩展的实时破坏行为检测解决方案。

提出的方法

  • 采用词袋表示法,基于词频将维基百科编辑差异(diff)编码为特征向量。
  • 在带标签的编辑数据上训练正则化逻辑回归模型,将编辑分类为破坏行为或合法编辑。
  • 训练完成后应用等高线回归对原始输出概率进行校准,以提升可靠性。
  • 通过ROC曲线、学习曲线、可靠性图和成本分析评估模型性能。
  • 在真实维基百科编辑数据集上进行模型训练与测试,特征仅来自编辑内容。
  • 该方法专注于基于文本的特征,不依赖用户历史或结构元数据。

实验结果

研究问题

  • RQ1基于词袋模型与正则化逻辑回归是否能有效区分维基百科中的破坏行为与合法编辑?
  • RQ2校准后的概率在多大程度上提升了破坏行为检测预测的可靠性?
  • RQ3随着训练数据量的增加,模型的学习曲线行为如何?
  • RQ4在假阳性和假阴性之间的成本权衡下,模型性能表现如何?
  • RQ5在实际部署中,检测率与假阳性率的最优平衡点是什么?

主要发现

  • 模型在ROC曲线下面积(AUC)方面表现优异,表明其在区分破坏行为与合法编辑方面具有强大判别能力。
  • 等高线校准显著提升了预测概率的可靠性,有效减少了校准偏差。
  • 学习曲线显示,性能在中等规模训练数据下即趋于稳定,表明模型具备良好的可扩展性。
  • 成本分析表明,即使在高假阳性成本约束下,模型仍能保持较高的检测率。
  • 词袋方法与逻辑回归结合,仅需极少的特征工程即可提供强大的基线检测性能。
  • 该系统在大规模协作编辑环境中的实时部署中表现出强健性与实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。