Skip to main content
QUICK REVIEW

[论文解读] Evaluating a bot detection model on git commit messages

Mehdi Golzadeh, Alexandre Decan|arXiv (Cornell University)|Mar 22, 2021
Advanced Malware Detection Techniques参考文献 12被引用 5
一句话总结

该论文评估了一个在GitHub拉取请求和问题评论上训练的机器人检测模型在git提交信息上的性能表现,表明通过在提交信息上重新训练模型可将精确率提升至0.80。作者提出了BoDeGiC,一个开源的命令行工具,利用提交信息中的模式和统计离散度特征来检测git仓库中的机器人,展示了其在各类社会技术分析任务中的强大泛化能力。

ABSTRACT

Detecting the presence of bots in distributed software development activity is very important in order to prevent bias in large-scale socio-technical empirical analyses. In previous work, we proposed a classification model to detect bots in GitHub repositories based on the pull request and issue comments of GitHub accounts. The current study generalises the approach to git contributors based on their commit messages. We train and evaluate the classification model on a large dataset of 6,922 git contributors. The original model based on pull request and issue comments obtained a precision of 0.77 on this dataset. Retraining the classification model on git commit messages increased the precision to 0.80. As a proof-of-concept, we implemented this model in BoDeGiC, an open source command-line tool to detect bots in git repositories.

研究动机与目标

  • 评估在拉取请求和问题评论上训练的机器人检测模型在git提交信息上的泛化能力。
  • 通过专门在提交信息数据上重新训练模型,提升机器人检测的精确率。
  • 开发一个实用工具,使研究人员和实践者能够大规模检测git仓库中的机器人。
  • 评估混合人类-机器人行为对机器人分类的影响,并提出基于活动级别的机器人识别方法。

提出的方法

  • 该模型使用从提交信息中提取的四个特征:唯一模式数量、模式频率、模式频率的基尼不平等指数以及消息总数。
  • 使用包含6,922名git贡献者(标记为机器人或人类)的真实标签数据集,训练随机森林分类器。
  • 首先在原始数据集上使用与拉取请求/问题评论训练时相同的特征评估模型,随后在提交信息数据上重新训练模型。
  • BoDeGiC是一个命令行工具,可自动化分析git仓库,提取提交信息,并应用分类模型预测贡献者为机器人或人类。
  • 该工具支持以文本、JSON或CSV格式输出结果,并包含详细日志记录的详细模式。
  • 对100个随机选取的案例进行了人工验证,以评估标签可靠性与模型一致性。

实验结果

研究问题

  • RQ1在拉取请求和问题评论上训练的机器人检测模型能否有效泛化到git提交信息?
  • RQ2专门在提交信息数据上重新训练模型是否能提升其在机器人检测中的精确率?
  • RQ3与使用多种信号的现有方法(如BIMAN)相比,该模型的性能如何?
  • RQ4混合人类-机器人行为在多大程度上挑战了机器人与人类的二元分类?

主要发现

  • 原始模型在拉取请求和问题评论上训练后,应用于git提交信息时,精确率达到0.77。
  • 在提交信息数据上重新训练后,精确率提升至0.80,提高了3个百分点。
  • 随机森林分类器在检测提交信息中机器人行为模式方面优于其他模型。
  • 对100个案例的人工验证显示,与原始数据集存在19处标签不一致,但模型正确预测了全部19个案例。
  • 部分贡献者同时表现出机器人和人类行为特征,表明需要从活动级别而非贡献者级别重新定义机器人识别方式。
  • BoDeGiC成功将模型实现为命令行工具,支持多种输出格式,可在大规模git仓库分析中实现实际应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。