[论文解读] A Bug or a Suggestion? An Automatic Way to Label Issues
本文提出一种基于注意力机制的双向LSTM(ABLSTM)模型,并结合基于k-NN的误分类纠正方法,以自动分类不同问题跟踪系统(ITSs)中的问题为错误或非错误。该方法在来自Jira和GitHub的超过120万条已标注问题上进行训练,F-measure达到85.6%,显著优于现有在异构ITS平台上的错误识别准确率最先进方法。
More and more users and developers are using Issue Tracking Systems (ITSs) to report issues, including bugs, feature requests, enhancement suggestions, etc. Different information, however, is gathered from users when issues are reported on different ITSs, which presents considerable challenges for issue classification tools to work effectively across the ITSs. Besides, bugs often take higher priority when it comes to classifying the issues, while existing approaches to issue classification seldom focus on distinguishing bugs and the other non-bug issues, leading to suboptimal accuracy in bug identification. In this paper, we propose a deep learning-based approach to automatically identify bug-reporting issues across various ITSs. The approach implements the k-NN algorithm to detect and correct misclassifications in data extracted from the ITSs, and trains an attention-based bi-directional long short-term memory (ABLSTM) network using a dataset of over 1.2 million labelled issues to identify bug reports. Experimental evaluation shows that our approach achieved an F-measure of 85.6\% in distinguishing bugs and other issues, significantly outperforming the other benchmark and state-of-the-art approaches examined in the experiment.
研究动机与目标
- 为解决不同问题跟踪系统(ITSs)中不一致且嘈杂的问题标注问题,特别是错误分类的错误,尤其是误标为错误的问题。
- 提升问题分类中错误识别的准确性,该问题在现有方法中常被忽视。
- 开发一种跨平台、可扩展的解决方案,仅需问题标题作为输入,从而在多样化ITS中实现广泛适用性。
- 利用k-NN方法纠正大规模问题数据集中的误分类,提升模型的鲁棒性和判别能力。
提出的方法
- 从Jira(Apache、JBoss、Spring)和23个高质量GitHub项目(超过17万条问题)中收集大规模数据集,包含超过120万条已标注问题。
- 应用k-NN算法检测并纠正数据集中的误分类问题,降低噪声并提升训练数据质量。
- 在清洗后的数据集上训练基于注意力机制的双向LSTM(ABLSTM)网络,以将问题分类为“错误”或“非错误”。
- 仅使用问题标题作为输入特征,实现跨不同ITS平台的泛化,无需依赖结构化元数据。
- 采用两阶段流程:(1) 通过k-NN进行数据清洗,(2) 使用ABLSTM进行端到端深度学习分类。
- 在Jira和GitHub的合并数据集上验证该方法,并与基准方法及最先进方法进行性能对比。
实验结果
研究问题
- RQ1深度学习模型能否在异构问题跟踪系统中有效区分错误报告与非错误问题?
- RQ2基于k-NN的误分类纠正方法在提升问题分类训练数据质量方面有多有效?
- RQ3ABLSTM模型在错误识别F-measure方面是否优于现有最先进方法及传统机器学习方法?
- RQ4仅基于问题标题训练的模型在多样化ITS平台上的性能能达到何种程度?
主要发现
- 所提出的ABLSTM模型在区分错误与非错误问题方面实现了85.6%的F-measure,显著优于基准方法和最先进方法。
- 基于k-NN的误分类纠正步骤有效降低了训练数据中的噪声,提升了模型的判别力和泛化能力。
- 该模型展现出强大的跨平台泛化能力,仅需问题标题作为输入,在Jira和GitHub的ITS中均表现良好。
- 与以往工作相比,该方法取得了更优的性能,包括那些使用复杂特征工程或额外元数据(如报告者背景或问题严重性)的方法。
- 实证评估证实,该模型在不同项目类型和问题标注质量下均表现出稳健且一致的性能。
- 本研究强调了数据质量在问题分类中的重要性,表明纠正误标问题可显著提升F-measure。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。