[论文解读] Predictive Models in Software Engineering: Challenges and Opportunities
本文对2009至2019年间软件工程领域145项预测模型研究进行了系统性综述,识别出关键模型、应用领域、评估指标及挑战。研究发现深度学习应用日益广泛,尤其是卷积神经网络(CNNs)与循环神经网络(RNNs);同时揭示了需求工程与测试等领域的研究尚不充分,并提出了未来在模型选择、特征工程及元学习方面的研究方向,以提升软件质量与开发效率。
Predictive models are one of the most important techniques that are widely applied in many areas of software engineering. There have been a large number of primary studies that apply predictive models and that present well-preformed studies and well-desigeworks in various research domains, including software requirements, software design and development, testing and debugging and software maintenance. This paper is a first attempt to systematically organize knowledge in this area by surveying a body of 139 papers on predictive models. We describe the key models and approaches used, classify the different models, summarize the range of key application areas, and analyze research results. Based on our findings, we also propose a set of current challenges that still need to be addressed in future work and provide a proposed research road map for these opportunities.
研究动机与目标
- 系统分析过去十年间软件工程预测建模领域的最新研究进展。
- 识别软件工程研究中最为常用的预测模型、评估指标与应用领域。
- 揭示数据集质量、特征选择与模型评估方面存在的关键挑战,这些挑战阻碍了预测模型的有效部署。
- 提出未来研究路线图,重点聚焦于需求工程与测试等尚未充分探索的领域,以及元学习与高级特征工程方面的机遇。
提出的方法
- 基于顶级软件工程会议与期刊(ICSE、ASE、FSE、TSE、TOSEM、EMSE)在2009至2019年间的文献,开展系统性文献综述。
- 通过标题与摘要筛选2,000余篇论文,再通过全文阅读验证摘要与引言部分的相关性。
- 依据相关性与方法论严谨性,最终选定145项高质量原始研究。
- 将预测模型分类为三类:基础学习器、集成学习器与深度学习器。
- 采用10种常用评估指标分析模型性能,其中召回率、精确率与F-measure使用频率最高。
- 将应用映射至软件开发生命周期的六个领域:需求工程、设计/开发、测试/调试、维护,以及专业实践。
实验结果
研究问题
- RQ12009至2019年间,软件工程研究中使用最广泛的预测模型与机器学习技术有哪些?
- RQ2预测模型在哪些软件工程领域中应用最频繁?这些应用中的关键技术挑战是什么?
- RQ3在软件工程任务中,评估预测模型性能最常用的评估指标有哪些?
- RQ4在数据集质量、特征选择与模型评估方面,存在哪些主要未解决的挑战,限制了预测模型的采纳与有效性?
- RQ5在需求工程与测试等尚未充分探索的领域,提升软件工程中预测建模的最有前景的未来研究方向是什么?
主要发现
- 2009至2019年,软件工程领域预测模型研究数量呈现持续上升趋势,多数研究提出新颖方法。
- 共识别出52种不同的预测模型,其中逻辑回归与朴素贝叶斯是最广泛使用的基学习器,支持向量机(SVM)与决策树也频繁应用。
- 深度学习应用正在上升,卷积神经网络(CNNs)与循环神经网络(RNNs)是代码异味检测与API问题分类等任务中最受欢迎的深度学习架构。
- 缺陷预测是应用最广泛的领域,11个最常见研究主题中有7个属于软件维护与质量评估范畴。
- 召回率、精确率与F-measure是最常使用的评估指标,表明研究重点集中于不平衡数据集中的分类性能。
- 主要挑战包括数据集质量差、特征选择不一致、缺乏标准化评估指标,以及在不同软件工程任务中缺乏模型选择的指导准则。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。