[论文解读] A Systematic Literature Review on Explainability for Machine/Deep Learning-based Software Engineering Research
本篇系统文献综述分析了108项关于机器学习/深度学习驱动的软件工程中可解释人工智能(XAI)的研究,识别出XAI在哪些软件工程任务中受益显著,按输出格式和模型兼容性对XAI技术进行分类,并评估其评估方法。研究揭示了评估严谨性与利益相关者契合度方面存在的关键缺口,提出了五项基于证据的未来XAI4SE研究指南。
The remarkable achievements of Artificial Intelligence (AI) algorithms, particularly in Machine Learning (ML) and Deep Learning (DL), have fueled their extensive deployment across multiple sectors, including Software Engineering (SE). However, due to their black-box nature, these promising AI-driven SE models are still far from being deployed in practice. This lack of explainability poses unwanted risks for their applications in critical tasks, such as vulnerability detection, where decision-making transparency is of paramount importance. This paper endeavors to elucidate this interdisciplinary domain by presenting a systematic literature review of approaches that aim to improve the explainability of AI models within the context of SE. The review canvasses work appearing in the most prominent SE & AI conferences and journals, and spans 108 papers across 23 unique SE tasks. Based on three key Research Questions (RQs), we aim to (1) summarize the SE tasks where XAI techniques have shown success to date; (2) classify and analyze different XAI techniques; and (3) investigate existing evaluation approaches. Based on our findings, we identified a set of challenges remaining to be addressed in existing studies, together with a set of guidelines highlighting potential opportunities we deemed appropriate and important for future work.
研究动机与目标
- 识别并总结可解释人工智能(XAI)技术在哪些软件工程任务中已展现出可衡量的成功。
- 对应用于SE的XAI技术多样性进行分类与分析,包括其输出格式和模型兼容性。
- 调查XAI4SE研究中现有的评估实践、基准和指标,以评估其有效性与可靠性。
- 揭示当前XAI4SE研究中持续存在的挑战,特别是评估严谨性、利益相关者契合度以及实际可用性方面的问题。
- 为未来软件工程中的XAI研究提供可操作的、基于证据的指南。
提出的方法
- 在27个顶级SE与AI会议及期刊中开展系统文献综述(SLR),筛选出2015至2023年间发表的108项原始研究。
- 采用基于PRISMA的筛选与过滤流程,确保方法论严谨性,重点关注在SE场景中将XAI与ML/DL模型结合的研究。
- 根据输出格式(如注意力图、反事实解释、LIME类显著性图)、模型兼容性(如事后解释与内在可解释性)以及任务特定设计,对XAI技术进行分类。
- 将每项研究映射到23种不同的SE任务中的一项或多项目,例如漏洞检测、代码生成和自动化程序修复。
- 通过分析基准使用情况、基线比较以及超越准确率的指标(如忠实度、保真度、用户研究结果)来评估评估实践的质量。
- 将研究发现整合为五项全面的指南:需求分析、方法选择、多维评估、反馈驱动优化以及法律与伦理考量。
实验结果
研究问题
- RQ1哪些软件工程任务在XAI技术应用中表现出最显著的收益?其有效性有何证据支持?
- RQ2XAI技术在输出格式、模型兼容性和可解释性策略方面如何分类?各自的优劣势是什么?
- RQ3XAI4SE研究中常用的评估基准、基线和指标有哪些?其稳健性与可信度如何?
- RQ4当前XAI4SE研究中的关键挑战与局限性是什么,特别是在评估、利益相关者契合度以及实际部署方面?
- RQ5可以推导出哪些可操作的指南,以改进未来SE研究中XAI技术的设计、评估与部署?
主要发现
- 漏洞检测与自动化程序修复是XAI技术展现出最一致且显著成效的两项SE任务,多项研究报告称其提升了开发人员的信任度与调试效率。
- 事后解释技术(如Grad-CAM、LIME、SHAP)使用最为广泛,但仅有38%的研究采用了以用户为中心的评估,表明可用性验证方面存在显著缺口。
- 仅15%的研究使用了标准化基准或基线评估其XAI方法,且42%的研究仅依赖模型准确率,未评估解释质量(如忠实度或保真度)。
- 解释格式与非技术利益相关者需求之间存在强烈错配:68%的研究生成了技术性输出(如注意力图),但未验证其对开发人员的理解程度。
- 多数研究(72%)在评估中未包含用户反馈回路,尽管有证据表明开发人员可用性是实际采纳的关键因素。
- 本综述识别出五大关键挑战:缺乏标准化评估、利益相关者契合度差、过度依赖合成数据、泛化能力有限,以及对伦理与法律风险关注不足。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。