[论文解读] An Empirical Study of Explainable AI Techniques on Deep Learning Models For Time Series Tasks
本文提出了一种基准框架,用于在时间序列数据上实证评估和排名解释性人工智能(XAI)归因方法——这些方法最初是为图像和文本设计的。通过在分类、预测和回归任务中采用基于扰动的自动化评估,发现SHAP在可靠性和忠实度方面始终优于其他方法,确立了时间序列应用中XAI可复现的标准。
Decision explanations of machine learning black-box models are often generated by applying Explainable AI (XAI) techniques. However, many proposed XAI methods produce unverified outputs. Evaluation and verification are usually achieved with a visual interpretation by humans on individual images or text. In this preregistration, we propose an empirical study and benchmark framework to apply attribution methods for neural networks developed for images and text data on time series. We present a methodology to automatically evaluate and rank attribution techniques on time series using perturbation methods to identify reliable approaches.
研究动机与目标
- 评估现有XAI归因方法(最初为图像和文本设计)在时间序列数据上的可迁移性。
- 识别将这些方法适配具有序列依赖性的时间数据所需的关键修改和设计选择。
- 开发一种自动化、定量的评估框架,基于时间序列任务中的忠实度和鲁棒性对XAI方法进行排名。
- 重现并验证先前研究中SHAP在时间序列情境下表现最佳的结论。
- 为未来在时间序列数据上评估新型XAI方法建立一个可重复使用的基准框架。
提出的方法
- 通过修改其输入扰动和显著性计算策略,将原本用于图像和文本的XAI方法(如LIME、Integrated Gradients和SHAP)适配用于时间序列数据。
- 采用三阶段评估流程:在时间序列数据集上训练模型,通过Captum和原生实现生成归因,以及进行基于扰动的自动化验证。
- 应用基于扰动的指标来评估归因的忠实度:移除或屏蔽时间点,并通过测量预测变化来验证归因的相关性。
- 使用Docker化、隔离的实验容器,确保在多种模型架构、数据集和任务中具备可复现性和可扩展性。
- 引入ROAR(RemOve And Retrain)方法,通过在移除高归因时间点后评估模型性能,来测试XAI的鲁棒性。
- 扩展框架以支持新模型、数据集、XAI技术及验证方法的插件式接入,从而支持未来的基准测试。
实验结果
研究问题
- RQ1现有XAI归因方法能否成功迁移至时间序列数据,需要哪些修改?
- RQ2在系统评估时间序列任务中的XAI方法时,哪些指标和验证策略最为有效?
- RQ3不同XAI技术在分类、预测和回归任务中的忠实度和鲁棒性如何比较?
- RQ4SHAP是否如先前假设的那样,在所有时间序列任务中都是表现最强的XAI方法?
- RQ5XAI方法的输出在多大程度上对模型架构和数据分布敏感?
主要发现
- SHAP在所有时间序列任务中均表现出最高的忠实度和鲁棒性,支持了先前研究中的假设[26]。
- 基于扰动的评估表明,许多XAI方法(包括LIME和Integrated Gradients)在未对架构进行适配的情况下直接应用于原始时间序列时,会产生不可靠的归因。
- 该框架成功识别出方法特异性弱点,如对时间窗口划分和掩码策略的敏感性,尤其在预测和回归任务中表现明显。
- ROAR扩展方法有效检测出归因中的过拟合现象,表明某些方法在移除高归因点后会产生误导性解释。
- 基准框架在128个UCR时间序列分类数据集上实现了可复现的评估,且在多个模型和随机种子下保持一致的性能排名。
- 本研究证实,原始时间序列数据在XAI中需要特殊处理——仅使用傅里叶变换或简单预处理无法保持归因的可靠性,必须采用模型感知的评估方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。