Skip to main content
QUICK REVIEW

[论文解读] Explainable Failure Predictions with RNN Classifiers based on Time Series Data

Ioana Giurgiu, Anika Schumann|arXiv (Cornell University)|Jan 20, 2019
Time Series Analysis and Forecasting参考文献 31被引用 5
一句话总结

本文提出了一种基于注意力机制的可解释RNN分类器,通过将脉冲状的遥测数据转换为聚类后的异常事件,并利用注意力机制量化每个事件对故障预测的贡献,从而基于时间序列KPI预测存储系统故障。在真实世界数据上的评估表明,该模型在保持与标准RNN相当的预测准确率的同时,提供了可操作且可解释的关键故障指示事件分析。

ABSTRACT

Given key performance indicators collected with fine granularity as time series, our aim is to predict and explain failures in storage environments. Although explainable predictive modeling based on spiky telemetry data is key in many domains, current approaches cannot tackle this problem. Deep learning methods suitable for sequence modeling and learning temporal dependencies, such as RNNs, are effective, but opaque from an explainability perspective. Our approach first extracts the anomalous spikes from time series as events and then builds an RNN classifier with attention mechanisms to embed the irregularity and frequency of these events. A preliminary evaluation on real world storage environments shows that our approach can predict failures within a 3-day prediction window with comparable accuracy as traditional RNN-based classifiers. At the same time it can explain the predictions by returning the key anomalous events which led to those failure predictions.

研究动机与目标

  • 解决利用高粒度时间序列遥测数据预测存储系统中罕见但关键故障的挑战。
  • 开发一种可解释的AI模型,为领域专家等人类用户提供故障预测的可读性洞察。
  • 克服LIME等事后可解释性方法在时间序列数据上产生的噪声和不精确解释的局限性。
  • 利用注意力机制和事件聚类,建模异常事件的时间演变过程——特别是其频率和新近性。
  • 在3天预测窗口内实现可靠的故障预测,同时量化单个异常事件对预测的贡献。

提出的方法

  • 使用基于阈值的检测方法识别时间序列KPI中的异常事件:$ KPI_{val}^{t} > threshold $。
  • 使用Ckmeans.1d.dp算法对时间上邻近的异常事件进行聚类,以识别事件窗口。
  • 将每种独特的异常事件类型嵌入连续向量空间,以捕捉其语义和功能特征。
  • 应用注意力机制,聚合每个聚类内事件的上下文信息,根据其对故障预测的相关性对事件进行加权。
  • 构建一个时间进展函数,基于事件类型和发生时间量化每个事件的影响,强调其新近性和频率。
  • 使用注意力得分将每个事件窗口表示为嵌入事件的加权和,然后将这些表示输入LSTM以进行故障预测。

实验结果

研究问题

  • RQ1基于注意力机制的RNN分类器能否在提供可解释性解释的同时,有效利用时间序列KPI预测存储系统故障?
  • RQ2与标准RNN相比,建模异常事件的不规则性和频率是否能提升故障预测的准确率和可解释性?
  • RQ3注意力机制在多大程度上有助于识别并量化单个异常事件对故障预测的贡献?
  • RQ4所提出的方法能否在性能上优于或至少匹配传统RNN,同时提供有意义且人类可读的解释?
  • RQ5对时间间隔敏感的异常事件表示如何增强模型检测潜在故障的能力?

主要发现

  • 所提出的模型在3天预测窗口内预测存储故障时,达到了与传统RNN分类器相当的预测准确率。
  • 该模型成功识别并突出显示了对故障预测贡献最大的关键异常事件,例如后端写入响应时间峰值或读取响应时间峰值。
  • 注意力机制使模型能够为历史事件分配有意义的权重,近期和频繁发生的异常事件贡献更高,例如在105分钟窗口内,两次后端写入响应时间峰值事件的贡献值达到0.06。
  • 该方法通过聚焦于聚类后语义明确的事件,而非原始时间序列片段,减少了LIME等事后解释技术产生的噪声和不精确性。
  • 该方法有效建模了真实遥测数据中常见的突发性、不规则事件模式,而传统RNN由于对事件间时间间隔不敏感,往往难以捕捉此类模式。
  • 该模型通过将特定事件类型及其时间聚类与故障风险相关联,提供了可操作的洞察,支持主动维护决策。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。