[论文解读] SCANIA Component X Dataset: A Real-World Multivariate Time Series Dataset for Predictive Maintenance
本文介绍了SCANIA Component X数据集,这是一个公开可用的真实世界多变量时间序列数据集,源自匿名化的重型卡车发动机,专为预测性维护研究而设计。该数据集支持使用真实运行数据、维修记录和车辆规格进行高级机器学习任务,如分类、回归、生存分析和异常检测,并采用自定义的代价敏感评估框架,以反映工业优先事项。
Predicting failures and maintenance time in predictive maintenance is challenging due to the scarcity of comprehensive real-world datasets, and among those available, few are of time series format. This paper introduces a real-world, multivariate time series dataset collected exclusively from a single anonymized engine component (Component X) across a fleet of SCANIA trucks. The dataset includes operational data, repair records, and specifications related to Component X, while maintaining confidentiality through anonymization. It is well-suited for a range of machine learning applications, including classification, regression, survival analysis, and anomaly detection, particularly in predictive maintenance scenarios. The dataset's large population size, diverse features (in the form of histograms and numerical counters), and temporal information make it a unique resource in the field. The objective of releasing this dataset is to give a broad range of researchers the possibility of working with real-world data from an internationally well-known company and introduce a standard benchmark to the predictive maintenance field, fostering reproducible research.
研究动机与目标
- 为解决预测性维护(PdM)在工业应用中缺乏公开可用的真实世界多变量时间序列数据集这一关键问题。
- 提供来自国际知名原始设备制造商(SCANIA)的基准数据集,以支持预测性维护研究中的可重现性研究和方法比较。
- 通过真实运行和维护数据,支持包括分类、回归、生存分析和异常检测在内的多样化机器学习任务。
- 通过自定义代价函数反映工业优先事项,该函数对假阴性(漏报故障)的惩罚远高于假阳性(不必要的检查)。
- 通过发布从真实卡车在真实运行条件下采集的数据集,促进产业界与学术界的协作。
提出的方法
- 该数据集包含三个核心数据源:来自车载传感器的运行数据(14个变量,198,140次读数)、来自维修车间的维修记录(标记的故障状态)以及卡车规格(类别特征)。
- 通过时间序列读数保留时间信息,支持对随时间推移的渐进性退化和故障发展过程进行建模。
- 数据已匿名化以保护专有信息,移除了部件名称和敏感标识符,同时保持数据完整性和保密性。
- 数据集被划分为训练集、验证集和测试集,其中测试集标签在IDA 2024工业挑战赛期间保持隐藏。
- 定义了基于五分类混淆矩阵(类别0–4)的代价敏感评估框架,其中误分类代价为非对称,反映实际的财务和运营后果。
- 公式(1)将总代价定义为各项代价之和:$Total\_cost = \sum_{n,m} Cost_{n,m} \times No\_instances$,其中对假阴性(如Cost_4_0 = 500)施加更高惩罚。

实验结果
研究问题
- RQ1机器学习模型在使用真实世界多变量时间序列数据预测Component X即将发生故障方面的有效性如何?
- RQ2与静态或非时间序列模型相比,整合时间退化模式在多大程度上能提升故障预测性能?
- RQ3代价敏感评估指标在真实世界PdM场景中如何影响模型选择与性能?
- RQ4该数据集能否作为不同研究团队之间比较预测性维护模型的可靠基准?
- RQ5在重型卡车发动机中,哪些关键特征和信号模式最能有效预测部件故障?
主要发现
- 该数据集包含来自5,045辆不同车辆的198,140次运行读数,所有特征的缺失值少于1%,确保了高质量和可用性。
- 测试集标签在IDA 2024工业挑战赛期间保持隐藏,最终标签将在挑战赛后公布,以确保评估的公平性。
- 代价函数对假阴性预测(如Cost_4_0 = 500)施加了显著更高的惩罚,远高于假阳性(如Cost_0_1 = 7),反映了未检测到故障的高昂成本。
- 该数据集以CC BY 4.0许可公开发布,支持广泛获取和预测性维护领域的可重现研究。
- 该数据集因其真实世界数据、多变量时间序列结构以及时间退化建模的结合而独具特色,超越了以往如APS数据集等缺乏时间序列顺序的数据集。
- 由于其丰富的时间序列和多变量结构,该数据集支持广泛的PdM任务,包括生存分析、剩余使用寿命估计的回归分析以及异常检测。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。