[논문 리뷰] SCANIA Component X Dataset: A Real-World Multivariate Time Series Dataset for Predictive Maintenance
이 논문은 예측 정비 연구를 위한 공개된 실세계 다변량 시계열 데이터셋인 SCANIA Component X 데이터셋을 소개한다. 이 데이터셋은 익명화된 중장비 트럭 엔진에서 유래한 것으로, 기계 학습 기반 정비 예측 작업을 위한 분류, 회귀, 생존 분석, 이상 탐지 등의 고도화된 작업을 가능하게 하며, 실세계 운영 데이터, 수리 기록, 차량 사양을 포함한다. 또한 산업적 우선순위를 반영하기 위해 특수하게 설계된 비용 민감도 평가 프레임워크를 제공한다.
Predicting failures and maintenance time in predictive maintenance is challenging due to the scarcity of comprehensive real-world datasets, and among those available, few are of time series format. This paper introduces a real-world, multivariate time series dataset collected exclusively from a single anonymized engine component (Component X) across a fleet of SCANIA trucks. The dataset includes operational data, repair records, and specifications related to Component X, while maintaining confidentiality through anonymization. It is well-suited for a range of machine learning applications, including classification, regression, survival analysis, and anomaly detection, particularly in predictive maintenance scenarios. The dataset's large population size, diverse features (in the form of histograms and numerical counters), and temporal information make it a unique resource in the field. The objective of releasing this dataset is to give a broad range of researchers the possibility of working with real-world data from an internationally well-known company and introduce a standard benchmark to the predictive maintenance field, fostering reproducible research.
연구 동기 및 목표
- 예측 정비(PdM) 분야에서 실세계 다변량 시계열 데이터셋이 부족한 문제를 해결하기 위해.
- 재현 가능한 연구와 방법 비교를 가능하게 하기 위해 국제적으로 인정받는 OEM(SCRIBE)에서 제공하는 기준 데이터셋을 제공하기 위해.
- 실세계 운영 및 유지보수 데이터를 활용해 분류, 회귀, 생존 분석, 이상 탐지 등 다양한 기계 학습 작업을 지원하기 위해.
- 실제 비용과 운영 영향을 반영하기 위해 잘못된 음성 결과(실패를 놓침)에 대해 잘못된 양성 결과(불필요한 점검)보다 훨씬 더 높은 벌점을 적용하는 특수 비용 함수를 통해 산업적 우선순위를 반영하기 위해.
- 실세계 운행 조건에서 수집된 실제 트럭 데이터를 통해 산업계와 학계 간의 협력을 촉진하기 위해.
제안 방법
- 이 데이터셋은 세 가지 핵심 데이터 소스로 구성된다: 차량 내 센서에서 수집한 운영 데이터(14개 변수, 198,140개 읽기값), 정비소에서 기록한 수리 기록(실패 상태 레이블 포함), 트럭 사양(범주형 특성 포함).
- 시간 정보는 시계열 읽기값을 통해 유지되어 점진적인 고장 진행 상황과 열화 패턴을 모델링할 수 있다.
- 기밀 정보를 보호하기 위해 데이터는 익명화되었으며, 구성 요소 이름 및 민감한 식별자만 제거되었고, 데이터 무결성과 기밀성은 유지되었다.
- 데이터셋은 훈련, 검증, 테스트 세트로 구조화되어 있으며, 테스트 레이블은 IDA 2024 산업 도전 대회 동안 보관된다.
- 비용 민감도 평가 프레임워크는 5개 클래스의 혼동 행렬(클래스 0–4)을 사용하며, 잘못된 분류 비용이 비대칭적이며 실세계 재정적 및 운영적 영향을 반영한다.
- 식 (1)은 총 비용을 개별 비용 항목의 합으로 정의한다: $Total\_cost = \sum_{n,m} Cost_{n,m} \times No\_instances$이며, 잘못된 음성 결과(예: Cost_4_0 = 500)에 대해 더 높은 벌점을 적용한다.

실험 결과
연구 질문
- RQ1실세계 다변량 시계열 데이터를 사용하여 기계 학습 모델이 Component X의 임박한 고장을 얼마나 효과적으로 예측할 수 있는가?
- RQ2시간에 따른 열화 패턴을 통합할 경우, 정적 또는 비시간 기반 모델 대비 고장 예측 성능이 얼마나 향상되는가?
- RQ3비용 민감도 평가 지표는 실세계 PdM 시나리오에서 모델 선택과 성능에 어떤 영향을 미치는가?
- RQ4이 데이터셋은 다양한 연구 팀 간의 예측 정비 모델 비교를 위한 신뢰할 수 있는 기준 데이터셋으로 기능할 수 있는가?
- RQ5중장비 트럭 엔진에서 구성 요소 고장을 가장 잘 예측할 수 있는 핵심 특성과 신호 패턴은 무엇인가?
주요 결과
- 데이터셋은 5,045대의 고유 차량에서 유래한 198,140개의 운영 읽기값을 포함하고 있으며, 모든 특성에서 1% 미만의 결측치를 보이며 높은 데이터 품질과 활용 가능성을 보장한다.
- 테스트 세트의 레이블은 IDA 2024 산업 도전 대회 동안 보관되며, 대회 후 최종 레이블이 공개되어 공정한 평가를 보장한다.
- 비용 함수는 잘못된 음성 예측(예: Cost_4_0 = 500)에 대해 잘못된 양성 예측(예: Cost_0_1 = 7)보다 훨씬 더 높은 벌점을 적용하여, 감지되지 않은 고장의 높은 비용을 반영한다.
- 이 데이터셋은 CC BY 4.0 라이선스 하에 공개되어 있어 예측 정비 분야에서 넓은 접근성과 재현 가능한 연구를 가능하게 한다.
- 실세계 데이터, 다변량 시계열 구조, 시간에 따른 열화 모델링을 결합한 유일한 특성 덕분에 이전의 APS 데이터셋과는 달리 시간 순서가 없는 점을 감안할 때 앞서는 데이터셋이다.
- 풍부한 시간적 및 다변량 구조 덕분에 이 데이터셋은 생존 분석, 잔여 수명 추정을 위한 회귀, 이상 탐지 등 예측 정비 작업의 광범위한 응용을 지원한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.