Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating the electrical power output of industrial devices with end-to-end time-series classification in the presence of label noise

Andrea Castellani, Sebastian Schmitt|arXiv (Cornell University)|2021. 05. 01.
Time Series Analysis and Forecasting참고 문헌 65인용 수 23
한 줄 요약

이 논문은 산업용 전력 출력 추정에서 레이블 노이즈를 보정하기 위해 공유 표현을 갖는 시계열 분류기와 오토인코더를 공동으로 훈련하는 다중 작업 딥러닝 프레임워크인 임베딩 분석을 통한 자기 재라벨링(SREA)을 제안한다. SREA는 자기지도 학습 방식으로 고장 난 센서에서 오는 잘못 분류된 샘플을 효과적으로 탐지하고 재라벨링하며, 합성 및 실제 시간시계열 데이터 양측에서 최신 기술을 크게 능가한다. 이는 복합 열전력(CHP) 기계의 전력 예측을 포함한다.

ABSTRACT

In complex industrial settings, it is common practice to monitor the operation of machines in order to detect undesired states, adjust maintenance schedules, optimize system performance or collect usage statistics of individual machines. In this work, we focus on estimating the power output of a Combined Heat and Power (CHP) machine of a medium-sized company facility by analyzing the total facility power consumption. We formulate the problem as a time-series classification problem where the class label represents the CHP power output. As the facility is fully instrumented and sensor measurements from the CHP are available, we generate the training labels in an automated fashion from the CHP sensor readings. However, sensor failures result in mislabeled training data samples which are hard to detect and remove from the dataset. Therefore, we propose a novel multi-task deep learning approach that jointly trains a classifier and an autoencoder with a shared embedding representation. The proposed approach targets to gradually correct the mislabelled data samples during training in a self-supervised fashion, without any prior assumption on the amount of label noise. We benchmark our approach on several time-series classification datasets and find it to be comparable and sometimes better than state-of-the-art methods. On the real-world use-case of predicting the CHP power output, we thoroughly evaluate the architectural design choices and show that the final architecture considerably increases the robustness of the learning process and consistently beats other recent state-of-the-art algorithms in the presence of unstructured as well as structured label noise.

연구 동기 및 목표

  • 고장 난 센서에서 자동으로 생성된 레이블이 존재하는 산업 에너지 모니터링을 위한 시계열 분류 문제에서 레이블 노이즈를 다루는 것.
  • 노이즈 수준에 대한 사전 지식 없이 잘못 레이블링된 샘플을 탐지하고 보정할 수 있는 자기지도 학습 딥러닝 방법을 개발하는 것.
  • 센서 고장으로 인해 신뢰할 수 없는 훈련 데이터가 발생하는 실제 산업 환경에서 시계열 분류 모델의 강건성을 향상시키는 것.
  • 합성 노이즈로 오염된 벤치마크와 실제 센서 고장이 발생한 실세계 CHP 전력 출력 추정 사례에 대해 방법을 평가하는 것.
  • 초기화 조건과 하이퍼파ram터에 대한 민감도 분석을 통해 최적의 아키텍처 구성 요건을 규명하는 것.

제안 방법

  • SREA는 시계열 분류기와 오토인코더 모두에 공유 표현을 생성하는 공유 인코더를 갖는 다중 작업 학습 프레임워크를 사용한다.
  • 분류기는 공유 임베딩에서 CHP 전력 출력 클래스를 예측하고, 오토인코더는 동일한 임베딩에서 입력 시계열을 재구성한다.
  • 레이블 노이즈 보정은 모델의 신뢰도와 임베딩 공간의 구조를 기반으로 반복적으로 레이블을 재할당하는 자기 재라벨링 메커니즘을 통해 달성된다.
  • 초기에는 분류 손실에 높은 가중치를 두고, 점차 임베딩 공간 내의 재구성 및 일관성 우선 순위를 갖는 동적 손실 가중 전략을 사용한다.
  • 훈련 과정은 원래 레이블을 기반으로 분류기가 먼저 훈련되는 웜업 단계와 이후 양쪽 작업이 동시에 업데이트되는 공동 최적화 단계로 구성된다.
  • 이 프레임워크는 노이즈 비율에 대한 사전 지식 없이도 대칭적이고 비대칭적 레이블 노이즈, 플립 노이즈 모두에 강건하게 설계되어 있다.

실험 결과

연구 질문

  • RQ1자기지도 학습 다중 작업 학습 프레임워크는 산업 환경에서 센서 고장으로 인한 잘못 레이블링된 시계열 샘플을 효과적으로 탐지하고 보정할 수 있는가?
  • RQ2제안된 SREA 방법은 대칭, 비대칭, 플립 노이즈 등 다양한 유형의 레이블 노이즈 하에서 최신 기술 시계열 분류 모델과 비교해 어떻게 성능을 내는가?
  • RQ3입력 신호 선택(예: 총 전력, 실외 온도, 물 온도)은 레이블 노이즈 존재 상황에서 모델 성능에 어떤 영향을 미치는가?
  • RQ4SREA 모델은 초기 손실 가중치와 재구성 손실 조정 스케줄에 대해 얼마나 민감한가?
  • RQ5제어된 합성 노이즈 외에도, 비정형적이고 예측 불가능한 센서 고장이 발생하는 실세계 산업 데이터에 대해 SREA는 일반화 가능한가?

주요 결과

  • 합성 노이즈로 오염된 벤치마크에서 SREA는 MixUp-BMM, Co-teaching, SIGUA와 같은 기존 방법들을 능가하는 최신 기술 수준의 성능을 기록했으며, 특히 높은 노이즈 비율에서 두각을 나타냈다.
  • 비대칭 레이블 노이즈 30% 조건에서 SREA는 CHP 데이터셋에서 F1-스코어 0.921을 달성했으며, 다음으로 우수한 성능을 보인 Co-teaching(0.871)를 크게 앞섰다.
  • 실세계 평가에서 SREA는 9월 19일 PCHP 센서 고장 기간을 정확히 재라벨링했고, 다른 활성 CHP 단계도 탐지하여 실제 센서 고장 상황에서도 강건성을 입증했다.
  • 제거 분석 결과, 총 전력(Ptot), 실외 온도(Tamb), 물 온도(Twater)의 세 신호를 모두 포함할 경우 성능이 가장 높았으며, 대칭 노이즈 조건에서 F1-스코어 0.978를 기록하여 多모달 입력의 중요성을 확인했다.
  • 하이퍼파ram터 분석 결과, λinit = 40 및 ∆end = 30 조합이 다양한 노이즈 유형에서 가장 안정적인 성능을 보였으며, ∆start에 대한 민감도가 최소였다.
  • 보정 후 혼동 행렬은 거의 완벽한 클래스 분포를 보였으며, 97.8%의 샘플이 정확히 분류되어 효과적인 노이즈 보정이 이루어졌음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.