Skip to main content
QUICK REVIEW

[논문 리뷰] RDIS: Random Drop Imputation with Self-Training for Incomplete Time Series Data

Tae-Min Choi, Jisu Kang|arXiv (Cornell University)|2020. 10. 20.
Data Stream Mining Techniques참고 문헌 38인용 수 6
한 줄 요약

이 논문은 랜덤 드롭 인paint링(RDI)과 엔트로피 기반 가짜 값 필터링을 조합하여 완전하지 않은 시계열 데이터를 보완하기 위한 새로운 자기학습 프레임워크인 RDIS를 제안한다. RDIS는 관측된 값을 무작위로 제거하여 학습시키며, 높은 신뢰도를 가진 가짜 값을 활용해 성능을 햖थ하고, 실제 공기질 및 가스 센서 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Time-series data with missing values are commonly encountered in many fields, such as healthcare, meteorology, and robotics. The imputation aims to fill the missing values with valid values. Most imputation methods trained the models implicitly because missing values have no ground truth. In this paper, we propose Random Drop Imputation with Self-training (RDIS), a novel training method for time-series data imputation models. In RDIS, we generate extra missing values by applying a random drop on the observed values in incomplete data. We can explicitly train the imputation models by filling in the randomly dropped values. In addition, we adopt self-training with pseudo values to exploit the original missing values. To improve the quality of pseudo values, we set the threshold and filter them by calculating the entropy. To verify the effectiveness of RDIS on the time series imputation, we test RDIS to various imputation models and achieve competitive results on two real-world datasets.

연구 동기 및 목표

  • 결측값에 대한 진짜 정답이 없을 때 보간 모델을 훈련하는 데 도전하는 것.
  • 관측된 값을 무작위로 제거하여 인위적인 결측 데이터를 생성함으로써 보간 모델의 명시적 훈련을 가능하게 하는 것.
  • 가짜 값과 함께 자기학습을 활용하여 고결측률 상황에서 일반화 능력을 향상시키고 과적합을 줄이는 것.
  • 엔트로피 기반 신뢰도 스코어링을 사용하여 낮은 신뢰도의 가짜 값을 효과적으로 필터링하는 신뢰할 수 있는 방법을 개발하는 것.
  • RDIS의 효과성을 다양한 딥러닝 아키텍처와 실제 시계열 데이터셋에서 입증하는 것.

제안 방법

  • RDI는 완전하지 않은 시계열에서 관측된 값을 무작위로 제거하여 증강된 훈련 데이터를 생성함으로써 명시적 보간 훈련을 가능하게 한다.
  • 다양한 RDI로 훈련된 모델들에 대해 앙상블 학습을 적용하여 강건성과 성능을 향상시킨다.
  • 기존의 결측값을 활용하기 위해 사전 훈련된 모델로부터 가짜 값을 생성함으로써 자기학습을 도입한다.
  • 가짜 값은 엔트로피 기반 신뢰도 스코어링을 통해 필터링된다: 낮은 엔트로피는 높은 신뢰도와 신뢰성을 의미한다.
  • 최종 모델은 관측된 값과 높은 신뢰도의 가짜 값의 조합으로 훈련되며, 가짜 값은 주기적으로 업데이트된다.
  • 가짜 값 선택을 위해 분산(엔트로피의 대체 지표)에 기반한 임계값을 사용하여 신뢰할 수 있는 가짜 값만을 훈련에 포함시킨다.

실험 결과

연구 질문

  • RQ1랜덤 드롭 인페인팅(RDI)이 관측된 값을 무작위로 제거함으로써 인위적인 결측 데이터를 생성함으로써 시계열 보간 모델의 명시적 훈련을 가능하게 할 수 있는가?
  • RQ2엔트로피로 필터링된 가짜 값과 함께 자기학습을 적용할 경우 실제 결측 데이터에 대한 보간 성능 향상이 얼마나 효과적인가?
  • RQ3RDI의 최적의 랜덤 드롭 비율은 무엇인가? 이는 다양한 결측률에서 보간 정확도를 최대화하기 위한 것이다.
  • RQ4가짜 값 업데이트 빈도는 모델 수렴과 성능에 어떤 영향을 미치는가?
  • RQ5RDIS는 다변량 실생활 시계열 데이터셋에서 기존 최신 기술 수준(SOTA) 방법들을 일관되게 능가할 수 있는가?

주요 결과

  • RDIS는 공기질 데이터셋과 가스 센서 데이터셋 양쪽에서 최신 기술 수준(SOTA)의 성능을 달성하여 기존 방법들을 크게 능가했다.
  • 공기질 데이터셋에서 RDIS는 30% 랜덤 드롭 비율에서 MSE를 0.2091로 줄여 기준 모델을 능가했다.
  • 가스 센서 데이터셋에서 RDIS는 20% 랜덤 드롭 비율에서 최저 MSE 0.0278을 기록했다.
  • 절단 실험에서 RDIS는 RDI 및 기준 모델보다 일관되게 성능 향상을 보였으며, 특히 높은 결측률(예: 50%) 상황에서 두드러졌다.
  • 엔트로피 기반 필터링은 낮은 분산(낮은 엔트로피)을 가진 가짜 값에서 더 높은 정확도를 보이며 신뢰할 수 있는 가짜 값을 효과적으로 식별했다.
  • 업데이트 에포크 수 400이 최적의 균형을 이뤘으며, 너무 자주 또는 너무 드물게 업데이트할 경우 성능이 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.