Skip to main content
QUICK REVIEW

[논문 리뷰] CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation

Yusuke Tashiro, Jiaming Song|arXiv (Cornell University)|2021. 07. 07.
Mental Health Research Topics인용 수 172
한 줄 요약

CSDI는 관찰된 값을 자기지도 학습 및 주의 기반 아키텍처를 활용하여 기존 방법보다 우수하게 성능을 발휘하는 확률적 시계열 보간을 위한 조건부 점수 기반 확산 접근법을 도입합니다.

ABSTRACT

The imputation of missing values in time series has many applications in healthcare and finance. While autoregressive models are natural candidates for time series imputation, score-based diffusion models have recently outperformed existing counterparts including autoregressive models in many tasks such as image generation and audio synthesis, and would be promising for time series imputation. In this paper, we propose Conditional Score-based Diffusion models for Imputation (CSDI), a novel time series imputation method that utilizes score-based diffusion models conditioned on observed data. Unlike existing score-based approaches, the conditional diffusion model is explicitly trained for imputation and can exploit correlations between observed values. On healthcare and environmental data, CSDI improves by 40-65% over existing probabilistic imputation methods on popular performance metrics. In addition, deterministic imputation by CSDI reduces the error by 5-20% compared to the state-of-the-art deterministic imputation methods. Furthermore, CSDI can also be applied to time series interpolation and probabilistic forecasting, and is competitive with existing baselines. The code is available at https://github.com/ermongroup/CSDI.

연구 동기 및 목표

  • 의료, 환경, 금융 분야에서 결측값이 있는 다변량 시계열의 견고한 보간을 촉진한다.
  • 대체로 근사하지 않고 보간을 위한 조건부 분포를 학습하는 조건부 확산 모델을 개발한다.
  • 조건화 및 주의 메커니즘을 통해 관찰된 데이터를 활용하여 시계열의 시간적 및 특징 의존성을 포착한다.
  • 실제 값이 결측된 경우를 가지지 않는 학습이 가능하도록 자기지도 학습 프레임워크를 제공한다.
  • 보간, 삽입 및 확률적 예측에의 적용 가능성을 입증하면서 기준 방법들을 능가한다.

제안 방법

  • 조건부 디노이징 확산 확률 모델(DDPM)을 채택하여 p(x_t-1^ta | x_t^ta, x_0^co)를 명시적으로 모델링하고, 조건부 디노이징 함수 epsilon_theta를 사용한다.
  • 역확률 과정을 mu_theta와 sigma_theta로 매개화하며, mu_theta는 x_t^ta와 조건 관찰 x_0^co를 사용하는 조건부 DDPM 디노이저로 구성된다.
  • 학습 중 관찰값을 보간 대상과 조건 관찰값으로 분할하여 마스킹된 언어 모델링에서 영감을 받은 자기지도 학습 스키마를 통합한다.
  • 시계열 데이터 내의 시간적 및 특징 의존성을 포착하기 위하여 2차원 주의 메커니즘(시간적 Transformer 및 특징 Transformer)을 사용한다.
  • 시간 임베딩 및 범주형 특징 임베딩을 포함한 사이드 정보를 제공하여 시간적 및 특징 맥락을 강화한다.
  • 입력 공간을 고정하기 위한 제로 패딩을 허용하고 관측된 인덱스를 나타내는 조건부 마스크를 도입하여 모델의 고정 형태 조건화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1다변량 시계열에서 결측값을 보간하기 위한 정확한 조건부 분포를 조건부 확산 모델이 학습할 수 있는가?
  • RQ2관측값에 조건을 두고 자기지도 학습 학습을 적용하는 것이 무조건적 확산 모델 및 자기회귀 베이스라인에 비해 확률적 및 결정적 보간을 개선하는가?
  • RQ3의료 및 환경 데이터셋에서 확률적 보간, 결정적 보간, 보간 및 예측에 대해 CSDI의 성능은 최첨단 방법과 비교하여 어떻게 되는가?
  • RQ4어떤 아키텍처 선택(주의 메커니즘, 사이드 정보, 대상 전략)이 보간 품질과 효율성에 가장 큰 영향을 미치는가?

주요 결과

  • CSDI는 확률적 보간에서 현저한 개선을 달성하여 의료 및 대기질 데이터셋에서 CRPS를 기준선 대비 40-65% 감소시킨다.
  • CSDI를 이용한 결정적 보간은 최신의 결정적 방법들에 비해 MAE를 5-20% 감소시킨다.
  • CSDI는 시계열 보간 및 확률적 예측에 효과적이며 종종 특화된 베이스라인과 경쟁하거나 우수하다.
  • 타깃 선택 전략을 활용한 자기지도 학습은 실제 그라운드 트루스 결측값 없이 학습을 가능하게 하여 강건한 조건부 모델링을 가능하게 한다.
  • 명시적 조건부 확산 프레임워크는 보간 작업에서 무조건적 확산 방식보다 관찰된 데이터를 더 잘 활용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.