Skip to main content
QUICK REVIEW

[논문 리뷰] High-Dimensional Conditionally Gaussian State Space Models with Missing Data

Joshua C. C. Chan, Aubrey Poon|arXiv (Cornell University)|2023. 02. 07.
Bayesian Modeling and Causal Inference인용 수 5
한 줄 요약

이 논문은 복잡한 누락 데이터 패턴을 가진 고차원 조건부 가우시안 상태공간 모형에 대해 정밀도 행렬의 희소성과 활용하여 한 번의 단계에서 모든 누락 관측치를 효율적으로 추출하는 정밀도 기반 MCMC 샘플링 방법을 제안한다. 이 방법은 대규모 베이지안 VAR 및 혼합 주파수 또는 비균형 패널 데이터를 포함한 동적 인자 모형에서 계산을 크게 가속화한다.

ABSTRACT

We develop an efficient sampling approach for handling complex missing data patterns and a large number of missing observations in conditionally Gaussian state space models. Two important examples are dynamic factor models with unbalanced datasets and large Bayesian VARs with variables in multiple frequencies. A key insight underlying the proposed approach is that the joint distribution of the missing data conditional on the observed data is Gaussian. Moreover, the inverse covariance or precision matrix of this conditional distribution is sparse, and this special structure can be exploited to substantially speed up computations. We illustrate the methodology using two empirical applications. The first application combines quarterly, monthly and weekly data using a large Bayesian VAR to produce weekly GDP estimates. In the second application, we extract latent factors from unbalanced datasets involving over a hundred monthly variables via a dynamic factor model with stochastic volatility.

연구 동기 및 목표

  • 혼합 주파수 데이터 및 비균형 패널과 같은 복잡한 누락 데이터 패턴을 가진 대규모 시계열 모형을 효율적으로 추정하는 데 도전한다.
  • 고차원 상태공간 모형에서 많은 수의 누락 관측치를 처리할 때 기존 칼만 필터 기반 방법의 계산적 한계를 극복한다.
  • 조건부 가우시안 상태공간 모형(예: 동적 인자 모형 및 다양한 기능을 가진 대규모 베이지안 VAR 포함)에 적용 가능한 모듈러하고 일반적인 샘플링 프레임워크를 개발한다.
  • 실시간 다주파수 데이터 소스를 강력한 통계 모델링과 통합함으로써 시기적절하고 종합적인 거시경제 분석을 가능하게 한다.
  • 완전 데이터 모델에 대한 빠른 추정 기법을 누락 데이터 설정으로 확장하여 계산 효율성을 유지하면서도 모델의 유연성을 유지한다.

제안 방법

  • 관측 데이터를 조건으로 하여 모든 누락 데이터를 한 번의 단계에서 추출하는 정밀도 기반 MCMC 샘플러를 제안하며, 조건부 분포의 가우시안 성질을 활용한다.
  • 누락 데이터 분포의 정밀도 행렬(역공분산)의 희소성과 띠형 구조를 활용하여 빠른 행렬 연산을 가능하게 한다.
  • Chan과 Jeliazkov(2009)의 정밀도 기반 샘플링 알고리즘을 고차원 상태공간 모형에 적용하여 계산 비용이 높은 칼만 필터링을 대체한다.
  • 시간에 따라 제약 조건이 존재하는 모형에서 전체 상태 경로(누락 관측치 포함)를 효율적으로 샘플링하기 위해 Durbin-Koopman 시뮬레이션 스무서를 적용한다.
  • 지연된 상태를 포함하도록 상태 벡터를 구성하고, 혼합 주파수 및 누락 데이터 제약 조건을 통합하기 위해 블록 구조의 전이 및 측정 행렬을 사용한다.
  • 완전 데이터 조건부 가우시안 상태공간 모형에 대해 효율적인 샘플러를 어떤 것도 통합할 수 있도록 모듈성을 확보하여 광범위한 적용 가능성을 확보한다.
Figure 1: Computation time of obtaining 10 draws against $n^{o}$ and $n^{m}$ , the numbers of observed and partially unobserved variables, respectively, with $T=300$ and $p=5$ . The four methods are: precision-based sampler with hard inter-temporal constraints (P-hard), precision-based sampler with
Figure 1: Computation time of obtaining 10 draws against $n^{o}$ and $n^{m}$ , the numbers of observed and partially unobserved variables, respectively, with $T=300$ and $p=5$ . The four methods are: precision-based sampler with hard inter-temporal constraints (P-hard), precision-based sampler with

실험 결과

연구 질문

  • RQ1복잡한 누락 데이터 패턴을 가진 고차원 상태공간 모형을 계산 비용이 높은 칼만 필터링에 의존하지 않고 효율적으로 추정할 수 있는 방법은 무엇인가?
  • RQ2누락 데이터의 정밀도 행렬의 희소성을 활용할 경우, 대규모 베이지안 VAR 및 동적 인자 모형에서 계산 속도 향상 정도는 어느 정도인가?
  • RQ3단일 단계 샘플링 접근법이 고차원 설정에서 MCMC 효율성과 수렴성 측면에서 순차적 또는 필터링 기반 방법보다 뛰어나게 성능을 발휘할 수 있는가?
  • RQ4제안된 방법은 혼합 주파수 데이터와 비균형 패널을 포함한 실제 거시경제 응용에서 어떻게 성능을 발휘하는가?
  • RQ5누락 데이터 패턴(예: 불규칙한 끝부분 또는 비정기적인 발표 일정)이 대규모 시계열 모형의 추정 효율성과 예측 정확도에 미치는 영향은 무엇인가?

주요 결과

  • 제안된 정밀도 기반 샘플러는 표준 칼만 필터 기반 방법에 비해 상당한 계산 속도 향상을 달성하며, 尤히 누락 관측치의 수가 많을 경우 두드러진다.
  • 관측 데이터를 조건으로 하여 누락 데이터의 결합 분포는 가우시안이며, 그 정밀도 행렬은 희소하고 띠형 구조를 가지므로 빠른 행렬 역행렬 계산과 샘플링이 가능하다.
  • 주간 GDP 추정 응용 사례에서, 모형은 분기별, 월별, 주간 데이터를 효과적으로 통합하여 대규모 베이지안 VAR를 활용해 고주파수 GDP 예측을 성공적으로 도출하였다.
  • 100개 이상의 월간 변수를 포함한 동적 인자 모형에서, 이 방법은 복잡한 누락 데이터 패턴을 가진 비균형 데이터셋으로부터 잠재 인자를 효과적으로 추출하였다.
  • MCMC 샘플의 비효율성 요소 분석 결과, 누락 데이터 및 모델 파라미터에 대한 샘플러는 합리적인 혼합 효율성을 보였으며, 대부분의 경우 중앙값 비효율성 요소가 10 이하였다.
  • 이 방법은 불규칙한 끝부분 데이터 패턴과 비동기적 데이터 발표 조건에서도 높은 추정 정확도와 강건성을 유지하며, 기존 방법에 비해 계산 확장성 측면에서 뛰어난 성능을 발휘하였다.
Figure 2: Computation time of obtaining 10 draws against $T$ and $p$ , the numbers of time periods and lags, respectively, with $n^{m}=5$ and $n^{o}=10$ . The four methods are: precision-based sampler with hard inter-temporal constraints (P-hard), precision-based sampler with soft constraints (P-sof
Figure 2: Computation time of obtaining 10 draws against $T$ and $p$ , the numbers of time periods and lags, respectively, with $n^{m}=5$ and $n^{o}=10$ . The four methods are: precision-based sampler with hard inter-temporal constraints (P-hard), precision-based sampler with soft constraints (P-sof

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.