Skip to main content
QUICK REVIEW

[論文レビュー] Time Series Structure Discovery via Probabilistic Program Synthesis

Ulrich Schaechtle, Feras A. Saad|arXiv (Cornell University)|Nov 21, 2016
Time Series Analysis and Forecasting参考文献 11被引用数 6
ひとこと要約

本稿では、時間系列構造同定のための確率的プログラム合成フレームワークを紹介する。これは、抽象構文木(AST)とVentureにおける確率的プログラムを用いて、自動ベイジアン共分散同定(ABCD)を再定式化したものである。実世界の経済時系列データにおいて、正確な補間と外挿を達成しており、70行の実装で非パラメトリックおよび標準的回帰ベースラインを上回る性能を発揮するとともに、非パラメトリッククラスタリングのための追加コードが10行未満で可能であり、柔軟かつ拡張可能なモデル同定を可能にしている。

ABSTRACT

There is a widespread need for techniques that can discover structure from time series data. Recently introduced techniques such as Automatic Bayesian Covariance Discovery (ABCD) provide a way to find structure within a single time series by searching through a space of covariance kernels that is generated using a simple grammar. While ABCD can identify a broad class of temporal patterns, it is difficult to extend and can be brittle in practice. This paper shows how to extend ABCD by formulating it in terms of probabilistic program synthesis. The key technical ideas are to (i) represent models using abstract syntax trees for a domain-specific probabilistic language, and (ii) represent the time series model prior, likelihood, and search strategy using probabilistic programs in a sufficiently expressive language. The final probabilistic program is written in under 70 lines of probabilistic code in Venture. The paper demonstrates an application to time series clustering that involves a non-parametric extension to ABCD, experiments for interpolation and extrapolation on real-world econometric data, and improvements in accuracy over both non-parametric and standard regression baselines.

研究の動機と目的

  • ABCDのような既存の時間系列構造同定手法の脆弱性と拡張性の限界を解消すること。
  • 確率的プログラミングを用いて、解釈可能な共分散構造の堅牢でスケーラブルかつ拡張可能な同定を可能にすること。
  • ガウス過程モデルのための、モデル事前分布、尤度関数、探索戦略を統合した単一の確率的プログラム合成フレームワークを構築すること。
  • 非パラメトリックおよび標準的回帰ベースラインと比較して、実世界の経済時系列データにおいて補間および外挿の性能が競争可能であることを示すこと。
  • 最小限のコード変更で時間系列の非パラメトリッククラスタリングを可能にし、合成および実データから真のグループ化を回復できること。

提案手法

  • 時間系列モデルをドメイン特化確率的言語内で抽象構文木(AST)として表現し、モデル構造の記号的取り扱いや探索を可能にする。
  • 共分散カーネル(例:線形、周期的、ホワイトノイズ)の文法から候補モデル構造をサンプリングする生成的AST事前分布を定義する。
  • ASTインタプリタを用いて、ASTをVenture確率的プログラミング言語における実行可能プログラムにコンパイルする。
  • メトロポリス・ハスティングス法と勾配ベース最適化を組み合わせた合成戦略を用いて、AST、ハイパーパramータ、モデル構造の同時後確率分布として全推論問題を定式化する。
  • モデル尤度関数と事前分布を統合した単一の確率的プログラムを構築し、モデル構造とハイパーパramータのベイズ推論を可能にする。
  • 非パラメトリッククラスタリング拡張において、Ventureの推論エンジンを活用して、モデル構造、ハイパーパramータ、クラスタ識別子の同時推論を実行する。

実験結果

リサーチクエスチョン

  • RQ1確率的プログラム合成を用いて、時間系列構造同定のためのABCDフレームワークを再定式化し、改善することは可能か?
  • RQ2合成戦略において勾配ベース最適化とMCMCサンプリングを組み合わせることで、モデル同定の正確性と頑健性にどのような影響を与えるか?
  • RQ3最小限のコード変更で、共通の共分散構造を持つ時間系列の非パラメトリッククラスタリングにこのフレームワークをどの程度拡張できるか?
  • RQ4合成されたモデルの予測性能は、実世界の時間系列データにおいて非パラメトリックおよび標準的回帰ベースラインと比較してどの程度か?
  • RQ5複雑な合成カーネル状況下で、後確率分布のモデル平均化とMAP構造の使用とでは、予測正確性にどのような影響があるか?

主な発見

  • 実世界の補間および外挿タスクにおいて、競争可能な予測性能を達成しており、ガウス過程モデルが航空機乗客数および太陽放射データのトレンドと周期性を正確に捉えている。
  • 4つの実世界データセットからのホールドアウトデータにおいて、確率的プログラム合成によるGPモデルは、非パラメトリックおよび標準的機械学習ベースラインを下回る平均二乗誤差(RMSE)を達成しており、ベースラインを1.0として標準化済み。
  • 4つの合成時間系列(線形2つ、周期的2つ)の真のパーティショニングを、たった64個の後確率的サンプルで、構造・ハイパーパramータ・クラスタ識別子の同時推論により回復した。
  • 後確率分布のモデル平均化は、MAP構造の使用を上回り、特にMAP推定が誤りとなる複雑な合成カーネル状況下で顕著に優れた性能を示した。
  • ABCDを非パラメトリッククラスタリング手法に拡張するには、10行未満のコード変更で実現可能であり、フレームワークの高い拡張性と組み合わせ可能性を示している。
  • 全実装はVentureコードでたった69行で実現されており、ABCD(4,166行)およびGPML Toolbox(13,945行)と比較して、著しくコードの複雑さが低減されており、フレームワークの簡潔さと保守性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。