Skip to main content
QUICK REVIEW

[論文レビュー] Change-point detection for multivariate and non-Euclidean data with local dependency

Hao Chen|arXiv (Cornell University)|Mar 5, 2019
Bayesian Methods and Mixture Models参考文献 20被引用数 4
ひとこと要約

本稿では、局所的依存構造を有する多次元および非ユークリッドデータにおける変化点検出を改善するため、ランダムな開始位置を持つ円形ブロック順列を提案する。この順列スキームを非パラメトリックなグラフベースのスキャン統計枠組みに統合することで、局所的依存下でも第一種過誤を制御しつつ高い検出力が得られ、長大な系列においても計算を効率化する解析的p値近似が可能となる。

ABSTRACT

In a sequence of multivariate observations or non-Euclidean data objects, such as networks, local dependence is common and could lead to false change-point discoveries. We propose a new way of permutation -- circular block permutation with a random starting point -- to address this problem. This permutation scheme is studied on a non-parametric change-point detection framework based on a similarity graph constructed on the observations, leading to a general framework for change-point detection for data with local dependency. Simulation studies show that this new framework retains the same level of power when there is no local dependency, while it controls type I error correctly for sequences with and without local dependency. We also derive an analytic p-value approximation under this new framework. The approximation works well for sequences with length in hundreds and above, making this approach fast-applicable for long data sequences.

研究の動機と目的

  • 観測値に局所的依存が見られる状況において、従来の順列に基づく非パラメトリックな変化点検出手法が第一種過誤を著しく上昇させることを是正すること。
  • ネットワークや多次元時系列などの高次元または非ユークリッドデータにおける変化点検出のための一般化された非パラメトリック枠組みを構築すること。
  • 独立性下では同じ検出力を維持しつつ、局所的依存に起因する誤検出を是正すること。
  • 長大な系列においても計算が高速に行える、解析的p値近似を導出すること。
  • 円形ブロック順列スキームにおける最適なブロックサイズの選定基準を実用的に提供すること。

提案手法

  • 局所的依存構造を再サンプリング時に保持するため、ランダムな開始位置を持つ円形ブロック順列を導入する。
  • プールされた観測値に基づく類似性グラフを構築し、その上でエッジカウント検定をスキャン統計枠組みに適応する。
  • 新しい順列スキーム下で、すべての可能な変化点位置における最大スキャン統計量を検定統計量として用いる。
  • 長さが数百以上である系列に対して有効な、検定統計量の解析的p値近似を導出する。
  • 増加するブロックサイズにおける最大スキャン統計量の収束に基づき、ブロックサイズ選択ルールを採用する。
  • 二分木または円形二分分割を用いた再帰的応用により、単一変化点手法を複数変化点検出に拡張する。

実験結果

リサーチクエスチョン

  • RQ1局所的依存が、順列に基づく従来の非パラメトリックな変化点検出手法の性能にどのように影響を与えるか。
  • RQ2修正された順列スキームが、局所的依存構造を保持しつつ、第一種過誤の制御を適切に行えるか。
  • RQ3ブロックサイズが、局所的依存下での検定統計量の正確性および安定性に与える影響は何か。
  • RQ4長大な系列においても正確かつ計算効率が良い解析的p値近似を導出できるか。
  • RQ5提案された枠組みを、複雑なデータタイプにおける複数変化点検出にどのように拡張できるか。

主な発見

  • 提案されたランダムな開始位置を持つ円形ブロック順列は、独立および局所的依存の両方のデータ下で第一種過誤を適切に制御するが、標準的な順列手法とは異なり、そのような制御が不十分である。
  • 観測値が独立である場合には、元の手法と同等の検出力を維持する。
  • 長さ100以上の系列に対して、解析的p値近似は高い正確性を示し、多数の再サンプリングを要せず高速な計算が可能となる。
  • ブロックサイズが増加するに従い、最大スキャン統計量は安定化し、比基準(例:比 > 0.99)を用いて依存構造を十分に捉えたブロックサイズの閾値を特定できる。
  • 自己回帰的多次元時系列およびネットワークデータにおいても、強い自己相関(例:ρ = 0.2)が存在する場合でも、変化点が適切に検出可能である。
  • 二分木分割を用いた再帰的応用による複数変化点検出への拡張は、シミュレーション研究でも有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。