Skip to main content
QUICK REVIEW

[論文レビュー] A self-calibrating method for heavy tailed data modelling. Application in neuroscience and finance

Nehla Debbabi, Marie Kratz|arXiv (Cornell University)|Dec 12, 2016
Complex Systems and Time Series Analysis参考文献 28被引用数 5
ひとこと要約

本稿では、ガウス分布(中央部)、指数関数的ブリッジ、および一般化パレート分布(GPD)(裾部)を組み合わせることで、重たい尾を持つ多成分データを自己校正型で教師なしにモデル化する手法を提案する。この手法は、閾値とモデルパラメータを同時に推定する反復的アルゴリズムを用い、全分布にわたる正確なフィットを達成する。神経科学およびS&P 500金融データへの応用で、標準的なEVT手法を上回る性能を示した。

ABSTRACT

Modelling non-homogeneous and multi-component data is a problem that challenges scientific researchers in several fields. In general, it is not possible to find a simple and closed form probabilistic model to describe such data. That is why one often resorts to non-parametric approaches. However, when the multiple components are separable, parametric modelling becomes again tractable. In this study, we propose a self-calibrating method to model multi-component data that exhibit heavy tails. We introduce a three-component hybrid distribution: a Gaussian distribution is linked to a Generalized Pareto one via an exponential distribution that bridges the gap between mean and tail behaviors. An unsupervised algorithm is then developed for estimating the parameters of this model. We study analytically and numerically its convergence. The effectiveness of the self-calibrating method is tested on simulated data, before applying it to real data from neuroscience and finance, respectively. A comparison with other standard Extreme Value Theory approaches confirms the relevance and the practical advantage of this new method.

研究の動機と目的

  • 神経科学や金融分野における非一様的で多成分の重たい尾を持つデータをモデル化する課題に取り組むこと。標準的なパラメトリックモデルでは不十分である。
  • 独立同分布(i.i.d.)仮定に依存するか、任意のグラフィカル閾値選択に依存する従来の極値理論(EVT)手法の限界を克服すること。
  • 中央部(ガウス分布)と尾部(GPD)の両方の挙動を同時に適合させる、統一的で自己校正型のパラメトリックモデルを開発すること。
  • 主観的な閾値選択に依存しない、強固で教師なしの反復的アルゴリズムを提供し、閾値とモデルパラメータを同時に推定すること。
  • 神経スパイクトレインとS&P 500の対数リターンという、多様な分野からの実世界データを用いて、本手法の実用的有用性と正確性を検証すること。

提案手法

  • 本手法は、中央部の挙動にガウス分布、平均値と尾部の間の滑らかな接続に指数関数的ブリッジ、重たい尾部にGPDを用いた三成分ハイブリッド分布を構築する。
  • モデルは、成分間の接続点を最適化によって反復的に推定する連続的かつC¹-正則化混合分布として定義される。
  • 最小二乗最適化とレーベンバーグ・マーカート法に基づく教師なしアルゴリズムを用い、閾値を含むすべてのパラメータを同時に推定する。
  • アルゴリズムは、一部のモデルに関しては解析的に収束性を検討し、他の部分に関しては数値的に検証することで、安定性と正確性を確保する。
  • 対称的または非対称的な重たい尾に対しては、データのモード(例:μ=0)で上尾と下尾のG-E-GPD成分を組み合わせることで、二重側ハイブリッドモデルに拡張可能である。
  • 全分布は重み付き混合として表現される:h_mix(x) = α₁h(−x;θ₁)𝕀_{]-∞,0[}(x) + α₂h(x;θ₂)𝕀_{[0,+∞[}(x),接続点で連続性が保証される。

実験結果

リサーチクエスチョン

  • RQ1グラフィカル手法に依存せずに、重たい尾データのハイブリッドモデルの閾値とパラメータを、自己校正型で教師なしのアルゴリズムが信頼性高く推定できるか?
  • RQ2ガウス分布、指数関数的ブリッジ、GPDの三成分ハイブリッドモデルは、実世界の重たい尾データの中央部と尾部の挙動をどれほど正確に適合できるか?
  • RQ3本手法は、実際の金融データおよび神経データにおいて、標準的な極値理論(EVT)手法(例:超過度数法(POT))と比較して、どの程度優れた性能を示すか?
  • RQ4非一様的で多成分構造を持つデータに対しても、本手法は分布成分間の滑らかさと連続性を維持しながら、どのように対処できるか?
  • RQ5反復的パラメータ推定アルゴリズムの収束特性はいかなるものか?また、標本サイズの増大に伴い、そのスケーリング特性はどのようになるか?

主な発見

  • 自己校正型アルゴリズムは、GPDの尾指数を正確かつ安定して推定でき、標準的なグラフィカルまたはヒューリスティックな閾値選択手法を著しく上回る。
  • シミュレーションデータにおいて、中央部および尾部の両方で最小限のバイアスで、全分布にわたる正確なフィットが達成された。
  • S&P 500の対数リターンへの応用において、本手法は、図7に示すように、経験的累積分布関数のフィットにおいて、標準的なEVT手法を上回った。
  • 本手法は神経スパイクトレインデータを効果的にモデル化でき、通常の発火パターンとまれな極端な出来事の両方を高い忠実度で捉えた。
  • アルゴリズムは解析的に(モデルの一部について)収束し、数値的に(シミュレーションで)検証されたため、パラメータ推定の安定性と信頼性が示された。
  • 本手法は一般化可能である。コアのアルゴリズム構造を変更せずに、他の成分分布(例:対数正規分布)へも適応可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。