Skip to main content
QUICK REVIEW

[論文レビュー] Toward a generic representation of random variables for machine learning

Gautier Marti, Philippe Very|arXiv (Cornell University)|Jun 2, 2015
Time Series Analysis and Forecasting参考文献 26被引用数 3
ひとこと要約

本稿では、依存構造と分布を情報損失なしに分離する一般化された非パラメトリックな確率変数の表現を提案し、両者を同時に捉える新しい距離尺度(GNPR)を構築する。この手法により、i.i.d. 時系列、特に金融市場の信用デフォルトスワップリターンに対して、従来のリターン値におけるL2距離と比較してはるかに安定的かつ一貫性のあるクラスタリングが可能となり、調整ランダムインデックス(ARI)は0.85(L2距離:0.64)を達成した。

ABSTRACT

This paper presents a pre-processing and a distance which improve the performance of machine learning algorithms working on independent and identically distributed stochastic processes. We introduce a novel non-parametric approach to represent random variables which splits apart dependency and distribution without losing any information. We also propound an associated metric leveraging this representation and its statistical estimate. Besides experiments on synthetic datasets, the benefits of our contribution is illustrated through the example of clustering financial time series, for instance prices from the credit default swaps market. Results are available on the website www.datagrapple.com and an IPython Notebook tutorial is available at www.datagrapple.com/Tech for reproducible research.

研究の動機と目的

  • i.i.d. 確率過程の機械学習互換の前処理および距離尺度を構築し、依存構造と分布を同時にモデル化することを目的とする。
  • 特に再サンプリングや摂動に対して不安定なクラスタリング結果を示す金融時系列の問題を解決することを目的とする。
  • 従来の分布のみまたは依存構造のみに焦点を当てた距離尺度に対する、数学的に根拠を持つ非パラメトリックな代替手法を提供することを目的とする。
  • 合成データおよび実世界の金融時系列(例:信用デフォルトスワップ価格)において、クラスタリング性能の向上を実証することを目的とする。
  • www.datagrapple.com で公開されたコードおよび実験結果を通じて、再現可能な研究を可能にすることを目的とする。

提案手法

  • コピュラ理論におけるスクラーの定理にインspiredされ、情報損失なしに依存構造と周辺分布を分離する非パラメトリックな確率変数の表現を提案する。
  • 分布と依存構造の両方の情報を統合する一般化された非パラメトリック表現(GNPR)距離を導入し、パラメータθ ∈ [0,1] を用いて、純粋な分布(θ=0)から純粋な依存構造(θ=1)へ滑らかに内挿する。
  • 実データの取り扱いのために、ランクベースおよび経験的累積分布関数技術を用いてGNPR距離の経験的推定を実施する。
  • ランダムウォーク仮説のもとで価格変動がi.i.d. であると仮定し、特に信用デフォルトスワップに対してGNPR距離を時系列の価格変動に適用する。
  • Ward法やk-means++などの標準的なクラスタリングアルゴリズムにGNPR距離を組み込み、パーティションの安定性と一貫性を評価する。
  • 再サンプリング(奇数日/偶数日)を用いた妥当性検証と、調整ランダムインデックス(ARI)を用いた安定性比較により結果を検証する。

実験結果

リサーチクエスチョン

  • RQ1依存構造と分布を分離する統一的表現が、i.i.d. 時系列におけるクラスタリング性能を向上させ得るか?
  • RQ2分布と依存構造を統合するGNPR距離は、リターン値における標準L2距離と比較して、クラスタリングの安定性においてどのように差を示すか?
  • RQ3本手法は、重尾分布を示す金融時系列(例:信用デフォルトスワップ)において、より一貫性があり均質なクラスタを生成するか?
  • RQ4GNPRにおけるパラメータθは、分布ベースと依存構造ベースのクラスタリングの間でどのように調整可能か?
  • RQ5GNPRに基づくクラスタリングは、取引日を再サンプリングするような小さな摂動に対しても頑健であるか?

主な発見

  • 分布と依存構造をバランスさせるθ=0.5のGNPR距離は、CDSデータで調整ランダムインデックス(ARI)0.85を達成し、リターン値におけるL2距離(0.64)を著しく上回った。
  • GNPR θ=0.5を用いたクラスタリングは、奇数日と偶数日間で安定したパーティションを生成し、最小限のクラスタ再割り当てが生じ、摂動に対して頑健であることが示された。
  • GNPR θ=0.0によるクラスタリングは、CDSデータセットにおける標準偏差の多峰的経験的分布と正確に一致し、分布差に敏感であることを確認した。
  • GNPR θ=1.0の距離行列は、CDSリターンに階層的な相関構造を明らかにし、地域(米国、ヨーロッパ、日本)、格付け(投資格付対象とハイイールド)、産業セクターごとのグループ化を示した。
  • 合成データにおいても、本手法は分布的および依存的構造を的確に捉え、より細分化され意味のあるパーティションを生成し、優れた性能を示した。
  • 結果は再現可能であり、www.datagrapple.com で公開されており、完全なコードと実験詳細が入手可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。