Skip to main content
QUICK REVIEW

[論文レビュー] Visualizing Dependence in High-Dimensional Data: An Application to S&P 500 Constituent Data

Marius Hofert, Wayne Oldford|arXiv (Cornell University)|Sep 29, 2016
Complex Systems and Time Series Analysis参考文献 1被引用数 5
ひとこと要約

本稿では、2007–2008年の金融危機期におけるS&P 500構成銘柄のリターンに特に応用された、高次元データにおける従属関係を検出および可視化するための新しい可視化ツール、zenpathおよびzenplotを紹介する。皮相的従属、相関、ケンドールのtauといったさまざまな従属尺度を用いることで、一連の経路に基づいた探索的可視化が可能となり、コンパクトで順序付けられた図的表示により、ペアワイズ関係を効率的に把握できる。すべての手法はRパッケージzenplotsに実装されており、SP500デモを通じて再現可能である。

ABSTRACT

The notion of a zenpath and a zenplot is introduced to search and detect dependence in high-dimensional data for model building and statistical inference. By using any measure of dependence between two random variables (such as correlation, Spearman's rho, Kendall's tau, tail dependence etc.), a zenpath can construct paths through pairs of variables in different ways, which can then be laid out and displayed by a zenplot. The approach is illustrated by investigating tail dependence and model fit in constituent data of the S&P 500 during the financial crisis of 2007-2008. The corresponding Global Industry Classification Standard (GICS) sector information is also addressed. Zenpaths and zenplots are useful tools for exploring dependence in high-dimensional data, for example, from the realm of finance, insurance and quantitative risk management. All presented algorithms are implemented using the R package zenplots and all examples and graphics in the paper can be reproduced using the accompanying demo SP500.

研究の動機と目的

  • 高次元金融データにおける従属関係の検出と可視化の課題に取り組むこと、特に2007–2008年の金融危機のような市場不安定期に焦点を当てる。
  • S&P 500構成銘柄のような数百の資産におけるペアワイズ従属構造をスケーラブルかつ解釈可能に探索するための方法を開発すること。
  • 従来の散布図行列が非現実的になるような高次元設定において、モデルの評価、選択、批判を支援する図的フレームワークを提供すること。
  • 皮相的従属、相関、順位相関といった従属尺度を統合的に、zenpathおよびzenplotを用いた一貫したインタラクティブな可視化経路に統合すること。

提案手法

  • zenpath法は、スピアマンのrho、ケンドールのtau、または皮相的従属係数といったユーザー定義の従属尺度に基づいて、ペアワイズ変数の組み合わせのシーケンスを構築する。
  • zenplotは、連続するプロットが共通の変数を共有するように配置されたジグザグレイアウトにこれらのペアワイズプロットを整理し、高次元の従属構造を効率的に視覚的にナビゲート可能にする。
  • 従属関係は、標準化された残差の擬似観測値から計算される条件付きスピークマンのrhoを用いた非パラメトリック推定器を用いて評価される。
  • 多変量コプシアン・GARCHフレームワークを用い、ARMA(1,1)–GARCH(1,1)モデルによる周辺動的構造のモデル化と、多変量コプシアン構造内での皮相的従属の推定を実施する。
  • S&P 500データセット(505銘柄)における欠損データは、Rのna.fill関数を用い「extend」法により線形補間と境界拡張処理を実施し、欠損率が20%未満の465銘柄を保持した。
  • すべての可視化および分析は、RパッケージzenplotsのSP500デモを用いて再現可能であり、ベースR、grid、ggplot2を含む複数のグラフィックスバックエンドをサポートする。

実験結果

リサーチクエスチョン

  • RQ1従来の散布図行列が非現実的になるような高次元金融データ(例:S&P 500構成銘柄リターン)における従属構造を、どのように効果的に可視化できるか?
  • RQ2皮相的従属、相関、順位相関といった従属尺度のうち、金融危機期の高次元データにおいて顕著なパターンを効果的に明らかにするのはどれか?
  • RQ3zenplotsおよびzenpathsは、高次元コプシアン・GARCHモデルにおけるモデル批判および選択をどの程度支援できるか?
  • RQ4視覚的ごみを減らしながら解釈可能性を保ちつつ、大規模データセットにおける最も関連性の高いペアワイズ従属関係を強調するように、図的ツールをどのように設計できるか?

主な発見

  • 2007–2009年のS&P 500構成銘柄データ(756件の日次観測、465銘柄)は、ARMA(1,1)–GARCH(1,1)モデルを用いて処理され、標準化された残差がペアワイズ皮相的従属の推定に使用された。
  • 条件付きスピークマンのrhoを用いた非パラメトリック推定により、特に金融セクターにおいて、二変量分布の右上尾部に顕著な皮相的従属が確認された。
  • zenplotレイアウトは、ペアワイズ上側皮相的従属係数の行列を効果的に可視化した。107,835個のエントリの密度プロットは右裾が長い分布を示しており、強い皮相的従属を示すペアは少数にとどまっていることを示した。
  • この手法により、効果的な図的モデル評価が可能となった:zenplots内のQ-Qプロットにより、共通の自由度パラメータを持つ単一の多変量スルム・コプシアンはデータによって完全には支持されないことが判明し、モデルの限界が示された。
  • zenpathアプローチにより、従属尺度に基づいてプロットを優先順位付けすることで、視覚的過負荷を軽減しつつ、重要な関係性を効果的に特定できた。
  • Rパッケージzenplotsにおける実装(SP500デモを含む)により、完全な再現性が確保され、ggplot2との統合や、loonによる動的プロットも含めた柔軟なカスタマイズが可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。