Skip to main content
QUICK REVIEW

[論文レビュー] An Online Algorithm for Nonparametric Correlations

Xiao Wei|arXiv (Cornell University)|Dec 5, 2017
Advanced Statistical Methods and Models参考文献 8被引用数 7
ひとこと要約

本論文は、O(1)の時間計算量およびメモリ計算量を達成する、スティーリングデータにおけるスピアマン順位相関およびケンダールのtau相関を計算する最初のオンラインアルゴリズムを提案する。固定サイズの区間点行列を用いて2変量分布を粗くすることで、バッチ手法と比較して10~1,000倍の高速化を達成しながら高い精度を維持する。特に十分な数の区間点を用いる場合に顕著である。

ABSTRACT

Nonparametric correlations such as Spearman's rank correlation and Kendall's tau correlation are widely applied in scientific and engineering fields. This paper investigates the problem of computing nonparametric correlations on the fly for streaming data. Standard batch algorithms are generally too slow to handle real-world big data applications. They also require too much memory because all the data need to be stored in the memory before processing. This paper proposes a novel online algorithm for computing nonparametric correlations. The algorithm has O(1) time complexity and O(1) memory cost and is quite suitable for edge devices, where only limited memory and processing power are available. You can seek a balance between speed and accuracy by changing the number of cutpoints specified in the algorithm. The online algorithm can compute the nonparametric correlations 10 to 1,000 times faster than the corresponding batch algorithm, and it can compute them based either on all past observations or on fixed-size sliding windows.

研究の動機と目的

  • ストリーミングデータ環境における非パラメトリック相関のための効率的なオンラインアルゴリズムの欠如に対処すること。
  • すべての歴史的データを保存し、ソートを要するため、バッチ手法が高い計算コストとメモリコストを伴う問題を克服すること。
  • 処理能力とメモリが限られたエッジデバイスでも、リアルタイムかつロバストな相関計算を可能にすること。
  • 調整可能な区間点選択により、速度と精度の間でトレードオフを調整可能な仕組みを提供すること。
  • 動的で現実世界の応用において、累積的および固定サイズのスライディングウィンドウ相関計算を効果的に行えること。

提案手法

  • アルゴリズムは、入力データ (X, Y) の2変量分布を、ユーザーが定義したXおよびYの区間点を用いて小さな行列Mに粗く分類する。
  • 行列M内に、一致・不一致ペアおよび同順位値のカウントといった十分統計量を維持し、相関を段階的に計算する。
  • スピアマン順位のため、区間点による入力値の順位変換を用いて順位を近似する。
  • ケンダールのtauのため、バイニングされた行列M内での一致ペア数(P)、不一致ペア数(Q)、同順位ペア数(T, U)を追跡する。
  • 新しいデータポイントごとに、行列Mおよび要約統計量を段階的に更新することで、O(1)時間で相関推定値を更新する。
  • 区間点は、観測データの分位数または一意な値を保持するように、目的の精度とデータ構造に応じて適応的に選択される。

実験結果

リサーチクエスチョン

  • RQ1記憶容量が限定され、更新ごとに定数時間で処理できる条件下で、ストリーミングデータに対して非パラメトリック相関をリアルタイムで効率的に計算できるか?
  • RQ2バイニングされたデータ表現を用いる場合、オンライン非パラメトリック相関推定値はバッチ結果をどの程度正確に近似できるか?
  • RQ3区間点の数が、オンライン相関推定における速度と精度のトレードオフに与える影響は何か?
  • RQ4提案されたアルゴリズムは、累積的および固定サイズのスライディングウィンドウ相関計算の両方を効果的に処理できるか?
  • RQ5外れ値や正規分布でない分布を示す現実世界のセンサデータにおいて、アルゴリズムはどの程度の性能を示すか?

主な発見

  • オンラインアルゴリズムはO(1)の時間計算量およびメモリ計算量を達成し、リソース制限のあるエッジデバイスへのデプロイが可能である。
  • データサイズや設定に応じて、バッチ手法と比較して10~1,000倍の高速化が達成される。
  • 30個の区間点を用いる場合、オンラインのスピアマン順位相関推定値は、少数の区間点数でも非常に高い精度を示す。
  • ケンダールのtauでは、区間点を増やすことで精度が著しく向上するが、相関が高く、データが対角線に集中している場合にはバイアスが増加する。
  • 産業用センサデータS1において19個の区間点を用いた場合、スピアマン相関で20~50倍、ケンダールのtauで5~20倍の高速化が達成された。
  • 一意な値を保持するように区間点を設定した場合(例:S1で120個)、オンラインアルゴリズムはバッチ結果と正確に一致し、顕著な高速化が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。