Skip to main content
QUICK REVIEW

[論文レビュー] Ordering-Free Inference from Locally Dependent Data

Kyungchul Song|arXiv (Cornell University)|Apr 2, 2016
Statistical Methods and Inference参考文献 42被引用数 7
ひとこと要約

本稿では、ウェブクロールドデータやネットワークベースのデータなど、高次元で局所的依存性を示すデータにおける統計的推論のための順序フリーな手法として、確率的サブサンプリング推論を提案する。ランダムに抽出されたサブサンプルからの検定統計量を集約することで、依存関係の順序に関する知識が不要なまま漸近的有効性を達成し、シミュレーションではU型統計量がM型を上回る性能を示す。

ABSTRACT

This paper focuses on a data-rich environment where the data set has a very large cross-sectional dimension, is likely to exhibit local dependence, and yet is hard to determine the dependence ordering. Such a situation arises, for example, when the data set is collected from the Internet, through a method of web crawling. This paper proposes an approach of randomized subsampling inference, where one constructs a test statistic by aggregating many randomized test statistics using random draws of subsamples, and uses for inference the conditional distribution of the test statistic given data. This paper explores two approaches of such inference: one based on an M-type statistic constructed from randomized mean statistics and the other based on a U-type statistic constructed from randomized U-statistics. This paper provides conditions for local dependence, the number of the random draws, and the subsample size, under which randomized subsampling inference is asymptotically valid. From the Monte Carlo simulation studies, this paper finds that the randomized subsampling inference based on the U-type statistics performs better than that based on the M-type statistics.

研究の動機と目的

  • 高次元で局所的依存性を示すが、依存関係の順序が不明なデータ環境における統計的推論を扱う。
  • 縦断的単位間の具体的な依存構造のモデル化や同定を必要としない手法を開発する。
  • ウェブクロールドデータやソーシャルネットワーク、観察されない置換パターンを有する製品市場などに適用可能な理論的・実用的な推論手順を提供する。
  • 標準のサブサンプリングおよびブートストラップ手法が局所的依存性と順序の欠如の下で失敗するのを補うように、それらを拡張する。
  • 平均検定を焦点として、確率的サブサンプリング推論が漸近的に有効であるための条件を確立する。

提案手法

  • 独立に抽出されたサブサンプルから得られる多数の確率的t検定統計量を集約して検定統計量を構築する。
  • データを条件とする集約検定統計量の条件付き分布を用いて臨界値を決定し、漸近的正規性への依存を回避する。
  • M型(確率的平均統計量に基づく)とU型(確率的U統計量に基づく)の2種類の統計量を採用する。
  • 漸近的有効性を保証するため、サブサンプルサイズ、ランダム抽出回数、局所的依存構造に関する制約を課す。
  • 順序に依存しない局所的依存測度を導入することで、依存関係の順序が不明または特定不能な状況への適用を可能にする。
  • マルティングルとモーメントに基づく議論を用いて、検定統計量の条件付き分布がピロティカル極限に確率的に一様に収束することを証明する。

実験結果

リサーチクエスチョン

  • RQ1依存関係の順序が不明または特定不能な高次元で局所的依存性のあるデータにおいて、統計的推論を実施できるか?
  • RQ2依存関係構造の知識がなくても、局所的依存性下で確率的サブサンプリング推論が漸近的に有効であるか?
  • RQ3有限標本におけるM型とU型の確率的統計量の性能特性はどのように比較できるか?
  • RQ4サブサンプルサイズとランダム抽出回数にどのような条件を課すと、推論手順の漸近的有効性が保証されるか?
  • RQ5データを条件とする集約検定統計量の条件付き分布を用いて、正規近似に依存せずに有効な臨界値を構築できるか?

主な発見

  • 依存関係の順序が不明であっても、局所的依存性、サブサンプルサイズ、抽出回数に関する条件下で、確率的サブサンプリング推論は漸近的に有効である。
  • 確率的U統計量に基づくU型統計量アプローチは、モンテカルロシミュレーションにおいてM型アプローチを上回り、より優れたサイズとパワー特性を示す。
  • データを条件とする検定統計量の条件付き分布は、ピロティカル分布に確率的に一様に収束するため、有効な臨界値の構築が可能である。
  • 標準のブートストラップおよびサブサンプリング手法が依存構造の誤指定により失敗するような局所的依存性下でも、本手法は有効である。
  • ウェブクロールドデータやソーシャルネットワークにおけるような複雑または臨床的な依存構造であっても、漸近的有効性は保たれる。
  • 理論的結果により、維持仮定の下で、検定統計量における推定誤差およびバイアス項が漸近的に消えることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。