Skip to main content
QUICK REVIEW

[论文解读] Bootstrap with Clustering in Two or More Dimensions

Konrad Menzel|arXiv (Cornell University)|Mar 8, 2017
Bayesian Methods and Mixture Models参考文献 13被引用 10
一句话总结

本文提出了一种新颖的自助法(bootstrap)程序,用于在具有多个分组结构的数据中进行推断,这些数据在多个聚类维度上表现出依赖性。该方法建立了枢轴统计量的逐点一致性与渐近修正,克服了在双向聚类下出现的非标准渐近分布问题,并将其应用于U统计量、网络数据以及非穷尽匹配样本。

ABSTRACT

We propose a bootstrap procedure for data that may exhibit clustering in two or more dimensions. We use insights from the theory of generalized U-statistics to analyze the large-sample properties of statistics that are sample averages from the observations pooled across clusters. The asymptotic distribution of these statistics may be non-standard if there is no clustering in means. We show that the proposed bootstrap procedure is (a) point-wise consistent for any fixed data-generating process (DGP), (b) uniformly consistent if we exclude the case of clustering without clustering in means, and (c) provides refinements for any DGP such that the limiting distribution is Gaussian.

研究动机与目标

  • 解决在双向或高维聚类设置下的推断问题,其中由于组内依赖性导致标准渐近分布为非标准形式。
  • 开发一种对数据依赖结构具有自适应能力的自助法程序,而无需了解潜在的数据生成过程。
  • 建立自助法实现一致一致或逐点一致性的条件,特别是在存在非退化方差分量的情况下。
  • 将该方法扩展至样本均值以外的一般统计量,包括渐近线性统计量和V统计量估计器。
  • 将该方法适应于非穷尽匹配样本和网络数据,其中仅观测到部分成对或网络对。

提出的方法

  • 该方法使用一种重加权自助法,通过从数据中重采样残差,以保持多个聚类维度之间的联合依赖结构。
  • 通过将样本均值分解为与行方向、列方向及跨聚类依赖相关的分量,利用正交子空间上的投影。
  • 在给定观测到的聚类结构条件下,使用i.i.d. Rademacher或对称随机变量重采样统计量的影响力函数。
  • 利用广义U统计量和维纳混沌展开的结果,刻画在多向依赖下检验统计量的渐近分布。
  • 该程序通过适当地加权观测到的成对数据,被调整以处理U统计量中的退化与非退化核,以及非穷尽抽样。
  • 对于网络数据,该方法适用于子图密度,通过将邻接矩阵元素视为具有多向依赖性的成对结果来处理。

实验结果

研究问题

  • RQ1能否构造一种自助法程序,即使在极限分布为非标准形式时,也能一致估计在双向聚类下样本均值的抽样分布?
  • RQ2是否存在一种自助法程序,可在双向聚类下对所有数据生成过程实现一致一致性,还是存在根本性限制?
  • RQ3如何将自助法调整以处理在多向聚类下V统计量和U统计量的推断,特别是当核为退化时?
  • RQ4该方法能否扩展至仅观测到部分成对数据的非穷尽匹配样本?
  • RQ5在多维聚类设置下,对于枢轴统计量,自助法是否能相对于高斯近似提供渐近修正?

主要发现

  • 在双向聚类下,样本均值极限分布的估计量不存在一致一致估计,这是由于存在无相关依赖的可能性。
  • 所提出的自助法对任何固定的生成过程均具有逐点一致性,使其能够自适应未知的依赖结构。
  • 通过排除无相关依赖的情况,可实现另一种自助法的统一一致性,从而支持保守推断。
  • 对于枢轴统计量,当极限分布为正态时,自助法相对于高斯近似提供了渐近修正。
  • 通过利用U统计量理论和影响力函数展开,该方法可扩展至V统计量和U统计量,包括退化核的情况。
  • 该程序对网络数据(如子图密度)以及非穷尽匹配样本均有效,通过适当的加权和重采样方案实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。