Skip to main content
QUICK REVIEW

[论文解读] Another look at Bootstrapping the Student t-statistic

Miklós Csörgő, Yuliya V. Martsynyuk|arXiv (Cornell University)|Sep 18, 2012
Bayesian Methods and Mixture Models参考文献 13被引用 5
一句话总结

本文通過對隨機權重而非數據進行條件化,重新評估了自助t統計量,利用林德伯格-弗勒利定理在最小假設下建立了其漸近有效性。研究表明,權重的交換性並非必要,並為自助t區間在極大值吸引域為正態分布、且母體分布具有無限方差的情況下仍有效的條件提供了新條件。

ABSTRACT

Let X, X_1,X_2,... be a sequence of i.i.d. random variables with mean $μ=E X$. Let ${v_1^{(n)},...,v_n^{(n)}}_{n=1}^\infty$ be vectors of non-negative random variables (weights), independent of the data sequence ${X_1,...,X_n}_{n=1}^\infty$, and put $m_n=\sumn v_i^{(n)}$. Consider $ X^{*}_1,..., X^{*}_{m_n}$, $m_n\geq 1$, a bootstrap sample, resulting from re-sampling or stochastically re-weighing a random sample $X_1,...,X_n$, $n\geq 1$. Put $\bar{X}_n= \sumn X_i/n$, the original sample mean, and define $\bar{X^*}_{m_n}=\sumn v_i^{(n)} X_i/m_n$, the bootstrap sample mean. Thus, $\bar{X^*}_{m_n}- \bar{X}_n=\sumn ({v_i^{(n)}}/{m_n}-{1}/{n}) X_i$. Put $V_n^{2}=\sumn ({v_i^{(n)}}/{m_n}-{1}/{n})^2$ and let $S_n^{2}$, $S_{m_{n}}^{*^{2}}$ respectively be the the original sample variance and the bootstrap sample variance. The main aim of this exposition is to study the asymptotic behavior of the bootstrapped $t$-statistics $T_{m_n}^{*}:= (\bar{X^*}_{m_n}- \bar{X}_n)/(S_n V_n)$ and $T_{m_n}^{**}:= \sqrt{m_n}(\bar{X^*}_{m_n}- \bar{X}_n)/ S_{m_{n}}^{*} $ in terms of conditioning on the weights via assuming that, as $n,m_n o \infty$, $\max_{1\leq i \leq n}({v_i^{(n)}}/{m_n}-{1}/{n})^2\big/ V_n^{2}=o(1)$ almost surely or in probability on the probability space of the weights. This view of justifying the validity of the bootstrap is believed to be new. The need for it arises naturally in practice when exploring the nature of information contained in a random sample via re-sampling, for example. Conditioning on the data is also revisited for Efron's bootstrap weights under conditions on $n,m_n$ as $n o \infty $ that differ from requiring $m_n /n$ to be in the interval $(λ_1,λ_2)$ with 0< λ_1 < λ_2 < \infty as in Mason and Shao. Also, the validity of the bootstrapped $t$-intervals for both approaches to conditioning is established.

研究动机与目标

  • 透過對隨機權重而非數據進行條件化,重新表達自助t統計量有效性的表達方式。
  • 建立在不需假設權重交換性的條件下,自助t統計量仍保持漸近有效的條件。
  • 將自助t區間的有效性擴展至極大值吸引域為正態分布的分佈,即使其方差無限大。
  • 提供一種更簡潔、更直接的自助有效性證明,利用林德伯格-弗勒利中心極限定理,避免依賴複雜的秩統計量或交換性假設。
  • 比較與對比艾夫倫的重採樣自適應法與隨機重加權自適應法在不同條件化架構下的表現。

提出的方法

  • 以林德伯格-弗勒利中心極限定理作為核心工具,用於在權重條件化下證明自助t統計量的漸近常態性。
  • 定義兩種自助t統計量:$ T^{*}_{m_n} = (\bar{X}^{*}_{m_n} - \bar{X}_n)/(S_n V_n) $ 和 $ T^{**}_{m_n} = \sqrt{m_n}(\bar{X}^{*}_{m_n} - \bar{X}_n)/S^{*}_{m_n} $,其中 $ V_n^2 = \sum_{i=1}^n \left( \frac{v_i^{(n)}}{m_n} - \frac{1}{n} \right)^2 $。
  • 施加最大可忽略性條件:在權重空間上,$ \max_{1\leq i\leq n} \left( \frac{v_i^{(n)}}{m_n} - \frac{1}{n} \right)^2 / V_n^2 = o(1) $ 幾乎必然或依機率成立。
  • 應用條件中心極限定理於中心化多項式變數的隨機加權和,當對資料進行條件化時,使用莫里斯[20]的結果。
  • 透過在權重條件化框架下證明漸近不相關性,建立自助t統計量在不同自適應重複之間的漸近條件獨立性。
  • 利用切比雪夫不等式與矩不等式,證明交叉加權和項收斂於機率零,從而確保自適應重複之間的漸近獨立性。

实验结果

研究问题

  • RQ1當對隨機權重而非資料進行條件化時,自助t統計量在何種條件下有效?
  • RQ2是否可以在不假設權重交換性的前提下,證明自適應的有效性?
  • RQ3當母體分佈具有無限方差(即處於正態分佈的極大值吸引域內)時,自適應t區間是否仍有效?
  • RQ4在資料條件化與權重條件化下,自適應t統計量的漸近行為有何差異?
  • RQ5是否可直接利用林德伯格-弗勒利中心極限定理來證明自適應t統計量的有效性,而無需依賴基於秩的漸近常態性結果?

主要发现

  • 在權重的最大可忽略性條件下,即使不假設交換性,自適應t統計量 $ T^{*}_{m_n} $ 仍收斂於標準常態分佈。
  • 自適應t區間的有效性在資料條件化與權重條件化兩種架構下均得到確立,其中後者在無限方差分佈下為新發現。
  • 當對資料進行條件化時,結果適用於處於正態分佈極大值吸引域(DAN)的$ X $,即使 $ \mathbb{E}[X^2] = \infty $,這是一項新貢獻。
  • 在權重條件化下,作者首次在 $ \mathbb{E}[X^2] = \infty $ 條件下建立類似結果,證明在相同可忽略性條件下,自適應t統計量的漸近常態性。
  • 透過矩不等式與切比雪夫不等式,證明自適應重複之間的漸近條件獨立性,其依據為交叉矩收斂於零。
  • 證明技術顯著簡化,特別是在對資料條件化時,得益於在加權多項式陣列上使用條件中心極限定理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。