[论文解读] Ranks and Pseudo-Ranks - Paradoxical Results of Rank Tests -
本文揭示了在不平衡设计下经典秩次检验中存在的悖论性结果,即在底层分布固定的情况下,检验决策可能随样本量变化而反转。本文提出使用伪秩次(pseudo-ranks)替代传统秩次以解决这些不一致问题,证明伪秩次可保持非非中心性参数的稳定性,从而在因子设计和子组设计中实现非参数效应的可靠推断与置信区间构建。
Rank-based inference methods are applied in various disciplines, typically when procedures relying on standard normal theory are not justifiable, for example when data are not symmetrically distributed, contain outliers, or responses are even measured on ordinal scales. Various specific rank-based methods have been developed for two and more samples, and also for general factorial designs (e.g., Kruskal-Wallis test, Jonckheere-Terpstra test). It is the aim of the present paper (1) to demonstrate that traditional rank-procedures for several samples or general factorial designs may lead to paradoxical results in case of unbalanced samples, (2) to explain why this is the case, and (3) to provide a way to overcome these disadvantages of traditional rankbased inference. Theoretical investigations show that the paradoxical results can be explained by carefully considering the non-centralities of the test statistics which may be non-zero for the traditional tests in unbalanced designs. These non-centralities may even become arbitrarily large for increasing sample sizes in the unbalanced case. A simple solution is the use of socalled pseudo-ranks instead of ranks. As a special case, we illustrate the effects in sub-group analyses which are often used when dealing with rare diseases.
研究动机与目标
- 证明在标准同方差正态模型下,即使底层分布固定,经典秩次检验在样本量不平衡时也可能产生悖论性结果(如检验决策反转)。
- 阐明这些悖论的根本原因在于:在不平衡设计中,由于权重分配不均,秩次检验统计量的非非中心性参数非零且随样本量增加而增大。
- 提出使用伪秩次作为解决方案,其具有单调变换下的不变性,并在固定总体效应下确保非非中心性参数的一致性。
- 通过基于伪秩次构建置信区间,实现对非参数效应大小的可靠估计,克服秩次检验主要局限于假设检验的局限性。
提出的方法
- 用伪秩次替代传统秩次,伪秩次通过组间所有配对秩次的加权平均计算得出,确保对非参数效应的无权重估计。
- 以非参数相对效应 ψ 为目标参数,定义为从一组中随机抽取的观测值大于另一组中随机抽取观测值的概率,伪秩次可提供无偏估计。
- 推导基于秩次、伪秩次和均值的检验统计量的非非中心性参数,并比较其在样本量不平衡增加时的行为表现。
- 证明尽管基于秩次的统计量的非非中心性随不平衡增加而上升,但基于伪秩次和均值的统计量在原假设下始终精确保持为零,从而确保稳定性。
- 应用检验统计量的渐近多变量正态分布,重点关注基于秩次方法中由于 √N c_p^p 随 N 增大而增加所导致的抽样分布偏移。
- 在 R 包 rankFD 中实现伪秩次程序,通过启用无权重效应选项,实现因子设计中的实际应用。
实验结果
研究问题
- RQ1在标准正态模型且同方差的前提下,经典秩次检验是否可能在样本量不平衡时产生悖论性结果(如检验决策反转)?
- RQ2为何非参数秩次检验在不平衡设计中表现出不一致性?其背后的统计机制是什么?
- RQ3伪秩次是否通过在样本量不平衡加剧时稳定非非中心性参数,从而解决秩次检验的悖论行为?
- RQ4能否基于伪秩次可靠构建有意义的非参数效应大小的置信区间,从而克服秩次检验主要局限于假设检验的局限性?
- RQ5在子组分析中,使用伪秩次是否优于成对或分层秩次,能更有效地避免悖论性结果?
主要发现
- 在 2×2 因子设计中,当某一子组的样本量从 100 增加到 2000 而其他子组大小保持不变时,基于秩次检验的非非中心性参数 √N c_p^p 从 0 上升至 12.89,表明其渐近分布发生显著偏移。
- 相比之下,基于伪秩次和均值的统计量的非非中心性参数 c_ψ^p 和 c_μ^p 始终精确为零,无论样本量如何不平衡,均保持稳定,确保推断的可靠性。
- 悖论行为的根源在于:基于秩次的统计量的非非中心性依赖于加权的非参数相对效应,而样本量不均导致这些效应的权重分布日益失衡。
- 伪秩次通过使用相对效应的无权重估计,消除了对样本量不平衡的依赖,从而防止非非中心性参数的虚假增长。
- 使用伪秩次可构建非参数效应的可靠置信区间,解决了秩次检验长期存在的无法用于效应估计的局限性。
- 所提出的方法已通过 R 包 rankFD 中的无权重效应选项实现,支持在因子设计和子组设计中的实际应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。