Skip to main content
QUICK REVIEW

[论文解读] Nearest Neighbor and Kernel Survival Analysis: Nonasymptotic Error Bounds and Strong Consistency Rates

George H. Chen|arXiv (Cornell University)|May 13, 2019
Statistical Methods and Inference参考文献 35被引用 6
一句话总结

本文在一般度量空间中建立了最近邻和核生存估计量的首个非渐近误差界,证明了与现有下界仅相差对数因子的强一致性速率。此外,还推导了基于Nelson-Aalen的累积风险估计量的类似界,并提出使用随机生存森林学习自适应核,实验表明其在四个数据集上均优于固定核。

ABSTRACT

We establish the first nonasymptotic error bounds for Kaplan-Meier-based nearest neighbor and kernel survival probability estimators where feature vectors reside in metric spaces. Our bounds imply rates of strong consistency for these nonparametric estimators and, up to a log factor, match an existing lower bound for conditional CDF estimation. Our proof strategy also yields nonasymptotic guarantees for nearest neighbor and kernel variants of the Nelson-Aalen cumulative hazards estimator. We experimentally compare these methods on four datasets. We find that for the kernel survival estimator, a good choice of kernel is one learned using random survival forests.

研究动机与目标

  • 在一般度量空间中,为基于最近邻和核方法的非参数生存估计量建立非渐近误差界。
  • 推导这些估计量的强一致性速率,并表明其几乎最优,与已知的条件累积分布函数估计下界仅相差对数因子。
  • 将分析扩展至基于Nelson-Aalen的累积风险函数估计量,以实现超参数选择的泛化保证。
  • 提出并评估一种使用随机生存森林学习自适应核的方法,以提高预测精度。
  • 在真实世界数据集上,对多种生存估计方法(包括k-最近邻、核方法和随机生存森林)的性能进行实证比较。

提出的方法

  • 为可分度量空间中基于Kaplan-Meier的最近邻和核估计量的条件生存函数,提出非渐近误差界框架。
  • 采用一种证明策略,该策略同样可导出最近邻和核版本的Nelson-Aalen累积风险估计量的非渐近界。
  • 提出一种方法,利用随机生存森林学习核生存估计量的数据自适应核,以提升预测性能。
  • 使用验证集推导自动选择最近邻数量或核带宽的泛化保证。
  • 根据估计的累积风险对测试样本进行排序,以计算 concordance 指数,并使用一种集成Brier评分变体,时间范围设定为训练事件时间的75百分位数。
  • 在超参数网格上进行搜索:k-最近邻(从4到n的2的幂次)、核带宽(从0.01h_max到h_max的对数间隔)、随机生存森林参数(树的数量和最大深度)。

实验结果

研究问题

  • RQ1当特征向量位于一般度量空间时,最近邻和核生存估计量的非渐近误差界可以如何建立?
  • RQ2所推导的误差界是否意味着强一致性?与已知的条件累积分布函数估计下界相比如何?
  • RQ3相同的证明框架能否导出基于Nelson-Aalen的累积风险函数估计量的非渐近界?
  • RQ4在实践中,使用随机生存森林学习核生存估计量的核在多大程度上有效?
  • RQ5在真实世界生存数据集上,所提出的自适应核方法与k-最近邻、固定核和随机生存森林相比,性能如何?

主要发现

  • 最近邻和核生存估计量的非渐近误差界与已知的条件累积分布函数估计下界仅相差对数因子,表明其近乎最优。
  • 所提出的方法在度量空间中各类分布下,对最近邻和核生存估计量均实现了强一致性。
  • 基于Nelson-Aalen的估计量的界,使得可通过验证集实现自动超参数选择的泛化保证。
  • 通过随机生存森林学习的自适应核在gbsg2、recid和kidney数据集上的预测精度与标准随机生存森林相当或更优。
  • 在最小的数据集(pbc)上,使用ℓ2距离的加权k-最近邻在 concordance 指数上优于其他方法,而随机生存森林在三个较大数据集上均实现了最低的集成Brier评分。
  • 集成Brier评分结果表明,随机生存森林始终表现最佳或第二佳,而自适应核方法在较大数据集上表现具有竞争力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。