Skip to main content
QUICK REVIEW

[论文解读] Nonparametric Estimation of ROC Surfaces Under Verification Bias

Duc‐Khanh To, Monica Chiogna|arXiv (Cornell University)|Apr 15, 2016
Imbalanced Data Classification Techniques参考文献 15被引用 4
一句话总结

本文提出了一种完全非参数的、基于最近邻插补的估计器,用于在缺失在随机(MAR)假设下对连续诊断试验的受试者工作特征(ROC)曲面进行估计,且考虑了验证偏倚。该方法通过平滑回归模型对疾病状态和验证过程进行建模,从而校正偏倚,实现了估计的一致性和渐近正态性,模拟和真实数据验证表明,即使在验证数据不完整的情况下,该方法仍表现出稳健的性能。

ABSTRACT

Verification bias is a well known problem when the predictive ability of a diagnostic test has to be evaluated. In this paper, we discuss how to assess the accuracy of continuous-scale diagnostic tests in the presence of verification bias, when a three-class disease status is considered. In particular, we propose a fully nonparametric verification bias-corrected estimator of the ROC surface. Our approach is based on nearest-neighbor imputation and adopts generic smooth regression models for both the disease and the verification processes. Consistency and asymptotic normality of the proposed estimator are proved and its finite sample behavior is investigated by means of several Monte Carlo simulation studies. Variance estimation is also discussed and an illustrative example is presented.

研究动机与目标

  • 解决三分类诊断试验评估中因金标准验证不完整而产生的验证偏倚问题。
  • 在MAR假设下,开发一种完全非参数的ROC曲面估计器,以校正因疾病状态缺失导致的偏倚。
  • 在温和正则性条件下,确保估计器的一致性和渐近正态性。
  • 在验证数据不完整的情况下,为部分参数化方法提供一种实用且稳健的替代方案。
  • 通过分层方法,将该方法扩展至处理分类辅助变量。

提出的方法

  • 使用最近邻插补法,基于试验结果和辅助协变量来估计缺失的疾病状态。
  • 对疾病过程和验证过程均采用通用的平滑回归模型,以灵活地建模协变量的影响。
  • 应用选择规则(公式3.8)确定最近邻的最优邻域大小K,使用马氏距离以考虑异方差性。
  • 在每个分层中,利用插补后的疾病状态构建校正验证偏倚的真正类分数(TCF)估计器。
  • 推导估计器的渐近正态性及其方差估计,以支持置信区域和统计推断。
  • 通过在分类辅助变量的每个水平内应用KNN估计器,将方法扩展至分层设置。

实验结果

研究问题

  • RQ1能否在MAR假设下,构建一种完全非参数的ROC曲面估计器,以校正验证偏倚?
  • RQ2在验证偏倚下,最近邻插补方法在偏倚、一致性及渐近正态性方面的表现如何?
  • RQ3与完整数据估计相比,所提出的估计器在小样本下的行为表现如何?
  • RQ4在存在验证偏倚的情况下,如何将该方法扩展以包含分类辅助变量?
  • RQ5能否通过渐近方差估计,使该估计器生成可靠的ROC曲面置信区域?

主要发现

  • 在正则性条件下,所提出的基于KNN的估计器实现了估计的一致性和渐近正态性,从而支持有效的统计推断。
  • 模拟研究结果表明,该估计器在小样本中表现良好,偏倚较低,且95%置信椭球的覆盖性能良好。
  • 在卵巢癌生物标志物实例中,即使仅有63.4%的受试者被验证,该方法生成的ROC曲面估计仍接近完整数据的参考值。
  • 使用马氏距离和最优K选择(示例中K=1)可提高异质数据中的估计精度。
  • 当K=3时,估计器仍保持稳健,表明其在不同邻域大小下具有稳定性。
  • 通过辅助分类变量实现的分层扩展保持了估计的一致性,并在亚群中实现了更优的估计性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。