Skip to main content
QUICK REVIEW

[论文解读] SurvSet: An open-source time-to-event dataset repository

Erik Drysdale|arXiv (Cornell University)|Mar 7, 2022
Air Quality Monitoring and Forecasting被引用 6
一句话总结

SurvSet 是一个开源的、标准化的时间到事件(T2E)数据集仓库,包含 76 个数据集,专为生存分析中机器学习和统计方法的基准测试而设计。它通过统一的格式与标准化的列命名和结构,实现了在生物医学、工程和经济学等不同领域数据集之间的一致性预处理,可通过 Python(PyPI)和 R(GitHub)访问。

ABSTRACT

Time-to-event (T2E) analysis is a branch of statistics that models the duration of time it takes for an event to occur. Such events can include outcomes like death, unemployment, or product failure. Most modern machine learning (ML) algorithms, like decision trees and kernel methods, are supported for T2E modelling with data science software (python and R). To complement these developments, SurvSet is the first open-source T2E dataset repository designed for a rapid benchmarking of ML algorithms and statistical methods. The data in SurvSet have been consistently formatted so that a single preprocessing method will work for all datasets. SurvSet currently has 76 datasets which vary in dimensionality, time dependency, and background (the majority of which come from biomedicine). SurvSet is available on PyPI and can be installed with pip install SurvSet. R users can download the data directly from the corresponding git repository.

研究动机与目标

  • 解决缺乏集中化、标准化的时间到事件(T2E)数据集仓库的问题,以支持机器学习和统计生存模型的基准测试。
  • 通过在所有数据集中提供一致且机器可读的格式,减少研究人员整理和预处理 T2E 数据所需的时间与精力。
  • 通过确保所有数据集遵循相同的结构模式(包括事件指示符、生存时间以及特征标记(数值型/因子型)),提升生存模型的快速评估与比较效率。
  • 通过提供可公开访问的、经整理的、真实世界中的 T2E 数据集及其来源文档,支持生存分析研究的可复现性与算法开发。
  • 通过 pip 安装和直接 GitHub 访问,同时支持 Python 和 R 用户,确保在各类数据科学平台上的广泛可用性。

提出的方法

  • SurvSet 仓库使用单一类 `SurvLoader`,其提供 `load_dataset` 方法,可程序化地获取格式一致的数据集。
  • 数据集以逗号分隔的文件形式存储,具有标准化的列结构:`pid`、`event`、`time`、`time2`(若存在时变特征),随后是 `num_` 前缀的数值型特征和 `fac_` 前缀的分类特征。
  • 所有数据集均经过预处理以确保一致性:事件指示符为二值(1 = 事件发生),生存时间为非负值,特征已标记以便自动预处理(如因子型特征的一键编码,数值型特征的归一化)。
  • 该仓库包含 76 个数据集,来源为成熟的 R 包和公共数据库(如 GEO、Mayo Clinic、Duke Databank),并附有元数据和来源引用。
  • 时变特征通过聚合时间区间的方式处理,以最小化数据行数,同时保留所有特征变化信息,从而确保建模效率。
  • 该仓库采用版本控制,可通过 PyPI(`pip install SurvSet`)和 GitHub 供 R 用户访问,可无缝集成到机器学习工作流中。

实验结果

研究问题

  • RQ1是否可以将单一、一致的预处理流水线应用于具有不同维度、背景和时间依赖性的多样化时间到事件数据集?
  • RQ2SurvSet 数据集的统一结构在多大程度上提升了机器学习和统计生存模型基准测试的效率?
  • RQ3现有生存模型(如正则化线性模型)在多样化的真实世界 T2E 数据集集合中,其一致性指数(concordance indices)的分布程度如何?
  • RQ4SurvSet 是否可作为新生存模型在生物医学与非生物医学领域中可靠且可扩展的基准测试平台?
  • RQ5标准化、开源的 T2E 数据的可用性在多大程度上提升了生存分析研究中的可复现性与可比性?

主要发现

  • SurvSet 提供了 76 个时间到事件数据集,格式统一,使得单一预处理流水线可一致地应用于所有数据集。
  • 该仓库支持 Python 和 R 用户,可通过 `pip install SurvSet` 安装,R 用户可直接通过 GitHub 访问数据文件。
  • 数据集的维度差异显著,包括高维基因组数据集(如 gse1992,p ≫ n)和长而纤细的数据集(如 hdfail,n ≫ p)。
  • 初步的实证评估表明,将正则化线性模型拟合到每个数据集后,一致性指数的分布近似均匀,表明不同数据集间预测性能存在显著差异。
  • 标准化的列结构(包括 `pid`、`event`、`time`、`time2`、`num_` 特征和 `fac_` 特征)支持自动化数据处理与模型训练。
  • SurvSet 的设计旨在支持现代机器学习方法(如随机森林、梯度提升、核方法和深度学习)在生存建模中的基准测试,且数据准备开销极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。