Skip to main content
QUICK REVIEW

[논문 리뷰] SurvSet: An open-source time-to-event dataset repository

Erik Drysdale|arXiv (Cornell University)|2022. 03. 07.
Air Quality Monitoring and Forecasting인용 수 6
한 줄 요약

SurvSet는 생존 분석에서 기계학습 및 통계 모델을 평가하기 위해 사용할 수 있는 76개의 시간-이벤트(T2E) 데이터셋을 포함한 오픈소스이자 표준화된 레포지터리입니다. 생물의학, 공학, 경제학 분야의 다양한 데이터셋을 통합된 형식과 표준화된 컬럼 명명 체계로 제공함으로써 일관된 전처리를 가능하게 하며, Python(PyPI) 및 R(GitHub)를 통해 접근할 수 있습니다.

ABSTRACT

Time-to-event (T2E) analysis is a branch of statistics that models the duration of time it takes for an event to occur. Such events can include outcomes like death, unemployment, or product failure. Most modern machine learning (ML) algorithms, like decision trees and kernel methods, are supported for T2E modelling with data science software (python and R). To complement these developments, SurvSet is the first open-source T2E dataset repository designed for a rapid benchmarking of ML algorithms and statistical methods. The data in SurvSet have been consistently formatted so that a single preprocessing method will work for all datasets. SurvSet currently has 76 datasets which vary in dimensionality, time dependency, and background (the majority of which come from biomedicine). SurvSet is available on PyPI and can be installed with pip install SurvSet. R users can download the data directly from the corresponding git repository.

연구 동기 및 목표

  • 기계학습 및 통계 생존 모델을 평가하기에 적합한 중심화되고 표준화된 시간-이벤트(T2E) 데이터셋 레포지터리가 부족한 문제를 해결하기 위해.
  • 연구자들이 T2E 데이터를 수거하고 전처리하는 데 소요되는 시간과 노력을 줄이기 위해, 모든 데이터셋 간에 일관되고 기계로 읽을 수 있는 형식을 제공하기 위해.
  • 모든 데이터셋이 동일한 구조 스키마를 따르도록 함으로써 생존 모델의 빠른 평가 및 비교를 가능하게 하기 위해(이벤트 지표, 생존 시간, 특징 레이블링(수치형/범주형) 포함).
  • 공개된 출처가 명시된 실제 세계의 T2E 데이터셋을 정제하여 제공함으로써 생존 분석 분야에서 재현 가능하고 반복 가능한 연구 및 알고리즘 개발을 지원하기 위해.
  • Python 및 R 사용자를 모두 고려하여 pip 설치 및 직접 GitHub 접근을 통해 넓은 데이터 과학 플랫폼에서의 접근성을 확보하기 위해.

제안 방법

  • SurvSet 레포지터리는 일관된 형식으로 데이터셋을 제공하기 위해 단일 클래스인 `SurvLoader`를 사용하며, 이는 `load_dataset` 메서드를 통해 프로그래밍 방식으로 데이터셋을 가져올 수 있도록 합니다.
  • 데이터셋은 콤마로 분리된 파일 형식으로 저장되며, 표준화된 컬럼 구조를 갖습니다: `pid`, `event`, `time`, `time2`(시간에 따라 변하는 특징이 있는 경우), 그 다음으로 `num_` 접두어가 붙은 수치형 특징과 `fac_` 접두어가 붙은 범주형 특징이 옵니다.
  • 모든 데이터셋은 통일성을 확보하기 위해 사전 전처리가 이루어집니다: 이벤트 지표는 이진값(1 = 이벤트 발생), 생존 시간은 음수가 아니며, 특징은 자동 전처리를 위한 레이블링이 되어 있습니다(예: 범주형 특징에 대한 원핫 인코딩, 수치형 특징에 대한 정규화).
  • 레포지터리는 기존의 R 패키지 및 공공 데이터베이스(예: GEO, Mayo Clinic, Duke Databank)에서 유래한 76개의 데이터셋을 포함하며, 메타데이터 및 출처 참조 정보가 함께 제공됩니다.
  • 시간에 따라 변하는 특징은 데이터 행 수를 최소화하면서도 모든 특징 변화 정보를 유지할 수 있도록 간격을 집계하여 처리함으로써 효율적인 모델링을 보장합니다.
  • 레포지터리는 버전 관리가 되어 있으며, PyPI(`pip install SurvSet`)와 GitHub를 통해 접근 가능하여 기계학습 워크플로우에 원활하게 통합될 수 있습니다.

실험 결과

연구 질문

  • RQ1다양한 차원성, 배경, 시간 의존성 요소를 지닌 다양한 시간-이벤트 데이터셋에 대해 단일이고 일관된 전처리 파이프라인을 적용할 수 있는가?
  • RQ2SurvSet 데이터셋의 통일된 구조가 기계학습 및 통계 생존 모델의 평가 효율성을 얼마나 향상시키는가?
  • RQ3기존의 생존 모델들(예: 정규화된 선형 모델)이 다양한 실제 세계의 T2E 데이터셋에서 일관된 분포를 보이는 콘cordance 지수를 도출할 수 있는가?
  • RQ4SurvSet은 생물의학적 및 비생물의학적 분야 모두에서 새로운 생존 모델의 신뢰할 수 있고 확장 가능한 평가 기반 플랫폼으로 기능할 수 있는가?
  • RQ5표준화되고 오픈소스인 T2E 데이터의 가용성이 생존 분석 연구에서 재현 가능성과 비교 가능성에 어떤 영향을 미치는가?

주요 결과

  • SurvSet은 일관된 형식으로 76개의 시간-이벤트 데이터셋을 제공하여, 모든 데이터셋에 동일한 전처리 파이프라인을 균일하게 적용할 수 있도록 합니다.
  • 레포지터리는 Python 및 R 사용자를 모두 지원하며, `pip install SurvSet`을 통한 설치와 R 사용자를 위한 GitHub를 통한 직접 접근이 가능합니다.
  • 데이터셋은 차원성 면에서 다양하게 분포되어 있으며, 고차원 유전자형 데이터셋(예: gse1992, p ≫ n)과 장기적이고 얇은 데이터셋(예: hdfail, n ≫ p)이 포함되어 있습니다.
  • 초기 실증 평가 결과, 각 데이터셋에 정규화된 선형 모델을 피팅한 결과 콘코르던스 지수의 분포가 약간 균일한 편이었으며, 이는 데이터셋 간 예측 성능의 다양성을 시사합니다.
  • `pid`, `event`, `time`, `time2`, `num_` 특징, `fac_` 특징을 포함한 표준화된 컬럼 구조는 자동화된 데이터 처리 및 모델 훈련을 가능하게 합니다.
  • SurvSet은 랜덤 포레스트, 그래디언트 부스팅, 커널 방법, 딥러닝과 같은 현대 기계학습 방법의 생존 모델링 평가를 지원하도록 설계되었으며, 최소한의 데이터 준비 오버헤드로도 활용이 가능합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.