Skip to main content
QUICK REVIEW

[論文レビュー] SurvSet: An open-source time-to-event dataset repository

Erik Drysdale|arXiv (Cornell University)|Mar 7, 2022
Air Quality Monitoring and Forecasting被引用数 6
ひとこと要約

SurvSet は、機械学習および統計的生存分析手法のベンチマークに使用するための、76 個の時間までのイベント(T2E)データセットからなるオープンソースで標準化されたリポジトリです。バイオメディスン、工学、経済学の分野にまたがる多様なデータセットに対して、一貫した前処理を可能にする統一されたフォーマットと標準化されたカラム名・構造を採用しており、Python(PyPI)および R(GitHub)からアクセス可能です。

ABSTRACT

Time-to-event (T2E) analysis is a branch of statistics that models the duration of time it takes for an event to occur. Such events can include outcomes like death, unemployment, or product failure. Most modern machine learning (ML) algorithms, like decision trees and kernel methods, are supported for T2E modelling with data science software (python and R). To complement these developments, SurvSet is the first open-source T2E dataset repository designed for a rapid benchmarking of ML algorithms and statistical methods. The data in SurvSet have been consistently formatted so that a single preprocessing method will work for all datasets. SurvSet currently has 76 datasets which vary in dimensionality, time dependency, and background (the majority of which come from biomedicine). SurvSet is available on PyPI and can be installed with pip install SurvSet. R users can download the data directly from the corresponding git repository.

研究の動機と目的

  • 機械学習および統計的生存モデルのベンチマークに適した、中央集権的で標準化された時間までのイベント(T2E)データセットリポジトリの欠如に対処すること。
  • すべてのデータセットに対して一貫した機械可読フォーマットを提供することで、研究者が T2E データをキュレートおよび前処理するのに要する時間と手間を削減すること。
  • すべてのデータセットが同じ構造的スキーマ(イベントインジケータ、生存時間、特徴量ラベル(数値/因子)を含む)に従うことで、生存モデルの迅速な評価と比較を可能にすること。
  • 文書化された出典を備えたキュレート済みで現実世界の T2E データセットを公開することで、生存分析における再現可能性の高い研究およびアルゴリズム開発を支援すること。
  • pip によるインストールと GitHub からの直接アクセスにより、Python および R の両方のユーザーが利用可能になるようにし、データサイエンスプラットフォーム全体にわたる広範なアクセシビリティを確保すること。

提案手法

  • SurvSet リポジトリは、一貫したフォーマットでデータセットを取得できる `load_dataset` メソッドを備えた単一のクラス `SurvLoader` を使用している。
  • データセットは、`pid`、`event`、`time`、`time2`(時変動特徴がある場合)、`num_` 前綴の数値特徴、`fac_` 前綴のカテゴリカル特徴を含む、標準化されたカラム構造のコンマ区切りファイルとして格納されている。
  • すべてのデータセットは均一性を確保するために事前に前処理されている:イベントインジケータは 2 値(1 = イベント発生)、生存時間は非負、特徴量は自動前処理(例:因子の one-hot 編碼、数値の正規化)のためのラベル付けがなされている。
  • リポジトリには、R パッケージや公的データベース(例:GEO、メイオクリニック、デューク・データバンク)から収集した 76 個のデータセットが含まれており、メタデータおよび出典参照情報も併記されている。
  • 時変動特徴は、すべての特徴変更情報を保持しつつデータ行数を最小限に抑えるために、時間間隔を集約することで処理されている。これにより、効率的なモデリングが可能になる。
  • リポジトリはバージョン管理されており、PyPI(`pip install SurvSet`)および GitHub から R ユーザーがアクセス可能で、機械学習ワークフローへのシームレスな統合を可能にしている。

実験結果

リサーチクエスチョン

  • RQ1多様な次元数、背景、時間依存性を有する時間までのイベントデータセットに、一貫した前処理パイプラインを適用可能か?
  • RQ2SurvSet データセットの均一な構造が、機械学習および統計的生存モデルのベンチマーク効率をどの程度向上させるか?
  • RQ3既存の生存モデル(例:正則化線形モデル)が、多様な現実世界の T2E データセット群において一様に分布する concordance index を得るか?
  • RQ4SurvSet は、バイオメディスン分野および非バイオメディスン分野の両方における新しい生存モデルの信頼性がありスケーラブルなベンチマークプラットフォームとして機能できるか?
  • RQ5標準化されオープンソースの T2E データの可用性が、生存分析研究における再現性および比較可能性にどのような影響を及えるか?

主な発見

  • SurvSet は、すべてのデータセットに一貫したフォーマットを提供する 76 個の時間までのイベントデータセットを提供しており、すべてのデータセットに同一の前処理パイプラインを一貫して適用可能である。
  • リポジトリは Python ユーザーと R ユーザーの両方をサポートしており、`pip install SurvSet` によるインストールと、R ユーザー向けの GitHub からの直接アクセスが可能である。
  • データセットは次元数において多様性を示しており、高次元のゲノムデータセット(例:gse1992、p ≫ n)や長く細いデータセット(例:hdfail、n ≫ p)を含む。
  • 初期の実証的評価では、各データセットに正則化線形モデルをフィットさせた結果、concordance index が概ね一様に分布しており、データセット間での予測性能の多様性が示された。
  • `pid`、`event`、`time`、`time2`、`num_` 特徴、`fac_` 特徴を含む標準化されたカラム構造により、自動化されたデータ処理およびモデル学習が可能である。
  • SurvSet は、ランダムフォレスト、勾配ブースティング、カーネル法、ディープラーニングなどの現代の機械学習手法を生存モデリングに適用するためのベンチマークを支援するように設計されており、最小限のデータ準備オーバーヘッドで利用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。