Skip to main content
QUICK REVIEW

[論文レビュー] Accelerated and interpretable oblique random survival forests

Byron C. Jaeger, Sawyer Welden|arXiv (Cornell University)|Aug 1, 2022
Data Analysis with R被引用数 5
ひとこと要約

本稿では、ニュートン・ラプソンスコア法を用いて計算コストを著しく削減する高速化・解釈可能な斜交ランダム生存フォレスト(aorsf)を提案する。これにより、約450倍の高速化を達成しながらも、高い予測精度を維持する。また、特徴量の寄与度を解釈するための「否定による変数重要度」を提案し、シミュレーションにおいて、順列法やSHAP法を上回る性能を示し、関連する予測子を効果的に同定する。

ABSTRACT

The oblique random survival forest (RSF) is an ensemble supervised learning method for right-censored outcomes. Trees in the oblique RSF are grown using linear combinations of predictors, whereas in the standard RSF, a single predictor is used. Oblique RSF ensembles have high prediction accuracy, but assessing many linear combinations of predictors induces high computational overhead. In addition, few methods have been developed for estimation of variable importance (VI) with oblique RSFs. We introduce a method to increase computational efficiency of the oblique RSF and a method to estimate VI with the oblique RSF. Our computational approach uses Newton-Raphson scoring in each non-leaf node, We estimate VI by negating each coefficient used for a given predictor in linear combinations, and then computing the reduction in out-of-bag accuracy. In benchmarking experiments, we find our implementation of the oblique RSF is hundreds of times faster, with equivalent prediction accuracy, compared to existing software for oblique RSFs. We find in simulation studies that ‘negation VI’ discriminates between relevant and irrelevant numeric predictors more accurately than permutation VI, Shapley VI, and a technique to measure VI using analysis of variance. All oblique RSF methods in the current study are available in the aorsf R package, and additional supplemental materials are available online.

研究の動機と目的

  • 斜交ランダム生存フォレスト(RSF)の高い計算コストが、大規模な生存データ解析への応用を制限しているという問題に取り組む。
  • 従来の変数重要度手法(例:順列法)が、予測子の線形結合のため効果が薄いことから、斜交RSFの解釈性を向上させる。
  • 各ノードでコックス部分尤度にニュートン・ラプソンスコア法を適用することで、斜交RSFの適合を高速かつスケーラブルに実現するアルゴリズムを開発する。
  • 値の順列を入れ替えるのではなく、係数を反転させることで予測子の影響を評価する、新規の変数重要度手法「否定重要度」を導入する。
  • ベンチマークおよびシミュレーション研究を通じて、提案手法の性能を既存手法と比較する。

提案手法

  • 各非リーフノードにおいて、コックス部分尤度を最適化するため、ニュートン・ラプソンスコア法を適用し、最適な予測子の線形結合の探索空間を縮小する。
  • すべての可能な組み合わせを全検索するのではなく、高速で反復的な最適化手法を用いて、ノード分割に最適な予測子の線形結合を特定する。
  • 各線形結合における予測子の係数を反転させ、アウトオブバッグの予測精度を再評価し、その低下量を測定することで「否定による変数重要度」を実装する。
  • 高速化された適合法および変数重要度手法をaorsf Rパッケージに統合し、オープンソースでの利用と再現可能性を確保する。
  • 時間依存型 concordance(c-index)とブリーダー得点を用いて、提案手法と既存実装(例:obliqueRSF、ranger、xgboost)の性能を比較する。
  • 相関、サンプルサイズ、予測子効果の変動を想定したシミュレーションスタディを実施し、変数重要度手法のロバストネスと識別能力を評価する。

実験結果

リサーチクエスチョン

  • RQ1ニュートン・ラプソン最適化により、予測精度を損なわず斜交RSFの計算負荷を軽減できるか?
  • RQ2「否定による変数重要度」は、順列重要度、SHAP、ANOVAベースの手法よりも、関連する予測子と無関係な予測子をより信頼性高く識別できるか?
  • RQ3加速されたaorsfの性能は、既存のRSFおよび生存モデル実装と比較して、予測精度と実行時間の両面で優れているか?
  • RQ4相関のある予測子や非線形効果を含む多様なデータ構造において、本手法は識別能力を維持または向上させられるか?
  • RQ5aorsf手法は、生存予測タスクにおいて、主効果、相互作用効果、組み合わせ効果を一貫して特定できるか?

主な発見

  • 加速されたaorsfの実装は、既存の斜交RSFソフトウェアと比較して約450倍高速であり、時間依存型c-indexは同等で、ブリーダー得点は優れている。
  • 「否定重要度」手法は、順列重要度、SHAP、ANOVAベースの重要度を上回り、特に相関が高い環境や非線形設定において、関連する予測子と無関係な予測子を識別する能力に優れている。
  • 2,500件の観察と30個の予測子を含むシミュレーションでは、否定重要度は主効果の識別精度が99.8%に達したのに対し、順列重要度は95.2%であった。
  • 組み合わせ効果の評価では、否定重要度がn=2,500で99.8%の識別精度を示し、順列法(89.0%)とSHAP法(97.9%)を大きく上回った。
  • aorsf手法は、すべてのベンチマークタスクで高い予測精度を維持し、c-indexは0.705から0.797の範囲にあり、ほとんどのデータセットで2秒未満の計算時間であった。
  • aorsf Rパッケージは、本研究で提案したすべての手法を含んでおり、大規模なバイオメディカルデータに対する効率的かつ解釈可能な生存モデリングを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。