Skip to main content
QUICK REVIEW

[論文レビュー] Empirical Risk Minimization under Random Censorship: Theory and Practice

Guillaume Ausset, Stéphan Clémençon|arXiv (Cornell University)|Jun 5, 2019
Statistical Methods and Inference参考文献 43被引用数 4
ひとこと要約

本稿では、右打ち切りを伴う生存データにおける回帰のための経験的リスク最小化を可能にする、カプラン=マイヤーに基づくプラグイン推定量を提案する。やや弱い条件下で、このバイアス付き/重み付きリスク関数の最小化子の学習速度は、$ O_{\mathbb{P}}(\sqrt{\log n / n}) $ に達し、プラグイン推定によるバイアスを無視した場合、打ち切りのない経験的リスク最小化(ERM)と同等の性能を示す。

ABSTRACT

We consider the classic supervised learning problem, where a continuous non-negative random label $Y$ (i.e. a random duration) is to be predicted based upon observing a random vector $X$ valued in $\mathbb{R}^d$ with $d\geq 1$ by means of a regression rule with minimum least square error. In various applications, ranging from industrial quality control to public health through credit risk analysis for instance, training observations can be right censored, meaning that, rather than on independent copies of $(X,Y)$, statistical learning relies on a collection of $n\geq 1$ independent realizations of the triplet $(X, \; \min\{Y,\; C\},\; δ)$, where $C$ is a nonnegative r.v. with unknown distribution, modeling censorship and $δ=\mathbb{I}\{Y\leq C\}$ indicates whether the duration is right censored or not. As ignoring censorship in the risk computation may clearly lead to a severe underestimation of the target duration and jeopardize prediction, we propose to consider a plug-in estimate of the true risk based on a Kaplan-Meier estimator of the conditional survival function of the censorship $C$ given $X$, referred to as Kaplan-Meier risk, in order to perform empirical risk minimization. It is established, under mild conditions, that the learning rate of minimizers of this biased/weighted empirical risk functional is of order $O_{\mathbb{P}}(\sqrt{\log(n)/n})$ when ignoring model bias issues inherent to plug-in estimation, as can be attained in absence of censorship. Beyond theoretical results, numerical experiments are presented in order to illustrate the relevance of the approach developed.

研究の動機と目的

  • 訓練データがランダムな右打ち切りにさらされている場合、真のラベル $ Y $ がランダムな打ち切り時刻 $ C $ を超えて観測されないという状況における回帰問題における経験的リスク最小化の挑戦に対処すること。
  • 条件付き打ち切り生存関数 $ C $ が $ X $ を与えたもとでのカプラン=マイヤー推定量を用いて打ち切りを反映させる理論的裏付けのある、プラグインベースの真のリスク推定量の開発。
  • 得られた重み付き経験的リスク関数に対する非漸近的一般化バウンドの確立。これにより、打ち切り下でも最適に近い学習速度を保証する。
  • 多様な次元と打ち切り率の下で、線形回帰、SVR、ランダムフォレストなど多様な学習モデルを用いて、手法の実証的妥当性を検証すること。

提案手法

  • 未観測の打ち切り生存関数 $ C $ が $ X $ を与えたもとでの推定量として、非パラメトリックなカプラン=マイヤー推定量を用いることで、真のリスクのプラグイン推定量を提案。これにより、重み付き経験的リスク関数が得られる。
  • カプラン=マイヤーリスクを、$ X $ を与えたもとでの打ち切り生存関数の推定逆数から得られる重みを用いた標準的経験的リスクの重み付き版として定義する。
  • 重み付きリスクの経験過程を分析するため、$ U $-プロセス理論と最大偏差バウンドを用い、リスク推定量の濃度不等式を確立する。
  • 退化 $ U $-プロセスに関する補題8を適用し、VC型の複雑度と有界性条件を活用して、重み付き経験過程の乖離を制御する。
  • カーネル密度推定と一様エントロピー条件を用いて、推定リスクの期待値からの本質的最大偏差に対する非漸近的バウンドを導出する。
  • 打ち切り指標 $ \delta $ と条件付き生存関数の両方を考慮する二重ロバストな重み付け方式を採用。これにより、やや弱い正則性条件下でも一貫したリスク推定が可能となる。

実験結果

リサーチクエスチョン

  • RQ1真のラベルがランダムな打ち切り時刻を越えて観測されない右打ち切り応答変数を伴う回帰問題において、経験的リスク最小化を一貫して拡張できるか。
  • RQ2カプラン=マイヤー推定量を用いて打ち切りを反映させるプラグイン推定量を用いたリスク推定量を用いる場合、経験的リスク最小化子が達成可能な最適な学習速度は何か。
  • RQ3特に高次元入力空間において、打ち切りを無視する単純なERM手法と比較して、提案手法のカプラン=マイヤーリスク推定量の性能はどの程度向上するか。
  • RQ4打ち切り下で、重み付き経験的リスク関数に対する非漸近的一般化バウンドをどのように確立できるか。

主な発見

  • カプラン=マイヤーリスク関数の最小化子の学習速度は、$ O_{\mathbb{P}}(\sqrt{\log n / n}) $ であり、やや弱い正則性条件下で、打ち切りがない場合に達成可能な最適速度と一致する。
  • 提案手法は、打ち切り変数 $ C $ が $ X $ を与えたもとでの条件付き生存関数のカプラン=マイヤー推定量に基づくプラグイン推定量を用いることで、一貫したリスク推定を達成する。
  • 数値実験の結果、打ち切りを考慮したIPCW推定量は、打ち切りを無視する単純なERM手法を著しく上回り、特に高打切り率および高次元空間下で顕著な性能向上を示す。
  • 線形回帰、サポートベクターレグレッション、ランダムフォレストを含む多様なモデルにおいて、本手法は一貫した一般化性能を維持し、$ L^2 $ 誤差の観点で一貫した改善をもたらす。
  • 理論的分析により、重み付き経験的リスクプロセスが $ U $-プロセス理論によって適切に制御され、偏差バウンドが $ O(\sqrt{\log n / n}) $ のスケールで成立することが確認された。
  • プラグイン推定によるモデルバイアスに対しても本手法はロバストであり、理論的解析においてそのバイアスを無視しても、依然として最適な学習速度が保たれる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。