Skip to main content
QUICK REVIEW

[論文レビュー] Two-phase analysis and study design for survival models with error-prone exposures

Kyunghee Han, Thomas Lumley|arXiv (Cornell University)|May 12, 2020
Statistical Methods and Inference参考文献 22被引用数 4
ひとこと要約

本稿は、誤差を含む曝撃要因を伴う二段階生存分析へ平均スコア法を拡張し、検証されていない共変量から得られる補助データを用いて測定誤差を補正する。コスト制約下で分散を最小化するように最適化されたアダプティブサンプリング設計を提案し、シミュレーションおよび実データにおいて、特に最適なパイロットサンプリングと層別割り当てをとった場合、ほぼオラクル性能に近い結果を達成した。

ABSTRACT

Increasingly, medical research is dependent on data collected for non-research purposes, such as electronic health records data (EHR). EHR data and other large databases can be prone to measurement error in key exposures, and unadjusted analyses of error-prone data can bias study results. Validating a subset of records is a cost-effective way of gaining information on the error structure, which in turn can be used to adjust analyses for this error and improve inference. We extend the mean score method for the two-phase analysis of discrete-time survival models, which uses the unvalidated covariates as auxiliary variables that act as surrogates for the unobserved true exposures. This method relies on a two-phase sampling design and an estimation approach that preserves the consistency of complete case regression parameter estimates in the validated subset, with increased precision leveraged from the auxiliary data. Furthermore, we develop optimal sampling strategies which minimize the variance of the mean score estimator for a target exposure under a fixed cost constraint. We consider the setting where an internal pilot is necessary for the optimal design so that the phase two sample is split into a pilot and an adaptive optimal sample. Through simulations and data example, we evaluate efficiency gains of the mean score estimator using the derived optimal validation design compared to balanced and simple random sampling for the phase two sample. We also empirically explore efficiency gains that the proposed discrete optimal design can provide for the Cox proportional hazards model in the setting of a continuous-time survival outcome.

研究の動機と目的

  • ゴールスタンダードの曝撃要因データがすべての被験者に対して入手できない場合の生存アウトカムにおける測定誤差を解消すること。
  • 従来、離散時間生存および二値アウトカムに用いられてきた平均スコア法を、誤差を含む曝撃要因を伴う連続時間生存モデルへ拡張すること。
  • 固定コスト制約下で、目的の回帰パラメータの分散を最小化する最適な二段階サンプリング設計を開発すること。
  • ネイマン配分に基づく最適なサンプリング割合を導出する。
  • パイロットフェーズを用いて、最適な層別割り当てに必要なノイズパラメータを推定するアダプティブ設計を提案すること。
  • シミュレーションおよび実データにおいて、提案された設計が単純無作為抽出およびバランスサンプリングに比べて得られる効率性の向上を評価すること。

提案手法

  • 二段階サンプリング設計を用いる:第1フェーズでは全被験者に対して容易に入手可能な誤差を含む曝撃要因データを収集し、第2フェーズではサブセットを検証して測定誤差構造を推定する。
  • 誤差を含む曝撃要因を補助変数として用い、平均スコア法を適用して、離散時間比例ハザードモデルにおける回帰パラメータ推定値を補正する。
  • ネイマン配分を用いて最適なサンプリング割合を導出し、固定された検証サンプルサイズ下で、目的パラメータの分散を最小化する。
  • マルチウェーブサンプリング戦略を導入:パイロットフェーズでノイズパラメータ(例:層別平均および分散)を推定し、本フェーズでのアダプティブ割り当てを可能にする。
  • パイロットデータに基づいてサンプリングを調整する修正アダプティブ設計を採用し、バランスサンプリングや単純無作為抽出に比べて性能を向上させる。
  • Cox比例ハザードモデルを用いた連続時間生存分析へその結果を拡張し、同じ設計フレームワーク下で、効率性の向上を示した。

実験結果

リサーチクエスチョン

  • RQ1誤差を含む曝撃要因を伴う離散時間生存モデルの二段階解析へ、平均スコア法を効果的に拡張できるか?
  • RQ2固定コスト制約下で、目的回帰パラメータの分散を最小化するための最適なサンプリング割合をどのように導出できるか?
  • RQ3パイロットフェーズを用いてノイズパラメータを推定することが、アダプティブサンプリング設計の効率性に与える影響は何か?
  • RQ4提案されたアダプティブ設計は、単純無作為抽出およびバランスサンプリングに比べて、分散低減および推定効率性の面でどの程度優れているか?
  • RQ5得られた最適設計は、Coxモデルを用いた連続時間生存分析において、どの程度の効率性向上を達成できるか?

主な発見

  • National Wilms Tumor Study データにおいて、提案された平均スコア推定器とアダプティブサンプリング設計は、バランスサンプリングおよび単純無作為抽出に比べて分散を最大で14%まで低減した。
  • パイロットフェーズを含むアダプティブ設計は、真の母集団パラメータを用いるオラクル設計の性能に非常に近づき、特に情報量の少ない層への過剰サンプリングを避ける戦略的パイロットサンプル選択がなされた場合に顕著であった。
  • 以前の分析で除外されていた一時的虚偽打ち切り被験者(n = 158)を含めることで、特に MS-BAL および MS-A 推定器において精度が向上した。
  • 段階的サンプルサイズが増加するにつれて、完全ケース解析や他のサンプリング戦略に比べ、本手法は一貫した効率性の向上を示した。
  • すべてのシミュレーション設定およびデータ例において、アダプティブ設計は単純無作為抽出およびバランスサンプリングを上回り、ロバストネスと実用的価値を示した。
  • Coxモデルを用いた連続時間生存アウトカムへも本手法は成功裏に拡張され、タイプIおよびランダム右打ち切りの両方の状況で、効率性の向上が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。