Skip to main content
QUICK REVIEW

[論文レビュー] CausalGPS: An R Package for Causal Inference With Continuous Exposures

Naeem Khoshnevis, Xiao Wu|arXiv (Cornell University)|Oct 1, 2023
Advanced Causal Inference TechniquesMathematics被引用数 3
ひとこと要約

CausalGPS は、重み付けまたはマッチングを用いた一般化された傾向スコア(GPS)を用いた連続的曝射要因における因果推論を可能にする R パッケージである。GPS推定、反復的変換による共変量のバランス最適化、アウトカムモデリングを自動化し、実世界のデータにおいてバランスの向上と効率的な推定を達成した。PM2.5 曝射分析において最適なカイパー選択とトリミング戦略を用いてその有効性が示された。

ABSTRACT

Quantifying the causal effects of continuous exposures on outcomes of interest is critical for social, economic, health, and medical research. However, most existing software packages focus on binary exposures. We develop the CausalGPS R package that implements a collection of algorithms to provide algorithmic solutions for causal inference with continuous exposures. CausalGPS implements a causal inference workflow, with algorithms based on generalized propensity scores (GPS) as the core, extending propensity scores (the probability of a unit being exposed given pre-exposure covariates) from binary to continuous exposures. As the first step, the package implements efficient and flexible estimations of the GPS, allowing multiple user-specified modeling options. As the second step, the package provides two ways to adjust for confounding: weighting and matching, generating weighted and matched data sets, respectively. Lastly, the package provides built-in functions to fit flexible parametric, semi-parametric, or non-parametric regression models on the weighted or matched data to estimate the exposure-response function relating the outcome with the exposures. The computationally intensive tasks are implemented in C++, and efficient shared-memory parallelization is achieved by OpenMP API. This paper outlines the main components of the CausalGPS R package and demonstrates its application to assess the effect of long-term exposure to PM2.5 on educational attainment using zip code-level data from the contiguous United States from 2000-2016.

研究の動機と目的

  • 連続的曝射要因を伴う観察研究において、従来の手法が重なりの欠如やバランスの悪さのため失敗するという課題に対処すること。
  • GPS 評価、仮想集団生成、アウトカムモデリングをサポートする、モジュラーで効率的かつ信頼性の高い R パッケージの開発。
  • 適切な共変量バランスを達成するために、最適なハイパーパramータおよび共変量変換の自動選択を実現すること。
  • 曝射および GPS サポートのトリミング、ハイパーパramータチューニング、反復的バランス改善のための柔軟なツールをユーザーに提供すること。

提案手法

  • ユーザーが定義したハイパーパラメータを用いて、アンサンブル機械学習モデル(例:XGBoost)を用いて GPS を推定し、パラメトリック、セミパラメトリック、非パラメトリックなアウトカムモデリングをサポートする。
  • ユーザーが定義した単変量関数(例:2乗、3乗)を、各ステップで最もバランスが悪い共変量に適用する、新しい反復的共変量変換戦略を実装する。
  • 曝射と共変量の間の絶対相関を用いて共変量バランスを評価し、バランスの閾値(例:0.1)を満たすか最大反復回数に達するまで処理を継続する。
  • 曝射(exposure_trim_qtls)および GPS 値(gps_trim_qtls)のトリミングを適用して、正の性(positivity)とサポートの重なりを改善できる。
  • 逆確率重み付けとマッチングの2つの因果推論アプローチをサポートし、マッチングでは L1 距離とカイパーに基づく近隣選択を用いる。
  • ログ記録システム、パフォーマンス最適化された C++ バックエンド、包括的なユニットテストおよび機能テストを備え、信頼性とスケーラビリティを確保する。

実験結果

リサーチクエスチョン

  • RQ1高次元の交絡要因を伴う観察データにおいて、連続的曝射要因に対して一般化された傾向スコアを効果的に推定・最適化する方法は何か?
  • RQ2マッチングに基づく因果推論において、曝射および GPS のトリミングが共変量バランスと推定効率に与える影響は何か?
  • RQ3事前に最適な変換法を知らなくても、反復的共変量変換によって GPS 推定を改善し、許容可能なバランスを達成できるか?
  • RQ4異なるハイパーパラメータ設定およびモデルライブラリが、GPS 推定および得られる因果効果推定値に与える影響は何か?
  • RQ5さまざまなトリミング設定およびハイパーパラメータ探索空間において、反復的バランス最適化の計算コストとパフォーマンスのトレードオフは何か?

主な発見

  • 曝射データを10百分位数と90百分位数にトリミングすることで、最大絶対相関が0.094にまで低下し、わずか3回の反復と287.32秒で最良のバランスが達成された。これは広いトリミング範囲よりも優れていた。
  • 最適なカイパーサイズ(delta_n)はトリミングに依存し、1st–99th では1.7、5th–95th では0.9、10th–90th では1.9であった。これはサポート定義に敏感であることを示している。
  • 反復的共変量変換アプローチにより不均衡が著しく低減され、曝射を10th–90th 百分位数にトリミングした場合、3回の反復後に最良のバランスが達成された。
  • 極端な GPS 値(gps_trim_qtls を用いて)を除外することでマッチング品質が向上したが、これはターゲット因果推定量を変更したため、因果推定量の解釈には注意が必要であることを示している。
  • 最大10回の反復で信頼性の高いパフォーマンスを達成し、広いトリミング範囲および高いハイパーパラメータ探索空間では計算コストが顕著に増加した。
  • generate_pseudo_pop() から得られる S3 オブジェクトには、元の相関と調整後の相関、最良のハイパーパラメータ、マッチング済み仮想集団を含む完全なメタデータが含まれており、完全な再現性が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。