Skip to main content
QUICK REVIEW

[论文解读] Causal inference for ordinal outcomes

Alexander Volfovsky, Edoardo M. Airoldi|arXiv (Cornell University)|Jan 6, 2015
Advanced Causal Inference Techniques参考文献 3被引用 14
一句话总结

本文提出了一类用于有序非数值结果的条件因果估计算法,基于潜在结果框架,利用贝叶斯模型中的秩似然估计治疗效应,无需假设尺度。结果表明,父母教育显著提高了教育程度,尤其对控制组中具有高中或以上教育水平者影响显著,后验中位数在敏感性分析中保持一致的治疗效应。

ABSTRACT

Many outcomes of interest in the social and health sciences, as well as in modern applications in computational social science and experimentation on social media platforms, are ordinal and do not have a meaningful scale. Causal analyses that leverage this type of data, termed ordinal non-numeric, require careful treatment, as much of the classical potential outcomes literature is concerned with estimation and hypothesis testing for outcomes whose relative magnitudes are well defined. Here, we propose a class of finite population causal estimands that depend on conditional distributions of the potential outcomes, and provide an interpretable summary of causal effects when no scale is available. We formulate a relaxation of the Fisherian sharp null hypothesis of constant effect that accommodates the scale-free nature of ordinal non-numeric data. We develop a Bayesian procedure to estimate the proposed causal estimands that leverages the rank likelihood. We illustrate these methods with an application to educational outcomes in the General Social Survey.

研究动机与目标

  • 解决在类别间相对大小关系未定义的情况下,有序非数值结果缺乏有效因果估计算法的问题。
  • 构建一种尊重有序数据无尺度特性的因果推断框架,避免对等距测量的假设。
  • 提出一种基于秩似然的贝叶斯估计程序,以推断治疗效应,而无需依赖潜在变量的可识别性。
  • 使用来自一般社会调查的真实教育结果数据,说明该方法在评估父母教育对子女教育成就影响中的应用。
  • 证明传统的一维估计算法(如平均治疗效应)不适用于有序非数值数据,因其缺乏有意义的尺度。

提出的方法

  • 提出一类多维估计算法,具体为:在控制结果为 $Y(0) = j$ 的条件下,治疗下潜在结果的中位数 $\text{median}[Y(1) \mid Y(0) = j]$。
  • 对费雪的常数效应原假设进行放松,以适应无尺度的有序数据,采用基于潜在结果之间相关性的检验统计量。
  • 采用具有有序probit链接函数的贝叶斯分层模型,以建模潜在连续的潜在结果。
  • 使用秩似然作为似然函数,避免对潜在尺度的参数假设,从而实现对观测尺度估计算法的后验预测推断。
  • 实施后验预测抽样(50,000次抽样),在不同相关性假设下估计条件估计算法的中位数和可信区间。
  • 使用似然型区间并针对相关性 $\rho$ 进行敏感性分析,以评估结果对潜在尺度假设的稳健性。

实验结果

研究问题

  • RQ1当缺乏相对大小关系的尺度时,如何为有序非数值结果有意义地定义因果估计算法?
  • RQ2在有序非数值数据中,如何构建一种有效的假设检验框架,以放松常数效应的假设?
  • RQ3如何将贝叶斯推断调整为在不依赖可识别潜在变量的前提下,估计有序结果的因果效应?
  • RQ4结果在多大程度上依赖于潜在潜在结果之间相关性的假设?
  • RQ5能否对由控制潜在结果定义的子群体有意义地估计和解释条件治疗效应?

主要发现

  • 对于控制组中教育水平为“<高中”者($Y(0) = 1$),$\text{median}[Y(1) \mid Y(0) = \text{``<high school''}}]$ 的后验中位数估计范围为4(学士)至2(高中),95%可信区间同时包含两者,表明对相关性假设具有轻微敏感性。
  • 对于控制组中具有高中文凭者($Y(0) = 2$),$Y(1)$ 的后验中位数估计为4(学士),95%可信区间为(2,4),表明存在强烈的治疗效应。
  • 对于控制组中拥有副学士学位者($Y(0) = 3$),$Y(1)$ 的后验中位数估计为5(研究生学位),95%可信区间为(4,5),表明存在显著的治疗效应。
  • 对于控制组中预计获得学士学位者($Y(0) = 4$),$Y(1)$ 的后验中位数估计为5(研究生学位),95%可信区间为(4,5),表明持续存在向上流动。
  • 对于控制组中已拥有研究生学位者($Y(0) = 5$),$Y(1)$ 的后验中位数估计为5(研究生学位),95%可信区间为(5,5),表明无治疗效应。
  • 分析表明,父母拥有大学学位可使所有在控制组中预计达到高中或以上教育水平的个体至少获得大学学位,证实了强烈且条件性的治疗效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。