[论文解读] On the Nuisance of Control Variables in Regression Analysis
本文主张,多元回归中的控制变量通常存在内生性问题,其估计系数因混杂机制的存在而缺乏因果解释。作者建议应省略或仅将控制变量系数保留在附录中,转而聚焦于主要处理效应的因果识别,以避免在管理学与组织研究中产生误导性解读。
Control variables are included in regression analyses to estimate the causal effect of a treatment on an outcome. In this paper, we argue that the estimated effect sizes of controls are unlikely to have a causal interpretation themselves, though. This is because even valid controls are possibly endogenous and represent a combination of several different causal mechanisms operating jointly on the outcome, which is hard to interpret theoretically. Therefore, we recommend refraining from interpreting marginal effects of controls and focusing on the main variables of interest, for which a plausible identification argument can be established. To prevent erroneous managerial or policy implications, coefficients of control variables should be clearly marked as not having a causal interpretation or omitted from regression tables altogether. Moreover, we advise against using control variable estimates for subsequent theory building and meta-analyses.
研究动机与目标
- 挑战在回归分析中将控制变量系数解释为具有因果意义的普遍做法。
- 强调即使有效的控制变量也可能存在内生性,反映多个未观测到的因果机制的联合效应,使其边际效应难以解释。
- 指出过度解读控制变量估计值可能引发错误的管理或政策推论的风险。
- 倡导将控制变量视为干扰参数而非实质性研究发现,以避免在实证研究中误用。
- 由于控制变量估计缺乏因果清晰性,建议在理论构建与元分析中避免使用其估计值。
提出的方法
- 采用潜在结果框架与因果图(d-分离)评估回归模型中应控制哪些变量。
- 利用图形因果模型区分有效控制与不良控制,强调控制变量仍可能存在内生性。
- 应用后门准则识别可阻断后门路径的调整集,确保处理效应估计的一致性。
- 建议研究者应聚焦于识别并合理论证主要处理变量,而非依赖控制变量的符号或显著性。
- 提议将控制变量系数从主回归表格中省略,或移至附录,并在表格注释中明确标注。
- 批评使用R²提升与增量F检验来决定是否纳入控制变量,主张应基于理论驱动的模型设定。
实验结果
研究问题
- RQ1为何尽管控制变量被纳入以改善估计,其回归模型中的系数仍常缺乏有效的因果解释?
- RQ2当控制变量系数被解释为因果关系时,若其存在内生性或受未观测因素混杂,会产生何种后果?
- RQ3研究者应如何报告控制变量结果,以避免在实证管理学与组织研究中产生误导性结论?
- RQ4鉴于控制变量估计的因果状态不确定,其在元分析或理论发展中的使用程度应如何界定?
- RQ5当控制变量系数可能产生偏误或难以解释时,其在回归模型中的适当角色是什么?
主要发现
- 2015至2020年间,《组织科学》与《战略管理杂志》中47%的基于回归的论文明确讨论了控制变量的估计效应大小,表明该解释实践广泛存在。
- 控制变量系数不太可能具有因果解释,因其可能反映多个未观测到的因果机制共同作用于结果变量。
- 即使控制变量是有效的,也可能因未观测到的混杂因素而存在内生性,从而削弱其孤立解释的可靠性。
- 如表1(第6至8列)所示,控制变量系数在不同调整集之间存在显著差异,表明其估计不稳定且缺乏唯一因果意义。
- 元分析应仅限于具有合理识别依据的主要处理变量,因为控制变量估计因因果状态模糊,对累积证据的贡献甚微。
- 省略或仅将控制变量系数保留在附录中,可防止误导性解读,并在不损失方法严谨性的前提下简化稿件呈现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。