Skip to main content
QUICK REVIEW

[论文解读] Human Wellbeing and Machine Learning

Ekaterina Oparina, Caspar Kaiser|arXiv (Cornell University)|Jun 1, 2022
Health disparities and outcomes被引用 6
一句话总结

本研究评估了机器学习(ML)方法——特别是树模型如随机森林和梯度提升——在使用德国、英国和美国的大规模调查数据预测主观幸福感方面的表现。与传统的普通最小二乘法(OLS)回归相比,ML模型表现更优,尤其是在使用扩展的预测变量集时,决定系数R²最高达到0.32,这验证了健康、物质条件和社会关系等既定的幸福感决定因素。

ABSTRACT

There is a vast literature on the determinants of subjective wellbeing. International organisations and statistical offices are now collecting such survey data at scale. However, standard regression models explain surprisingly little of the variation in wellbeing, limiting our ability to predict it. In response, we here assess the potential of Machine Learning (ML) to help us better understand wellbeing. We analyse wellbeing data on over a million respondents from Germany, the UK, and the United States. In terms of predictive power, our ML approaches do perform better than traditional models. Although the size of the improvement is small in absolute terms, it turns out to be substantial when compared to that of key variables like health. We moreover find that drastically expanding the set of explanatory variables doubles the predictive power of both OLS and the ML approaches on unseen data. The variables identified as important by our ML algorithms - $i.e.$ material conditions, health, and meaningful social relations - are similar to those that have already been identified in the literature. In that sense, our data-driven ML results validate the findings from conventional approaches.

研究动机与目标

  • 评估机器学习(ML)模型在预测主观幸福感方面是否显著优于传统线性模型。
  • 确定基于调查数据预测幸福感的预测性能上限。
  • 评估ML识别出的重要变量是否与传统幸福感文献中的结果一致。
  • 检验扩大解释变量集合对模型性能的影响。
  • 通过包含个体固定效应的面板数据结构,检验ML结果的稳健性。

提出的方法

  • 使用了三个大规模调查数据集:德国SOEP、英国HLS和美国盖洛普每日调查,覆盖超过一百万受访者。
  • 应用基于树的ML算法:随机森林(RF)和梯度提升(GB),并以惩罚回归和OLS作为对比基准。
  • 采用两阶段变量集方法:'受限集'(标准预测变量)和'扩展集'(所有非幸福感变量),以评估预测性能的提升。
  • 使用排列重要性与伪部分效应,对所有模型(包括OLS)的变量重要性进行排序。
  • 针对面板数据,采用Mundlak型校正方法,通过引入个体层面的时间不变均值及其偏离值,以控制未观测异质性。
  • 通过在未见数据上的R²及交叉验证来评估模型性能,确保结果稳健。

实验结果

研究问题

  • RQ1ML算法在预测幸福感方面是否显著优于传统线性模型?
  • RQ2基于调查数据,预测幸福感的能力上限是什么?
  • RQ3ML算法识别出的重要变量是否与传统幸福感文献中的结果一致?
  • RQ4扩大解释变量集合对OLS和ML模型的预测性能有何影响?
  • RQ5在考虑面板数据中个体固定效应时,ML模型的表现如何?

主要发现

  • 基于树的ML模型,特别是梯度提升,预测幸福感的表现优于OLS,绝对R²提升最高达0.03,相当于或超过健康状况的预测能力。
  • 将预测变量集从标准的'受限集'扩展到完整的'扩展集',使幸福感的解释方差翻倍以上,R²在各数据集中从约0.15提升至约0.30。
  • 所有模型和数据集中可达到的最大R²约为0.32,表明当前调查数据下预测准确性的实际上限。
  • 通过排列重要性得出的ML模型变量重要性排名与OLS结果具有强相关性(ρ = 0.58至0.83),证实了不同方法间的一致性。
  • ML识别出的最重要预测变量为健康、物质条件和有意义的社会关系——这些正是传统幸福感研究中已确立的核心决定因素。
  • 在面板数据分析中,协变量的个体层面时间不变均值是最强的预测变量,其偏离值(如健康状况的变化)也对幸福感预测有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。