[論文レビュー] Human Wellbeing and Machine Learning
本研究では、ドイツ、イギリス、アメリカの大规模なアンケートデータを用いて、主観的幸福度を予測するための機械学習(ML)手法——特に木構造ベースのモデル(ランダムフォレストや勾配ブースティング)——の有効性を評価している。MLモデルは、従来のOLS回帰と比較して優れた性能を示し、予測変数のセットを拡張した場合に特に顕著で、決定係数(R-squared)が最大0.32に達した。これは、健康状態、物的条件、社会的関係といった、既に確立された幸福度の決定要因を裏付ける結果である。
There is a vast literature on the determinants of subjective wellbeing. International organisations and statistical offices are now collecting such survey data at scale. However, standard regression models explain surprisingly little of the variation in wellbeing, limiting our ability to predict it. In response, we here assess the potential of Machine Learning (ML) to help us better understand wellbeing. We analyse wellbeing data on over a million respondents from Germany, the UK, and the United States. In terms of predictive power, our ML approaches do perform better than traditional models. Although the size of the improvement is small in absolute terms, it turns out to be substantial when compared to that of key variables like health. We moreover find that drastically expanding the set of explanatory variables doubles the predictive power of both OLS and the ML approaches on unseen data. The variables identified as important by our ML algorithms - $i.e.$ material conditions, health, and meaningful social relations - are similar to those that have already been identified in the literature. In that sense, our data-driven ML results validate the findings from conventional approaches.
研究の動機と目的
- 機械学習(ML)モデルが、従来の線形モデルと比較して、主観的幸福度の予測精度を向上させるかどうかを評価すること。
- アンケートデータを用いた場合の幸福度予測の上限性能を特定すること。
- MLが特定した重要な変数が、従来の幸福度研究文脈における要因と整合しているかどうかを評価すること。
- 説明変数のセットを拡張することによるモデル性能への影響を検討すること。
- 個体固定効果を含むパネルデータ構造を用いて、MLの結果の妥当性を検証すること。
提案手法
- ドイツのSOEP、イギリスのUKHLS、アメリカのガロップ・デイリーポールの3つの大規模アンケートデータセットを用い、合計100万人を超える被験者をカバーした。
- ランダムフォレスト(RF)と勾配ブースティング(GB)の木構造ベースのMLアルゴリズムを適用し、比較のための正則化回帰とOLSを併用した。
- 2段階の変数セットアプローチを実施:「制限付きセット」(標準的な予測変数)と「拡張セット」(幸福度以外のすべての変数)を用い、予測性能の向上を評価した。
- すべてのモデル(OLSを含む)において、変数の重要度を順位付けするために、パーミュテーション重要度と疑似部分回帰効果を用いた。
- パネルデータに対して、個体レベルの時間不変平均とその偏差を含めるMundlak型補正を実施し、観察されない異質性を制御した。
- 交差検証を用いて妥当性を確保しつつ、未知のデータにおける決定係数(R-squared)を指標として、モデル性能を評価した。
実験結果
リサーチクエスチョン
- RQ1MLアルゴリズムは、従来の線形モデルと比較して、幸福度の予測において顕著に優れた性能を示すか?
- RQ2アンケートデータに基づく幸福度の予測において、我々の能力の上限は何か?
- RQ3MLアルゴリズムが特定した重要な変数は、従来の幸福度研究文脈における要因と整合しているか?
- RQ4説明変数のセットを拡張することで、OLSおよびMLモデルの予測性能にどのような影響が生じるか?
- RQ5パネルデータにおける個体固定効果を考慮した場合、MLモデルの性能はどのようになるか?
主な発見
- 特に勾配ブースティングを用いた木構造ベースのMLモデルは、OLSを上回る性能を示し、決定係数(R-squared)が絶対的に最大0.03向上した。これは、健康状態の有無が与える予測力と同等またはそれを上回る。
- 標準的な「制限付きセット」から、利用可能な全変数を含む「拡張セット」に予測変数を拡張することで、幸福度の説明変動が2倍以上に増加し、データセット全体で決定係数(R-squared)が約0.15から約0.30に上昇した。
- すべてのモデルとデータセットを統合した結果、最大の達成可能な決定係数(R-squared)は約0.32であり、これは現在のアンケートデータを用いた幸福度予測の実用的上限を示唆している。
- MLモデルによる変数重要度順位(パーミュテーション重要度を用いて算出)は、OLSとの間に強い相関(ρ = 0.58~0.83)を示し、両手法間で一貫性があることが確認された。
- MLが特定した最重要な予測要因は、健康状態、物的条件、意味のある社会的関係——これらは、従来の幸福度研究で長年にわたり確認された核心的要因である。
- パネルデータ分析において、共変数の個体レベル時間不変平均が最も強い予測要因であった。また、その偏差(例:健康状態の変化)も、幸福度予測に有意義に寄与していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。