Skip to main content
QUICK REVIEW

[論文レビュー] Infant Mortality Prediction using Birth Certificate Data

Antonia Saravanou, Clemens Noelke|arXiv (Cornell University)|Jul 21, 2019
Data-Driven Disease Surveillance参考文献 13被引用数 4
ひとこと要約

本論文は、出生証明書データを用いて、社会経済的および臨床的特徴を活用して乳児死亡率を予測する機械学習的手法を提案している。XGBoostを用いた人種別モデルの訓練により、AUCスコアが最大0.84に達し、標準的な疫学的手法を著しく上回り、母親の教育水準、人種、出生時体重が死亡率予測において重要な役割を果たしていることが示された。

ABSTRACT

The Infant Mortality Rate (IMR) is the number of infants per 1000 that do not survive until their first birthday. It is an important metric providing information about infant health but it also measures the society's general health status. Despite the high level of prosperity in the U.S.A., the country's IMR is higher than that of many other developed countries. Additionally, the U.S.A. exhibits persistent inequalities in the IMR across different racial and ethnic groups. In this paper, we study the infant mortality prediction using features extracted from birth certificates. We are interested in training classification models to decide whether an infant will survive or not. We focus on exploring and understanding the importance of features in subsets of the population; we compare models trained for individual races to general models. Our evaluation shows that our methodology outperforms standard classification methods used by epidemiology researchers.

研究の動機と目的

  • 出生証明書データに含まれる社会経済的および臨床的要因を包括的に活用して、乳児死亡率の予測精度を向上させること。
  • 一般集団モデルと比較して、人種別にモデル化することにより予測性能が向上するかどうかを調査すること。
  • 解釈可能な機械学習技術を用いて、乳児死亡率を予測する上で最も影響力のある特徴を同定すること。
  • 異なるクラス不均衡状況(1:1、1:10、1:145)におけるモデルの性能を評価し、頑健性を検証すること。
  • 高リスクのサブグループと主要なリスク要因を同定することで、公衆衛生政策に実用的インサイトを提供すること。

提案手法

  • 母体、乳児、産科的特徴を含む128の特徴を持つ、米国出生証明書データセット(2000年~2002年)を1,200万件用い、二値分類として乳児生存(あり/なし)を予測する。
  • XGBoostを用いてハイパーパramータチューニングを実施し、性能最適化を図る。
  • 人種群(白人、黒人、アメリカインディアン)ごとに別々のモデルを訓練し、集団特有のモデリングの影響を評価する。
  • AUCを用いてモデルの性能を評価し、勾配ブースティング決定木における情報ゲインを用いて特徴の重要度を分析する。
  • 実世界のデータの偏りを再現するため、異なるクラス不均衡分布(1:1、1:10、1:145)を想定し、汎化性能を評価する。
  • 母体の教育水準、婚姻状態、居住地など、外部の社会経済的特徴を活用して予測力の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1出生証明書データを用いた機械学習モデルは、従来の疫学的手法に比べ、乳児死亡率の予測において優れた性能を示せるか?
  • RQ2一般集団モデルと比較して、人種別にモデルを訓練することで予測精度が向上するか?
  • RQ3本モデルによると、社会経済的および臨床的特徴の中で、乳児死亡率の予測に最も予測力のあるものは何か?
  • RQ4クラス不均衡(1:145)がモデル性能に与える影響は何か?また、その影響を軽減する戦略は何か?
  • RQ5母親の教育水準、年齢、人種といった特徴が、乳児死亡率の予測にどの程度寄与しているか?

主な発見

  • XGBoostモデルは白人集団でAUC 0.84、一般集団(1:145の不均衡)でAUC 0.82を達成し、標準的な疫学的手法を著しく上回った。
  • 人種別モデルは予測精度を向上させ、黒人集団ではAUC 0.83、アメリカインディアンではAUC 0.75を記録し、サブグループ別モデリングが性能向上に寄与することが示された。
  • 最も重要な2つの特徴は出生時体重(グラム単位)とアプガースコアであり、その後に母体の教育水準、年齢、人種が続く。社会経済的要因の重要性が浮き彫りになった。
  • 上位20位内の9つの特徴が母体関連であり、婚姻状態、居住地、妊娠期間中の健診回数が含まれ、母体の状況の重要性が強調された。
  • 不均衡度が異なる状況下でもモデルは強く性能を維持し、AUCは1:1の0.84から1:145の0.82へわずかに低下するにとどまり、頑健性が確認された。
  • 特徴の重要度分析から、臨床的要因(例:妊娠週数、先天性奇形)と社会経済的指標(例:母体の教育水準、喫煙)が正確な予測に不可欠であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。