Skip to main content
QUICK REVIEW

[论文解读] A Millennium Bug Still Bites Public Health - An Illustration Using Cancer Mortality

Martina Fu, David Todem|arXiv (Cornell University)|Jan 29, 2014
Global Cancer Incidence and Screening参考文献 8被引用 4
一句话总结

本文揭示了在美国2000年人口标准进行年龄标准化时,癌症死亡率比较中存在显著偏差,导致前列腺癌死亡率被高估12–91%,而病例死亡率被低估9–78%。本文提出一种基于数学优化的新型均值参考人群方法,以最小化平方偏差,提供一种更准确、普遍适用的替代方案,避免了任意选择标准人群的缺陷。

ABSTRACT

Accurate estimation of cancer mortality rates and the comparison across cancer sites, populations or time periods is crucial to public health, as identification of vulnerable groups who suffer the most from these diseases may lead to efficient cancer care and control with timely treatment. Because cancer mortality rate varies with age, comparisons require age-standardization using a reference population. The current method of using the Year 2000 Population Standard is standard practice, but serious concerns have been raised about its lack of justification. We have found that using the US Year 2000 Population Standard as reference overestimates prostate cancer mortality rates by 12-91% during the period 1970-2009 across all six sampled U.S. states, and also underestimates case fatality rates by 9-78% across six cancer sites, including female breast, cervix, prostate, lung, leukemia and colon-rectum. We develop a mean reference population method to minimize the bias using mathematical optimization theory and statistical modeling. The method corrects the bias to the largest extent in terms of squared loss and can be applied broadly to studies of many diseases.

研究动机与目标

  • 调查使用美国2000年人口标准作为参考在年龄标准化中对癌症死亡率估计的影响。
  • 识别该标准引入的系统性偏差,特别是在前列腺癌和病例死亡率比较中的影响。
  • 开发一种统计上严谨的方法,以最小化跨人群年龄调整率估计中的总体平方偏差。
  • 为公共卫生报告中任意选择标准参考人群的问题,提供一种普遍适用且理论依据充分的替代方案。

提出的方法

  • 本文将优化问题公式化,以寻找一个参考人群,使所有人群的年龄调整率与粗率之间的平方偏差之和最小化。
  • 采用二次规划求解约束优化问题,通过拉格朗日乘子推导出估计参考人群最优权重的方程组。
  • 该方法将均值参考人群构建为观测到的人群年龄结构的凸组合,确保其反映比较人群的集中趋势。
  • 证明在凸性假设下,最优解唯一且为全局最小值,避免陷入局部极小值。
  • 还提出一种统计抽样方法,以数值方式近似最优权重,尤其适用于解析解难以求解的情形。
  • 使用美国六个州的SEER数据和六个癌症部位的病例死亡率数据对方法进行验证,将结果与2000年人口标准和粗率进行比较。

实验结果

研究问题

  • RQ1使用美国2000年人口标准作为参考人群是否会在年龄标准化癌症死亡率中引入系统性偏差?
  • RQ2参考人群的选择如何影响不同人群之间癌症死亡率和病例死亡率的排名与解释?
  • RQ3能否构建一个数学上最优的参考人群,以最小化年龄调整率估计中的总体偏差?
  • RQ4与现行标准做法相比,所提出的均值参考人群方法在多大程度上减少了偏差?
  • RQ5所提出的方法在不同疾病和人群群体中是否具有鲁棒性和可推广性?

主要发现

  • 在美国2000年人口标准下,1970至2009年六个美国州的前列腺癌死亡率被高估12–91%。
  • 同一标准导致六个癌症部位(包括女性乳腺癌、宫颈癌、前列腺癌、肺癌、白血病和结直肠癌)的病例死亡率被低估9–78%。
  • 所提出的均值参考人群方法在所有比较人群的凸线性组合中最小化了总体平方偏差。
  • 该方法产生了一个唯一且全局最优的参考人群,具有统计和数学上的合理性,避免了现有标准的任意性。
  • 均值参考人群与比较中所有人群的年龄分布高度相似,增强了结果的可解释性和公平性。
  • 该方法广泛适用于癌症以外的疾病率比较,为公共卫生政策和健康差异研究提供了更可靠的理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。