Skip to main content
QUICK REVIEW

[论文解读] Semantically-aware population health risk analyses

Alexander New, Sabbir M. Rashid|arXiv (Cornell University)|Nov 27, 2018
Health, Environment, Cognitive Aging参考文献 9被引用 3
一句话总结

本文提出了一种语义感知、基于知识图谱的系统,通过使用NHANES数据动态识别与疾病相关的统计显著风险因素和亚群体。通过整合健康风险本体、用于研究定义的模块化“模块”以及用于可解释、亚群体特异性分析的监督骨干模型,该系统实现了可重现、具备溯源追踪功能的群体健康风险发现,结果存储于计算知识图谱中。

ABSTRACT

One primary task of population health analysis is the identification of risk factors that, for some subpopulation, have a significant association with some health condition. Examples include finding lifestyle factors associated with chronic diseases and finding genetic mutations associated with diseases in precision health. We develop a combined semantic and machine learning system that uses a health risk ontology and knowledge graph (KG) to dynamically discover risk factors and their associated subpopulations. Semantics and the novel supervised cadre model make our system explainable. Future population health studies are easily performed and documented with provenance by specifying additional input and output KG cartridges.

研究动机与目标

  • 通过支持动态、可重用且语义形式化的风险因素分析,减少冗余的群体健康研究。
  • 利用可解释机器学习模型发现具有不同风险特征的亚群体。
  • 通过本体和知识图谱形式化群体健康工作流程,以实现溯源、可重现性和互操作性。
  • 通过模块化、可组合的“模块”(用于疾病、风险因素和分析工作流)支持未来研究。
  • 通过自动亚群体发现和结果记录,实现可扩展的、加权调查的统计分析,对NHANES数据进行分析。

提出的方法

  • 系统使用语义数据字典(SDD)将NHANES数据转换为链接数据表示,将变量映射到标准化本体。
  • 开发了健康风险因素本体,包含三个组成部分:分析概念、工作流公理和背景领域公理,以支持风险因素和疾病语义建模。
  • 使用模块化“模块”封装研究定义:响应变量(疾病)、队列(纳入标准)、风险因素(语义分组)以及工作流(分析步骤)。
  • 系统采用监督骨干模型(SCM),将观测值聚类为亚群体,并在每个骨干组内识别显著的风险因素-疾病关联。
  • 统计发现结果、亚群体汇总信息和模型参数均写回知识图谱并附带完整溯源信息,支持查询和比较。
  • 风险分析器Web应用程序通过R-Shiny接口暴露该系统,允许用户通过知识图谱和模块动态指定并执行研究。

实验结果

研究问题

  • RQ1语义结构化的知识图谱与模块化模块是否能够实现动态、可重用且可重现的群体健康风险分析?
  • RQ2监督骨干模型如何在保持可解释性的前提下发现具有不同风险特征的亚群体?
  • RQ3知识图谱中溯源信息与语义注释在多大程度上能提升群体健康研究结果的透明度与可重用性?
  • RQ4该系统能否识别出如2型糖尿病和高血压等疾病的新型环境风险因素,并与先前文献结果相验证?
  • RQ5将加权调查建模整合到分析中,在NHANES等存在偏差的调查数据中,如何提升风险因素关联的有效性?

主要发现

  • 系统在动态分析中成功识别出尿液中的钼和铀与2型糖尿病显著相关,与新兴的环境风险假说一致。
  • 对于高血压,系统确认了血铅水平与高收缩压之间存在显著关联,与Alghasham等人(2011年)和Almeida Lopes等人(2017年)的先前研究结果一致。
  • 监督骨干模型为2-羟基苯并[a]芘暴露发现了两个不同的亚群体:其中一组(骨干1)与高血压存在显著关联,而另一组则无,展示了亚群体特异性风险发现的能力。
  • 骨干1由男性和“其他西班牙裔”女性组成,其血压水平和尿液中2-羟基苯并[a]芘水平较高,揭示了一种此前未报告的风险特征。
  • 所有分析结果,包括亚群体统计、模型超参数和骨干成员身份,均以完整溯源方式存储于知识图谱中,支持查询与比较。
  • 该系统的模块化模块设计可快速适应新疾病、新风险因素和新数据集,支持可扩展且可扩展的未来研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。