Skip to main content
QUICK REVIEW

[논문 리뷰] Semantically-aware population health risk analyses

Alexander New, Sabbir M. Rashid|arXiv (Cornell University)|2018. 11. 27.
Health, Environment, Cognitive Aging참고 문헌 9인용 수 3
한 줄 요약

이 논문은 NHANES 데이터를 사용하여 질병과 관련된 통계적으로 유의미한 위험 요인과 하위 집단을 동적으로 식별하는 의미론적 인식, 지식 그래프 기반 시스템을 제시한다. 건강 위험 온톨로지, 연구 정의를 위한 모듈러한 '카트리지', 그리고 설명 가능하고 하위 집단별 분석이 가능한 지도 학습 기반 캐드레 모델을 통합함으로써, 결과를 계산 지식 그래프에 저장함으로써 재현 가능하고 증거 추적 기능이 있는 인구 건강 위험 탐색을 가능하게 한다.

ABSTRACT

One primary task of population health analysis is the identification of risk factors that, for some subpopulation, have a significant association with some health condition. Examples include finding lifestyle factors associated with chronic diseases and finding genetic mutations associated with diseases in precision health. We develop a combined semantic and machine learning system that uses a health risk ontology and knowledge graph (KG) to dynamically discover risk factors and their associated subpopulations. Semantics and the novel supervised cadre model make our system explainable. Future population health studies are easily performed and documented with provenance by specifying additional input and output KG cartridges.

연구 동기 및 목표

  • 재현 가능한, 의미론적으로 형식화된 위험 요인 분석을 통해 중복되는 인구 건강 연구를 줄이기 위해 동적이고 재사용 가능한 분석을 가능하게 한다.
  • 설명 가능한 기계 학습 모델을 사용하여 위험 프로파일이 다름을 보이는 하위 집단을 탐색한다.
  • 온톨로지와 지식 그래프를 활용해 인구 건강 워크플로우를 형식화함으로써 증거 추적, 재현 가능성, 상호운용성을 확보한다.
  • 질병, 위험 요인, 분석 워크플로우를 위한 모듈러하고 조합 가능한 '카트리지'를 통해 향후 연구를 지원한다.
  • 설문 조사 가중치를 적용한 스케일러블 통계 분석을 통해 NHANES 데이터의 자동 하위 집단 탐색 및 결과 기록을 가능하게 한다.

제안 방법

  • 시스템은 의미론적 데이터 사전(SDD)을 사용하여 변수를 표준 온톨로지로 매핑함으로써 NHANES 데이터를 연결된 데이터 표현으로 변환한다.
  • 세 가지 구성 요소로 이루어진 건강 위험 요인 온톨로지가 개발되었으며, 이는 분석 개념, 워크플로우 공리, 배경 도메인 공리로 구성되어 있어 위험 요인과 질병의 의미론적 모델링을 가능하게 한다.
  • 모듈러한 '카트리지'를 사용하여 연구 정의를 캡슐화한다: 반응(질병), 코hort(포함 기준), 위험 요인(의미적으로 그룹화된), 워크플로우(분석 단계).
  • 시스템은 관측치를 하위 집단으로 클러스터링하고 각 캐드레 내에서 유의미한 위험 요인-질병 연관성을 식별하는 지도 학습 기반 캐드레 모델(SCM)을 사용한다.
  • 통계적 발견, 하위 집단 요약, 모델 하이퍼파ram터는 전체 증거 추적 기능을 갖춘 지식 그래프에 다시 기록되며, 질의 및 비교를 가능하게 한다.
  • 위험 분석자 웹 애플리케이션은 R-Shiny 인터페이스를 통해 시스템을 노출하여 사용자가 지식 그래프와 카트리지로 동적으로 연구를 지정하고 실행할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1의미론적으로 정렬된 지식 그래프와 모듈러한 카트리지가 동적이고 재사용 가능하며 재현 가능한 인구 건강 위험 분석을 가능하게 할 수 있는가?
  • RQ2지도 학습 기반 캐드레 모델은 해석 가능성 유지와 함께 위험 프로파일이 다른 하위 집단을 어떻게 탐색할 수 있는가?
  • RQ3지식 그래프 내의 증거 추적 및 의미론적 주석이 인구 건강 연구 결과의 투명성과 재사용 가능성에 얼마나 기여하는가?
  • RQ4이 시스템은 기존 문헌과 검증된 바 있는, 제2형 당뇨병과 고혈압에 대한 새로운 환경적 위험 요인을 식별할 수 있는가?
  • RQ5설문 조사 가중치를 적용한 모델 통합이 NHANES와 같은 편향된 설문 조사 데이터에서 위험 요인 연관성의 타당성을 어떻게 향상시키는가?

주요 결과

  • 시스템은 동적 분석을 통해 제2형 당뇨병과 관련이 있는 소변 마그네슘과 우라늄이 유의미하게 연관되어 있음을 확인했으며, 이는 최근 환경적 위험 가설과 일치한다.
  • 고혈압에 대해 시스템은 혈액 수은 농도와 높은 수축기 혈압 간의 유의미한 연관성을 확인했으며, 이는 Alghasham 등(2011)과 Almeida Lopes 등(2017)의 이전 연구 결과와 일치한다.
  • 지도 학습 기반 캐드레 모델은 2-하이드록시페나탄트렌에 노출된 두 개의 서로 다른 하위 집단을 탐색했다: 한 집단(Cadre 1)은 고혈압과의 유의미한 연관성을 보였고, 다른 집단은 그렇지 않았다. 이는 하위 집단별 위험 탐지의 가능성을 입증한다.
  • Cadre 1은 고혈압 수치와 소변 2-하이드록시페나탄트렌 수치가 높은 남성 및 기타 히스패닉 여성으로 구성되어 있었으며, 이는 이전에 보고되지 않은 위험 프로파일을 드러냈다.
  • 모든 분석 결과, 하위 집단 통계, 모델 하이퍼파ram터, 캐드레 소속 정보는 전체 증거 추적 기능을 갖춘 지식 그래프에 저장되어 질의 및 비교가 가능했다.
  • 시스템의 모듈러한 카트리지 설계는 새로운 질병, 위험 요인, 데이터셋에 대한 빠른 적응을 가능하게 하여 향후 확장 가능한 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.