Skip to main content
QUICK REVIEW

[論文レビュー] Semantically-aware population health risk analyses

Alexander New, Sabbir M. Rashid|arXiv (Cornell University)|Nov 27, 2018
Health, Environment, Cognitive Aging参考文献 9被引用数 3
ひとこと要約

本論文では、NHANESデータを用いて疾患に関連する統計的に有意なリスク要因およびサブポピュレーションを動的に同定する、意味的認識型で知識グラフ駆動のシステムを提示する。健康リスクオントロジー、研究定義のためのモジュラー「カートリッジ」、および説明可能なサブポピュレーション特化分析のための教師ありコーディネートモデルを統合することで、結果を計算的知識グラフに格納する、再現可能でプロバンセンス追跡可能な集団健康リスクの発見が可能になる。

ABSTRACT

One primary task of population health analysis is the identification of risk factors that, for some subpopulation, have a significant association with some health condition. Examples include finding lifestyle factors associated with chronic diseases and finding genetic mutations associated with diseases in precision health. We develop a combined semantic and machine learning system that uses a health risk ontology and knowledge graph (KG) to dynamically discover risk factors and their associated subpopulations. Semantics and the novel supervised cadre model make our system explainable. Future population health studies are easily performed and documented with provenance by specifying additional input and output KG cartridges.

研究の動機と目的

  • 再発のない集団健康研究を減らすために、動的で再利用可能で意味的フォーマル化されたリスク要因分析を可能にする。
  • 説明可能な機械学習モデルを用いて、異なるリスクプロファイルを示すサブポピュレーションを発見する。
  • オントロジーと知識グラフを用いて集団健康ワークフローをフォーマル化し、プロバンセンス、再現性、相互運用性を確保する。
  • 疾患、リスク要因、分析ワークフローのためのモジュラーで合成可能な「カートリッジ」を提供し、将来的な研究を支援する。
  • スケーラブルで調査加重付きの統計分析を可能にし、自動的なサブポピュレーション発見と結果文書化を実現するNHANESデータの分析

提案手法

  • システムは、変数を標準化されたオントロジーにマッピングするための意味的データ辞書(SDD)を用いて、NHANESデータをリンクされたデータ表現に変換する。
  • 健康リスク要因オントロジーは、3つの構成要素で構成される:分析概念、ワークフロー公理、および背景ドメイン公理。これにより、リスク要因と疾患の意味的モデリングが可能になる。
  • モジュラー「カートリッジ」を用いて研究定義をカプセル化する:反応(疾患)、コhort(参加基準)、リスク要因(意味的にグループ化されたもの)、およびワークフロー(分析ステップ)。
  • システムは教師ありコーディネートモデル(SCM)を採用し、観測をサブポピュレーションにクラスタリングし、各コーディネート内での有意なリスク要因-疾患関連を同定する。
  • 統計的発見、サブポピュレーション要約、モデルパラメータは、完全なプロバンセンスとともに知識グラフに書き戻され、クエリと比較が可能になる。
  • リスクアナライザーWebアプリケーションは、R-Shinyインターフェースを通じてシステムを公開し、ユーザーがKGとカートリッジを用いて動的に研究を指定・実行できるようにする。

実験結果

リサーチクエスチョン

  • RQ1意味的に構造化された知識グラフとモジュラーなカートリッジは、動的で再利用可能かつ再現可能な集団健康リスク分析を可能にするか?
  • RQ2教師ありコーディネートモデルは、解釈可能性を維持しながら、異なるリスクプロファイルを示すサブポピュレーションをどのように発見できるか?
  • RQ3知識グラフにおけるプロバンセンスと意味的アノテーションは、集団健康研究結果の透明性と再利用可能性をどの程度向上させるか?
  • RQ4このシステムは、2型糖尿病や高血圧に対して、先行文献と照合可能な新しい環境的リスク要因を同定できるか?
  • RQ5調査加重モデリングの統合は、NHANESのようなバイアスの高い調査データにおけるリスク要因関連の妥当性をどのように向上させるか?

主な発見

  • システムは動的分析において、尿中モリブデンとウランが2型糖尿病と有意に関連していることを特定した。これは、新規の環境的リスク仮説と整合的であった。
  • 高血圧に関しては、血液中鉛濃度と収縮期血圧の上昇との有意な関連が確認された。これは、Alghashamら(2011年)およびAlmeida Lopesら(2017年)の先行研究と一致した。
  • 教師ありコーディネートモデルは、2-ヒドロキシフェナントレーン露出に対して2つの明確なサブポピュレーションを発見した。1つ目(コーディネート1)では高血圧と有意に関連していたが、2つ目ではそのような関連は認められず、サブポピュレーション特化リスク発見の有効性が示された。
  • コーディネート1は、男性およびその他のヒスパニック系女性で構成されており、血圧と尿中2-ヒドロキシフェナントレーン濃度が高かった。これは以前に報告のなかったリスクプロファイルを明らかにした。
  • すべての分析結果、サブポピュレーション統計、モデルハイパーパramータ、コーディネートメンバーシップが完全なプロバンセンスとともに知識グラフに格納され、クエリと比較が可能になった。
  • システムのモジュラーなカートリッジ設計により、新しい疾患、リスク要因、データセットへの迅速な適応が可能となり、スケーラブルかつ拡張可能な将来的な研究を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。