Skip to main content
QUICK REVIEW

[论文解读] A robust kernel machine regression towards biomarker selection in multi-omics datasets of osteoporosis for drug discovery

Md Ashad Alam, Hui Shen|arXiv (Cornell University)|Jan 13, 2022
Bioinformatics and Genomic Networks被引用 4
一句话总结

本文提出RobKMR方法,一种稳健的核机器回归技术,通过整合多组学数据,在存在数据污染和异常值的情况下,识别出稳定且具有生物学意义的骨质疏松症生物标志物。该方法基于鲁棒M-估计器的核框架与一种新型得分检验,识别出显著的基因三联体(如DKK1、SMTN、DRGX)及关键基因(DKK1、MTND5、FASTKD2、SIDT1),这些基因与骨密度相关,从而实现以他克莫司、伊班膦酸、阿仑膦酸和巴azedoxifene进行药物老药新用的有效性。

ABSTRACT

Many statistical machine approaches could ultimately highlight novel features of the etiology of complex diseases by analyzing multi-omics data. However, they are sensitive to some deviations in distribution when the observed samples are potentially contaminated with adversarial corrupted outliers (e.g., a fictional data distribution). Likewise, statistical advances lag in supporting comprehensive data-driven analyses of complex multi-omics data integration. We propose a novel non-linear M-estimator-based approach, "robust kernel machine regression (RobKMR)," to improve the robustness of statistical machine regression and the diversity of fictional data to examine the higher-order composite effect of multi-omics datasets. We address a robust kernel-centered Gram matrix to estimate the model parameters accurately. We also propose a robust score test to assess the marginal and joint Hadamard product of features from multi-omics data. We apply our proposed approach to a multi-omics dataset of osteoporosis (OP) from Caucasian females. Experiments demonstrate that the proposed approach effectively identifies the inter-related risk factors of OP. With solid evidence (p-value = 0.00001), biological validations, network-based analysis, causal inference, and drug repurposing, the selected three triplets ((DKK1, SMTN, DRGX), (MTND5, FASTKD2, CSMD3), (MTND5, COG3, CSMD3)) are significant biomarkers and directly relate to BMD. Overall, the top three selected genes (DKK1, MTND5, FASTKD2) and one gene (SIDT1 at p-value= 0.001) significantly bond with four drugs- Tacrolimus, Ibandronate, Alendronate, and Bazedoxifene out of 30 candidates for drug repurposing in OP. Further, the proposed approach can be applied to any disease model where multi-omics datasets are available.

研究动机与目标

  • 解决复杂疾病多组学数据分析中对异常值和非正态分布的统计敏感性问题。
  • 克服传统核机器方法在假设理想数据分布下运行的局限性,尤其在对抗性或污染数据下的失效问题。
  • 开发一种稳健的非线性统计框架,以检测基因组、转录组和表观基因组数据中的高阶复合效应。
  • 通过增强鲁棒性的整合多组学数据集,实现骨质疏松症中可靠生物标志物的选择与药物老药新用。
  • 提供一种可推广的方法,适用于任何具备多组学数据的疾病模型。

提出的方法

  • 提出一种基于M-估计器的稳健核机器回归(RobKMR)框架,以最小化异常值和非正态分布数据的影响。
  • 构建稳健的核中心Gram矩阵,以在数据污染条件下提升参数估计的准确性。
  • 引入一种稳健得分检验,通过多组学数据组分的Hadamard积评估特征的边际效应与联合效应。
  • 将该方法应用于高加索女性骨质疏松症患者的真实多组学数据集,以识别相互关联的风险因素。
  • 对37个选定蛋白与35种候选药物进行分子对接,以预测结合亲和力并识别最佳药物候选。
  • 利用三维结构建模与相互作用图谱验证关键命中结果的蛋白-配体相互作用(如氢键、疏水作用)。

实验结果

研究问题

  • RQ1在非理想分布假设下,稳健核机器回归方法是否能有效检测多组学数据中的高阶复合效应?
  • RQ2当数据包含对抗性异常值或虚构分布时,RobKMR在识别具有生物学意义的生物标志物方面表现如何?
  • RQ3哪些多组学基因组合在骨质疏松症中与骨密度(BMD)显著相关?
  • RQ4通过分子对接与结合亲和力分析,识别出的生物标志物是否可与现有药物关联?
  • RQ5与最先进方法相比,RobKMR在模拟和真实世界多组学数据集中的预测能力与鲁棒性如何?

主要发现

  • RobKMR识别出三个显著的基因三联体——(DKK1, SMTN, DRGX)、(MTND5, FASTKD2, CSMD3) 和 (MTND5, COG3, CSMD3),p值均≤ 0.00001,且均与骨密度(BMD)直接相关。
  • 前四个基因——DKK1、MTND5、FASTKD2 和 SIDT1——表现出强烈的统计显著性(DKK1、MTND5、FASTKD2 的p值≤ 0.00001;SIDT1 的p值≤ 0.001),且在生物学上与骨质疏松症密切相关。
  • 分子对接识别出四种先导药物——他克莫司、伊班膦酸、阿仑膦酸和巴azedoxifene——其平均结合亲和力评分均≥ -7.5 kcal/mol,针对前四位靶蛋白。
  • DKK1_阿仑膦酸复合物形成六个氢键及显著的疏水相互作用,表明其具有强结合稳定性。
  • MTND5_伊班膦酸复合物形成五个氢键及关键疏水相互作用,支持高亲和力结合。
  • 网络分析与因果推断证实,所选基因在功能上相互关联,并直接影响BMD,验证了其生物学相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。