Skip to main content
QUICK REVIEW

[论文解读] Novel Mining of Cancer via Mutation in Tumor Protein P53 using Quick Propagation Network

Ayad Ghany Ismaeel, Raghad Zuhair Yousif|arXiv (Cornell University)|May 20, 2015
Genetics, Bioinformatics, and Biomedical Research参考文献 6被引用 4
一句话总结

本研究提出了一种新颖的深度学习方法,采用快速传播(QP)神经网络,从TP53基因突变数据中挖掘癌症预测结果。通过利用全面的TP53突变数据库并最小化输入特征,该模型实现了近乎完美的相关性(0.9999)和极低的误差率(0.0029的平均绝对相对误差),在基于突变数据分类癌症风险方面表现出极高的准确性。

ABSTRACT

There is multiple databases contain datasets of TP53 gene and its tumor protein P53 which believed to be involved in over 50% of human cancers cases, these databases are rich as datasets covered all mutations caused diseases (cancers), but they haven't efficient mining method can classify and diagnosis mutations patient's then predict the cancer of that patient. This paper proposed a novel mining of cancer via mutations because there is no mining method before offers friendly, effective and flexible predict or diagnosis of cancers via using whole common database of TP53 gene (tumor protein P53) as dataset and selecting a minimum number of fields in training and testing quick propagation algorithm which supporting this miming method. Simulating quick propagation network for the train dataset shows results the Correlation (0.9999), R-squared (0.9998) and mean of Absolute Relative Error (0.0029), while the training for the ALL datasets (train, test and validation dataset) have results the Correlation (0.9993), R-squared (0.9987) and mean of Absolute Relative Error (0.0057).

研究动机与目标

  • 解决现有方法在分类与癌症相关的TP53突变方面缺乏高效、灵活且用户友好的挖掘技术的问题。
  • 开发一种预测模型,仅使用最少的输入特征,同时保持在基于TP53突变诊断癌症风险方面的高准确性。
  • 利用真实世界的TP53突变数据,在训练集和完整数据集(训练集、测试集、验证集)上验证快速传播网络的性能。
  • 提供一种可扩展且高效的解决方案,用于基于TP53突变谱的早期癌症诊断。

提出的方法

  • 本研究采用快速传播(QP)神经网络,基于来自公共数据库的全面TP53基因突变数据集进行训练。
  • 仅从TP53突变数据库中选取最少量的相关字段作为输入特征,以提升模型效率并降低复杂度。
  • 模型在专用的训练数据集上进行训练,随后在独立的测试集和验证集上进行评估,以确保泛化能力。
  • 通过皮尔逊相关系数、决定系数(R-squared)和平均绝对相对误差(MARE)来衡量性能。
  • 选择QP算法因其在处理突变数据分类任务时具备快速收敛和高效的特点。
  • 整个流程均被实现并模拟运行,以评估在不同数据划分下的预测准确性和鲁棒性。

实验结果

研究问题

  • RQ1快速传播神经网络能否有效基于TP53基因突变数据对癌症风险进行分类?
  • RQ2当使用TP53数据库中最少的输入特征进行训练时,QP模型在预测癌症结果方面的准确性如何?
  • RQ3在训练集和完整数据集(训练集+测试集+验证集)上,该模型在相关性和误差指标方面的表现如何?
  • RQ4所提出的方法是否为现有TP53相关癌症预测挖掘技术提供了一种灵活且高效的替代方案?

主要发现

  • QP网络在训练数据集上实现了0.9999的相关性以及0.9998的决定系数,表明预测结果与真实值高度一致。
  • 在完整数据集(训练集、测试集和验证集)上,模型保持了0.9993的高相关性以及0.9987的决定系数。
  • 在训练集上,平均绝对相对误差(MARE)为0.0029,表明预测具有高度精确性。
  • 在完整数据集上,MARE略微上升至0.0057,但仍表明模型具备出色的预测性能。
  • 结果证实,QP网络在仅使用最少输入特征的情况下,能够高效地从TP53突变中挖掘癌症风险。
  • 本研究证明,所提出的方法在准确性和效率方面均表现出色,为早期癌症诊断提供了一个极具前景的工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。