Skip to main content
QUICK REVIEW

[论文解读] A New Hierarchical Redundancy Eliminated Tree Augmented Naive Bayes Classifier for Coping with Gene Ontology-based Features

Cen Wan, Alex A. Freitas|arXiv (Cornell University)|Jul 6, 2016
Bioinformatics and Genomic Networks参考文献 6被引用 6
一句话总结

该论文提出HRE–TAN,一种新型的树增强朴素贝叶斯分类器,通过一种懒惰学习方法,利用分层冗余消除最大权重生成树(HRE–MST),在学习阶段消除了基于基因本体(GO)特征的分层冗余。HRE–TAN在预测准确率和对类别不平衡的鲁棒性方面显著优于传统TAN,在以GO术语作为特征的衰老相关基因数据集上表现更优。

ABSTRACT

The Tree Augmented Naive Bayes classifier is a type of probabilistic graphical model that can represent some feature dependencies. In this work, we propose a Hierarchical Redundancy Eliminated Tree Augmented Naive Bayes (HRE-TAN) algorithm, which considers removing the hierarchical redundancy during the classifier learning process, when coping with data containing hierarchically structured features. The experiments showed that HRE-TAN obtains significantly better predictive performance than the conventional Tree Augmented Naive Bayes classifier, and enhanced the robustness against imbalanced class distributions, in aging-related gene datasets with Gene Ontology terms used as features.

研究动机与目标

  • 为解决基因本体(GO)术语中的分层冗余问题,该问题违反了朴素贝叶斯中的独立性假设并降低分类器性能。
  • 开发一种在学习过程中而非预处理阶段消除分层冗余的分类器,以提升模型泛化能力。
  • 增强在衰老相关基因分类任务中对类别分布不平衡的鲁棒性。
  • 在多种模式生物的GO术语不同组合上评估所提方法的性能。

提出的方法

  • HRE–TAN为每个测试实例使用条件互信息(CMI)作为边权重,构建最大权重生成树(MST)。
  • 引入分层冗余检查:连接具有相同值的祖先或后代特征的边被标记为“不可用”并从MST构建中排除。
  • 该算法维护一个可用边集合,并根据当前实例中的分层关系和特征值动态更新边的选择状态。
  • 最终树结构仅由非冗余且CMI较高的边构建,随机选择一个节点作为根节点以定向边,形成贝叶斯网络。
  • 通过仅使用每个实例中HRE–MST包含的特征,重新定义训练和测试数据集,实现基于实例的模型自适应。
  • 通过为每个测试实例重新计算树结构,将懒惰学习整合进来,确保上下文感知的特征依赖建模。

实验结果

研究问题

  • RQ1在分类器学习过程中消除分层冗余是否能提升基于GO术语的基因分类任务的预测性能?
  • RQ2HRE–TAN在准确率和对类别不平衡的鲁棒性方面与传统TAN相比表现如何?
  • RQ3在学习阶段内嵌的冗余消除方法是否优于基于预处理的特征选择方法?
  • RQ4HRE–TAN的性能增益是否在不同GO术语组合及模式生物中保持一致?

主要发现

  • 在28个衰老相关基因数据集中的18个上,HRE–TAN的几何平均值(GMean)显著高于传统TAN,且在Wilcoxon符号秩检验中在0.05显著性水平下具有统计学意义。
  • HRE–TAN在类别不平衡方面表现出更优的鲁棒性,其GMean与类别不平衡程度的皮尔逊相关系数为r = -0.479,而TAN为r = -0.801。
  • 随着类别不平衡程度增加,HRE–TAN的GMean下降更缓慢,表明在数据分布偏斜情况下具有更好的稳定性。
  • 在两个数据集中,HRE–TAN与TAN的GMean得分相同,表明在类别平衡设置下性能一致。
  • 该方法有效减少了冗余GO术语依赖带来的噪声,从而实现了对长寿相关基因和抗衰老相关基因更准确、更稳定的分类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。