[论文解读] Annotation Enrichment Analysis: An Alternative Method for Evaluating the Functional Properties of Gene Sets
本文提出注释增强分析(Annotation Enrichment Analysis, AEA),一种新方法,通过考虑基因本体(Gene Ontology)等数据库中基因注释分布不均的问题,纠正传统功能富集分析中的偏差。与费雪精确检验(Fisher’s Exact Test, FET)不同,FET在基因集包含大量高度注释基因时会高估显著性,而AEA评估的是功能注释的重叠而非基因重叠,从而揭示了此前被假阳性掩盖的生物学上有意义的富集结果。
Gene annotation databases (compendiums maintained by the scientific community that describe the biological functions performed by individual genes) are commonly used to evaluate the functional properties of experimentally derived gene sets. Overlap statistics, such as Fisher's Exact Test (FET), are often employed to assess these associations, but don't account for non-uniformity in the number of genes annotated to individual functions or the number of functions associated with individual genes. We find FET is strongly biased toward over-estimating overlap significance if a gene set has an unusually high number of annotations. To correct for these biases, we develop Annotation Enrichment Analysis (AEA), which properly accounts for the non-uniformity of annotations. We show that AEA is able to identify biologically meaningful functional enrichments that are obscured by numerous false-positive enrichment scores in FET, and we therefore suggest it be used to more accurately assess the biological properties of gene sets.
研究动机与目标
- 识别并纠正传统功能富集分析中因基因数据库注释分布不均而产生的偏差。
- 解决当基因集包含异常多高度注释基因时,费雪精确检验(FET)对显著性产生高估的问题。
- 开发一种基于注释重叠而非基因重叠来评估功能富集的方法,从而减少假阳性结果。
- 证明AEA可识别出被FET统计偏差所掩盖的生物上合理的功能富集结果。
- 提供一种实用的、基于解析近似的FET替代方法,以考虑基因本体DAG的结构特性。
提出的方法
- 提出注释增强分析(AEA),通过计算基因集与某一基因本体分支中功能术语集合之间的重叠,而非基因与术语之间的重叠。
- 将基因本体分支定义为一个父代术语及其所有后代,该分支中唯一基因的总数等于其父代术语所注释的基因数。
- 通过迭代交换基因,构建具有固定总注释数(Mg)但平均基因注释度(k_avg)可变的偏倚随机基因集,以匹配目标注释水平。
- 通过随机顺序选择基因本体术语生成随机基因本体分支,直到所选术语注释的唯一基因数接近目标值k_t(误差在1%以内)。
- 使用AEA基于注释重叠计算p值,并采用理论近似方法以降低计算成本。
- 将AEA结果与FET及FDR校正后的FET在随机和真实基因特征集上进行比较,以评估偏差和统计效能。
实验结果
研究问题
- RQ1当使用费雪精确检验时,基因集中每个基因的注释数量是否会导致功能富集结果的显著性产生偏差?
- RQ2基因本体中的注释非均匀性是否会导致标准功能分析工具中出现假阳性富集信号?
- RQ3在功能注释层面而非基因层面上评估重叠,是否能减少偏差并提高对真正生物关联的检测能力?
- RQ4对AEA的理论近似是否能提供一种计算效率更高的替代方案,以替代基于置换的AEA?
- RQ5实验获得的基因特征集是否系统性地富集了高度注释的基因,且这种富集是否影响其功能富集评分?
主要发现
- 当基因集包含异常多高度注释基因时,费雪精确检验(FET)会强烈偏向于高估显著性。
- 即使基因集大小保持不变,平均注释数较高(k_avg ≈ 65)的随机基因集产生的假阳性富集结果显著多于平均注释数较低(k_avg ≈ 21)的随机基因集。
- 注释增强分析(AEA)通过建模注释重叠而非基因重叠,有效消除了这一偏差,揭示了此前被FET掩盖的生物上合理的富集结果。
- 来自基因特征数据库(GeneSigDB2012)的真实基因特征集包含不成比例的大量高度注释基因,导致FET的p值被人为放大。
- AEA方法在真实基因集中识别出显著的功能富集结果,而这些结果在FET中因对注释偏差敏感而未被检测到。
- 本文提供了一种对AEA的解析近似方法,可在保持准确性的前提下实现更快的计算速度,使其适用于大规模功能富集分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。