Skip to main content
QUICK REVIEW

[论文解读] Compositional representation of protein sequences and the number of Eulerian loops

Bailin Hao, Huimin Xie|ArXiv.org|Mar 10, 2001
Genomics and Phylogenetic Studies参考文献 2被引用 11
一句话总结

本文提出了一种使用重叠K-字符串的蛋白质序列组合表示方法,并将重构问题建模为在有向欧拉图中计数欧拉回路的问题。通过修改BEST定理以考虑平行边和自环,研究发现当K ≥ 5时,pdb.seq数据库中绝大多数蛋白质具有唯一重构结果,表明K-字符串为蛋白质序列提供了近乎唯一的表示。

ABSTRACT

An amino acid sequence of a protein may be decomposed into consecutive overlapping strings of length K. How unique is the converse, i.e., reconstruction of amino acid sequences using the set of K-strings obtained in the decomposition? This problem may be transformed into the problem of counting the number of Eulerian loops in an Euler graph, though the well-known formula must be modified. By exhaustive enumeration and by using the modified formula we show that the reconstruction is unique at K equal or greater than 5 for an overwhelming majority of the proteins in the PDB.seq database. The corresponding Euler graphs provide a means to study the structure of repeated segments in protein sequences.

研究动机与目标

  • 调查蛋白质序列是否可从其重叠K-字符串这一组合表示方法中唯一重构。
  • 将重构问题建模为从K-字符串频率数据导出的有向欧拉图中计数欧拉回路的问题。
  • 开发并应用一种修改后的BEST定理版本,以在图表示中考虑平行边和自环。
  • 评估在pdb.seq数据库中不同K值下真实蛋白质序列的重构唯一性。
  • 识别出具有高度非唯一重构的蛋白质,这些蛋白质可能暗示复杂的重复结构基序。

提出的方法

  • 将每个蛋白质序列分解为长度为K的重叠K-字符串,形成包含其频率的K-字符串多重集。
  • 构建一个有向欧拉图,其中节点表示(K-1)-聚体,边表示K-字符串,边的多重性反映其频率。
  • 应用修改后的BEST定理公式:R = Δ × ∏(di−1)! / ∏(aij!) 以计数欧拉回路数量,其中Δ为基尔霍夫矩阵余子式,di为节点i的度数,aij为边(i,j)的多重性。
  • 使用该修改公式计算从相同K-字符串多重集中可重构的不同序列数量。
  • 对pdb.seq中的2820个蛋白质进行详尽枚举和数据库筛查,以验证公式并评估重构唯一性。
  • 未来工作中将对氨基酸字母表进行粗粒度化处理,以增强生物学相关性并检测更高阶相关性。

实验结果

研究问题

  • RQ1在多大程度上,蛋白质序列可从其重叠K-字符串的多重集中唯一重构?
  • RQ2随着K值增加,可能的重构数量(R)如何变化?在哪个K值时唯一性成为典型情况?
  • RQ3哪些蛋白质表现出大量可能的重构?其结构特征如何解释这种行为?
  • RQ4修改后的BEST定理能否准确预测从真实蛋白质序列导出的图中欧拉回路的数量?
  • RQ5从具有高度非唯一重构的蛋白质中可获得哪些生物学启示,特别是关于重复片段和进化机制方面?

主要发现

  • 当K ≥ 5时,pdb.seq数据库中2820个蛋白质中有76.7%具有唯一重构结果,当K = 10时该比例上升至99.0%。
  • 欧拉回路数量R使用一种修改后的BEST公式计算,该公式考虑了欧拉图表示中的平行边和自环。
  • 具有极大R值的蛋白质(例如K=5时R=491,166,720)虽罕见但可识别,如CENB_HUMAN和MCMI_YEAST,且其序列长度并非必然很长。
  • 即使长蛋白质(例如>2115个氨基酸)也倾向于具有唯一或少量重构结果,表明长度本身并不能预测重构多重性。
  • 当K=11时,所有R > 1的蛋白质均满足R = 1,表明在所有测试案例中,当K ≥ 11时重构完全唯一。
  • 本研究识别出一小部分具有复杂重复结构的蛋白质,其对K-字符串分解高度敏感,提示其可能是结构或进化分析的候选对象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。