[论文解读] Comparison of amino acid occurrence and composition for predicting protein folds
本论文提出了一种基于线性判别分析(LDA)的方法,该方法使用氨基酸残基出现频率而非组成或序列来预测蛋白质折叠。该方法在1,612个球状蛋白的30个主要折叠类别中实现了37%的敏感度,优于或匹配了复杂方法,同时计算效率高且适用于大规模数据集的可扩展性。
Background:Prediction of protein three-dimensional structures from amino acid sequences is a long-standing goal in computational/molecular biology. The successful discrimination of protein folds would help to improve the accuracy of protein 3D structure prediction. Results: In this work, we propose a method based on linear discriminant analysis (LDA) for recognizing proteins belonging to 30 different folds using the occurrence of amino acid residues in a set of 1612 proteins. The present method could discriminate the globular proteins from 30 major folding types with the sensitivity of 37%, which is comparable to or better than other methods in the literature. A web server has been developed for predicting the folding type of the protein from amino acid sequence and it is available at http://granular.com/PROLDA/. Conclusions:Linear discriminant analysis based on amino acid occurrence could successfully recognize protein folds. The present method has several advantages such as, (i) it directly predicts the folding type of a protein without performing pair-wise comparisons, (ii) it can discriminate folds among large number of proteins and (iii) it is very fast to obtain the results. This is a simple method, which can be easily incorporated in any other structure prediction algorithms.
研究动机与目标
- 开发一种简单、快速且可扩展的方法,仅从氨基酸序列预测蛋白质折叠,无需成对比较。
- 探究仅基于氨基酸残基出现频率是否足以在不同结构类别中实现可靠的折叠识别。
- 评估在LDA中重新加权对折叠识别性能的影响,以平衡蛋白质数量严重不均的折叠类别之间的表现。
- 创建一个免费可访问的网络服务器,用于在蛋白质结构预测中实际应用该方法。
- 将该简单方法的性能与更复杂的模型(如神经网络和SVM)在折叠识别任务中的表现进行比较。
提出的方法
- 该方法计算每个蛋白质中20种氨基酸残基的出现次数,形成每个蛋白质的20维向量。
- 对这些向量应用线性判别分析(LDA),以最大化类间散度与总散度之比(S_B / S_T),目标是将蛋白质分离为30种结构折叠。
- 使用LDA的两种变体:一种带重新加权(W_k = 1),以确保每种折叠对性能的贡献相等,无论其大小如何;另一种不带重新加权(W_k = N_k),以优化整体准确率。
- LDA变换找到氨基酸计数的线性组合(z_i = a_0 + Σ a_j * n_ij),使折叠在判别轴上实现最佳分离。
- 使用R语言中的MASS库进行LDA计算,标准硬件上执行时间仅需几秒。
- 实现了一个网络服务器(http://granular.com/PROLDA/),允许用户输入蛋白质序列,并使用LDA模型接收预测的折叠分类结果。
实验结果
研究问题
- RQ1仅基于氨基酸残基出现频率是否能以高敏感度预测蛋白质折叠,即使不使用基于序列或结构的特征?
- RQ2当折叠大小差异显著时,LDA中的重新加权如何影响折叠识别性能?
- RQ3该简单LDA方法在折叠预测中的表现与更复杂的模型(如神经网络和SVM)相比如何?
- RQ4尽管训练数据存在不平衡,该方法是否能在所有30种折叠中实现高敏感度?
- RQ5该方法是否足够高效和可扩展,可在无需大量计算资源的情况下实现大规模蛋白质折叠预测?
主要发现
- 该方法在1,612个球状蛋白的30个主要折叠类别中实现了37%的敏感度,该性能与文献中报道的其他方法相当或更优。
- LDA中的重新加权显著改善了各折叠类别间的性能平衡,将折叠平均敏感度与整体敏感度之间的差距从约10%降低至更均衡的分布。
- 该方法在预测螺旋上下文束折叠(a.24)和EF-手样折叠(a.39)方面优于沈和周(2007)的方法,准确率分别达到39%和44%,而后者分别为30.5%和24%。
- 该方法在数据不平衡的数据集上表现出鲁棒性,各折叠的敏感度与每类中的蛋白质数量相关,但通过重新加权有效缓解了该问题。
- 该方法计算效率高,可实现单次运行的蛋白质分类,无需成对比较,因此适合集成到更大的结构预测流程中。
- 免费提供的网络服务器(http://granular.com/PROLDA/)支持实时从氨基酸序列预测折叠,并支持多种重新加权策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。