Skip to main content
QUICK REVIEW

[论文解读] Capsule Networks for Protein Structure Classification and Prediction

Dan Rosa de Jesus, Julian Cuevas|arXiv (Cornell University)|Aug 22, 2018
Genetics, Bioinformatics, and Biomedical Research参考文献 18被引用 10
一句话总结

本文提出了一种用于蛋白质结构分类的胶囊网络架构,通过利用2D和3D结构编码中的分层空间关系,相较于传统CNNs提升了准确率与可解释性。在KRAS-HRAS分类任务中达到92%的准确率,并通过激活向量可视化与扰动分析展示了增强的可解释性。

ABSTRACT

Capsule Networks have great potential to tackle problems in structural biology because of their attention to hierarchical relationships. This paper describes the implementation and application of a Capsule Network architecture to the classification of RAS protein family structures on GPU-based computational resources. The proposed Capsule Network trained on 2D and 3D structural encodings can successfully classify HRAS and KRAS structures. The Capsule Network can also classify a protein-based dataset derived from a PSI-BLAST search on sequences of KRAS and HRAS mutations. Our results show an accuracy improvement compared to traditional convolutional networks, while improving interpretability through visualization of activation vectors.

研究动机与目标

  • 解决卷积神经网络(CNNs)在捕捉空间层次结构及确保蛋白质结构分类可解释性方面的局限性。
  • 在基于GPU的系统上实现并评估胶囊网络架构,用于RAS家族蛋白质结构分类。
  • 通过可视化激活向量并分析结构扰动引起的变化,提升模型的可解释性。
  • 展示网络对天然蛋白质结构以及来自PSI-BLAST搜索的序列衍生结构的分类能力。
  • 探索胶囊网络在未来基于错误构象评分的蛋白质结构预测中的潜力。

提出的方法

  • 胶囊网络采用动态路由机制以保留空间层次结构,用基于向量的注意力机制替代最大池化操作。
  • 基于残基级别的空间与理化特征,将蛋白质结构编码为2D和3D表示。
  • 使用Keras 2.2.0 API与TensorFlow 1.8.8后端,在配备两块NVIDIA Tesla P100的GPU加速节点上进行训练。
  • 通过修改特定结构元件(如移除α螺旋)并测量激活向量范数的变化,实现可解释性。
  • 通过从PDB文件和PSI-BLAST序列搜索中提取的测试集上的准确率指标,评估分类性能。
  • 可视化并对比原始与修改后蛋白质结构的激活向量,以识别关键结构组分。

实验结果

研究问题

  • RQ1胶囊网络在使用2D和3D结构编码时,能否在RAS蛋白家族结构分类中超越传统CNNs?
  • RQ2胶囊网络中的激活向量如何反映蛋白质的结构变化,从而实现可解释性?
  • RQ3胶囊网络在多大程度上能够对来自PSI-BLAST序列搜索的蛋白质结构进行分类?
  • RQ4针对特定结构的修改如何影响胶囊网络中的激活向量与分类结果?
  • RQ5基于一致性的路由机制能否有效保留复杂蛋白质结构中的空间层次结构?

主要发现

  • 胶囊网络在2D和3D KRAS-HRAS蛋白质结构分类数据集上均达到了92%的准确率。
  • 对于PSI-BLAST衍生的数据集,模型在2D编码上达到68%的准确率,在3D编码上达到84%的准确率,表明对基于序列输入的鲁棒性。
  • 移除α螺旋(残基152–166)导致激活向量发生显著变化,HRAS的向量范数从1.0464增加至3.73×10⁻³,引发从HRAS误分类为KRAS。
  • 在移除残基87–104的螺旋后,HRAS到HRAS的案例中,激活向量差的范数为5.20×10⁻²,表明对分类影响极小。
  • 该模型表现出高度可解释性,结构组分的变化在激活向量的大小与方向上均有清晰体现。
  • 结果表明,胶囊网络能够有效编码并推理蛋白质结构中的分层空间关系,从而同时提升准确率与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。