[论文解读] Intrinsic-Extrinsic Convolution and Pooling for Learning on 3D Protein Structures
本文提出了一种新颖的深度学习框架,用于基于内在-外在卷积和分层池化的3D蛋白质结构分析。通过利用共价键/氢键和3D原子坐标对蛋白质的一级、二级和三级结构进行建模,该方法捕捉了多层次的不变性,并在蛋白质折叠和酶分类任务中分别取得了46.5%和85.3%的准确率,优于当前最先进方法。
Proteins perform a large variety of functions in living organisms, thus playing a key role in biology. As of now, available learning algorithms to process protein data do not consider several particularities of such data and/or do not scale well for large protein conformations. To fill this gap, we propose two new learning operations enabling deep 3D analysis of large-scale protein data. First, we introduce a novel convolution operator which considers both, the intrinsic (invariant under protein folding) as well as extrinsic (invariant under bonding) structure, by using $n$-D convolutions defined on both the Euclidean distance, as well as multiple geodesic distances between atoms in a multi-graph. Second, we enable a multi-scale protein analysis by introducing hierarchical pooling operators, exploiting the fact that proteins are a recombination of a finite set of amino acids, which can be pooled using shared pooling matrices. Lastly, we evaluate the accuracy of our algorithms on several large-scale data sets for common protein analysis tasks, where we outperform state-of-the-art methods.
研究动机与目标
- 解决现有蛋白质学习方法无法同时建模一级、二级和三级结构层次的局限性。
- 开发一种深度学习架构,显式地整合跨多个层次的蛋白质特异性结构不变性。
- 通过新型分层池化操作实现蛋白质的多尺度分析。
- 在下游蛋白质分类任务中超越现有最先进方法。
- 提供一个端到端框架,统一学习过程中利用内在(基于键)和外在(3D空间)距离。
提出的方法
- 提出一种多图数据结构,使用共价键和氢键表示一级和二级结构,通过3D原子坐标表示三级结构。
- 引入一种内在-外在卷积算子,在欧几里得距离和从多图导出的多种测地线距离上应用n维卷积。
- 设计蛋白质特异的分层池化算子,以实现维度压缩和跨可变蛋白质大小的多尺度特征学习。
- 采用孪生网络架构进行少样本折叠分类,以评估对未见折叠的泛化能力。
- 将基于3D坐标表示与键网络特征结合,作为卷积层的输入。
- 应用可学习核,同时作用于内在(键网络)和外在(3D空间)距离,以捕捉结构不变性。
实验结果
研究问题
- RQ1深度学习模型能否有效将一级、二级和三级蛋白质结构层次整合到统一表征中?
- RQ2结合内在(基于键)和外在(3D空间)距离在多大程度上改善了蛋白质表征学习?
- RQ3分层池化操作在多大程度上实现了对尺寸高度可变蛋白质的多尺度分析?
- RQ4所提出方法在少样本学习设置下能否泛化到未见的蛋白质折叠?
- RQ5所提出架构能否在蛋白质折叠和酶分类任务中超越现有最先进方法?
主要发现
- 所提方法在蛋白质折叠分类任务中达到46.5%的准确率,优于先前最先进方法。
- 在酶促反应分类任务中,该方法取得85.3%的平均准确率,超越先前最先进结果。
- 消融研究证实,所有组件——蛋白质特异性表征、内在-外在卷积和池化——对最优性能均不可或缺。
- 模型在未见蛋白质折叠上实现泛化,在少样本折叠分类的未见测试集中达到31.9%的准确率。
- 由于其分层池化机制,该方法在不同大小和结构复杂度的蛋白质中表现出鲁棒性。
- 结果表明,显式建模多层次蛋白质结构可产生比仅基于序列或仅基于3D坐标基线更丰富且更具泛化能力的表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。