Skip to main content
QUICK REVIEW

[논문 리뷰] Learning from Protein Structure with Geometric Vector Perceptrons

Bowen Jing, Stephan Eismann|arXiv (Cornell University)|2020. 09. 03.
Computational Drug Discovery Methods참고 문헌 41인용 수 193
한 줄 요약

기하 벡터 퍼셉트론(GVP)을 도입하여 GNN을 확장하고 단백질 구조에 대한 기하적 및 관계적 추론 이중을 가능하게 하며, 계산적 단백질 설계(CPD)와 모델 품질 평가(MQA)에서 최첨단 성과를 달성한다.

ABSTRACT

Learning on 3D structures of large biomolecules is emerging as a distinct area in machine learning, but there has yet to emerge a unifying network architecture that simultaneously leverages the graph-structured and geometric aspects of the problem domain. To address this gap, we introduce geometric vector perceptrons, which extend standard dense layers to operate on collections of Euclidean vectors. Graph neural networks equipped with such layers are able to perform both geometric and relational reasoning on efficient and natural representations of macromolecular structure. We demonstrate our approach on two important problems in learning from protein structure: model quality assessment and computational protein design. Our approach improves over existing classes of architectures, including state-of-the-art graph-based and voxel-based methods. We release our code at https://github.com/drorlab/gvp.

연구 동기 및 목표

  • CNN 유사 기하학적 처리와 GNN을 통합하여 생체분자 구조로부터 학습하기 위한 기하학적 및 관계적 추론의 다리를 놓는다.
  • 그래프 전파 중 기하를 보존하기 위해 벡터 특징에 직접 작용하는 회전-등가 네트워크 층을 개발한다.
  • 두 가지 단백질 구조 학습 과제인 계산적 단백질 설계(CPD)와 모델 품질 평가(MQA)에서 접근법을 시연한다.
  • GVP-GNN이 CPD 및 MQA 벤치마크에서 기존 아키텍처를 능가함을 보인다.

제안 방법

  • 실수 스칼라 특징 s in R^n과 벡터 특징 V in R^{ν×3}에서 작용하는 기하 벡터 퍼셉트론(GVPs)을 도입하여 s' in R^m과 V' in R^{μ×3}를 생성한다.
  • GVPs는 변환된 벡터의 L2 노름을 연결(concatenate)하여 회전 불변 정보를 추출한 뒤, 스칼라와 벡터에 대해 각각 선형 및 비선형 변환을 적용한다.
  • 3D 회전/반사 하에서 GVP의 등가성/불변성을 증명하고 회전 및 반사 불변 스칼라에 대한 보편 근사 속성을 보인다.
  • 훈련 안정화를 위해 벡터 채널 드롭아웃 및 벡터-레이어 정규화를 도입한다.
  • 단백질 백본을 나타내는 스칼라 및 벡터 엣지/노드 특징과 함께 메세지 전달 단계에 GVP를 사용하여 GVP-GNN을 구성한다.
  • 단백질을 백본 원자를 노드로 하고 방향 벡터, 가우시안 기저를 통한 거리, 백본-상대 인코딩을 포함하는 이웃 간 엣지 특징을 갖는 근접 그래프로 표현한다.

실험 결과

연구 질문

  • RQ1GVPs가 그래프 신경망이 단백질 구조의 기하적 및 관계적 측면을 함께 추론하도록 할 수 있는가?
  • RQ2GVP-GNN이 구조 기반 및 시퀀스 기반 최첨단 방법들과 비교하여 CPD 및 MQA 벤치마크에서 성능을 향상시키는가?
  • RQ3스칼라와 벡터 특징을 모두 포함하는 것과 오직 스칼라 또는 오직 벡터를 사용하는 것이 성능에 미치는 영향은 무엇인가?
  • RQ4아키텍처 차별 분석(예: Wμ 제거, 스칼라/벡터만 사용)이 CPD 및 MQA 결과에 어떤 영향을 미치는가?
  • RQ5CASP 시대 데이터셋 전반에 걸쳐 GVP-GNN이 기존 GNN 및 3D CNN과 어떻게 비교되는가?

주요 결과

  • GVP-GNN은 CATH 4.2 CPD 벤치마크에서 최첨단 perplexity 및 시퀀스 회복을 달성하여 Structured Transformer 및 Structured GNN 변형을 능가한다.
  • TS50에서 GVP-GNN은 44.9% 회복을 달성하여 Rosetta의 30%를 초과하고 세 가지 표현 클래스 기반 방법들을 능가한다.
  • MQA에서 GVP-GNN은 CASP 11-12 벤치마크에서 단일 구조, 구조만 방법들보다 더 높은 글로벌 및 대상별 상관관계를 달성하고 CASP 13에서 최고의 구조 기반 방법들을 능가한다.
  • GVP 차별 분석은 스칼라 경로 또는 벡터 경로 중 하나를 제거하면 성능이 저하되며, 이중 스칼라/벡터 설계가 최상의 결과를 위해 필수적임을 보여준다; Wμ 제거 역시 약간의 성능 저하를 유발한다.
  • 전반적으로 GVP-GNN은 고차 텐서 방법에 대한 경량의 등가 대안을 제공하며 CPD 및 MQA 작업에서 강력한 성능을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.