Skip to main content
QUICK REVIEW

[논문 리뷰] Pre-training Molecular Graph Representation with 3D Geometry

Shengchao Liu, Hanchen Wang|arXiv (Cornell University)|2021. 10. 07.
Computational Drug Discovery Methods참고 문헌 85인용 수 150
한 줄 요약

GraphMVP는 3D 기하를 대조 및 생성식 자기지도 작업으로 활용하여 2D 분자 그래프 인코더를 사전 학습하고, 다운스트림 분자 특성 예측 성능을 향상시킵니다.

ABSTRACT

Molecular graph representation learning is a fundamental problem in modern drug and material discovery. Molecular graphs are typically modeled by their 2D topological structures, but it has been recently discovered that 3D geometric information plays a more vital role in predicting molecular functionalities. However, the lack of 3D information in real-world scenarios has significantly impeded the learning of geometric graph representation. To cope with this challenge, we propose the Graph Multi-View Pre-training (GraphMVP) framework where self-supervised learning (SSL) is performed by leveraging the correspondence and consistency between 2D topological structures and 3D geometric views. GraphMVP effectively learns a 2D molecular graph encoder that is enhanced by richer and more discriminative 3D geometry. We further provide theoretical insights to justify the effectiveness of GraphMVP. Finally, comprehensive experiments show that GraphMVP can consistently outperform existing graph SSL methods.

연구 동기 및 목표

  • 3D 기하 정보를 2D 그래프 인코딩에 도입하여 분자 표현을 개선하려는 동기를 제시한다.
  • 2D 및 3D 뷰 간의 대조 및 생성 작업을 활용하는 자기지도 사전 학습 프레임워크(GraphMVP)를 제안한다.
  • 사전 학습 중 2D 그래프 임베딩을 향상시키는 특권 정보로서 3D 기하가 작용한다는 것을 입증한다.
  • 마스킹 비율, conformer(콘포머) 수, 그리고 목표 함수의 영향을 분석한다.
  • 3D 기하 정보를 활용한 다중 뷰 사전 학습의 이점에 대한 이론적 통찰과 경험적 증거를 제공합니다.

제안 방법

  • 분자를 두 가지 뷰로 표현합니다: 2D 토폴로지 그래프와 3D 기하학적 conformer 그래프.
  • 두 가지 자기지도 예비 작업을 사용합니다: 2D와 3D 뷰를 분자Across 정렬하는 대조 목표(InfoNCE 또는 EB-NCE)와 뷰 간 표현을 재구성하는 생성 목표(VRR).
  • 표현 공간에서 교차 뷰 재구성 품질을 측정하기 위한 변분 표현 재구성(VRR) 대리 손실을 도입합니다.
  • 두 가지 SSL 목표를 통합된 GraphMVP 목표로 결합하며, GraphMVP-G 및 GraphMVP-C 변형은 2D SSL 보조 작업을 통합합니다.
  • 공유 데이터세트(2D/3D 구조 및 conformers가 포함된 50k 분자)에서 사전 학습하고, 다운스트림 8개의 저 데이터 태스크에서 2D GNN 백본(GIN)과 3D 기하(SchNet)를 사전 학습 신호로 사용하는 파인튜닝.

실험 결과

연구 질문

  • RQ1사전 학습에 3D 기하 정보를 포함하는 것이 다운스트림 태스크를 위한 2D 분자 그래프 표현을 향상시키나요?
  • RQ22D와 3D 뷰 간의 대조적 및 생성적 SSL 신호가 GraphMVP에서 서로를 어떻게 보완하나요?
  • RQ3마스킹 비율과 conformer 수가 학습 및 성능에 미치는 영향은 무엇인가요?
  • RQ43D 기하가 사전 학습 동안 학습을 가속하지만 테스트 시점에 사용할 수 없는 특권 정보로 작용하나요?
  • RQ52D SSL 목표를 추가하는 확장(GraphMVP-G, GraphMVP-C)이 추가 이점을 가져오나요?

주요 결과

  • GraphMVP는 8개의 분자 특성 태스크에서 무작위 초기화와 대부분의 SSL 베이스라인을 능가하며, 주목할 만한 평균 개선을 보입니다.
  • 하이브리드 변형인 GraphMVP-G와 GraphMVP-C는 GraphMVP를 지속적으로 능가하여 3D 기하가 2D 토폴로지와 상보적임을 확인합니다.
  • VRR 기반 생성 SSL은 확률적 표현 재구성으로써 결정적 재구성에 비해 견고한 이점을 제공합니다.
  • 대조적 SSL과 생성적 SSL의 결합이 태스크 전반에서 최고의 성능을 보입니다.
  • 연구 중 제거 실험은 마스킹과 conformer 수가 성능에 영향을 미치며, 중간 정도의 conformer 수를 넘으면 수익이 감소하고 비제로 마스킹에서 혜택이 있음을 보여줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.