[논문 리뷰] Advanced Graph and Sequence Neural Networks for Molecular Property Prediction and Drug Discovery
이 논문은 고급 그래프 및 시퀀스 신경망을 통합한 종합적인 기계학습 프레임워크인 AdvProp을 소개한다. 분자의 성질 예측 및 약물 발견에 활용되며, 다중 수준 메시지 전파 신경망(ML-MPNN)을 통해 그래프 기반 학습을 수행하고, 마스킹된 임베딩 복구를 통한 대비-BERT 모델을 통해 시퀀스 모델링을 수행한다. 이는 새로운 AUC 중심의 손실 함수를 통해 최적화되어, ROC-AUC 및 PRC-AUC에서 최신 기준 성능을 달성하였으며, 코로나19 약물 발견을 위한 AI Cures Open Challenge에서 #1 등수를 기록하였다.
Properties of molecules are indicative of their functions and thus are useful in many applications. With the advances of deep learning methods, computational approaches for predicting molecular properties are gaining increasing momentum. However, there lacks customized and advanced methods and comprehensive tools for this task currently. Here we develop a suite of comprehensive machine learning methods and tools spanning different computational models, molecular representations, and loss functions for molecular property prediction and drug discovery. Specifically, we represent molecules as both graphs and sequences. Built on these representations, we develop novel deep models for learning from molecular graphs and sequences. In order to learn effectively from highly imbalanced datasets, we develop advanced loss functions that optimize areas under precision-recall curves. Altogether, our work not only serves as a comprehensive tool, but also contributes towards developing novel and advanced graph and sequence learning methodologies. Results on both online and offline antibiotics discovery and molecular property prediction tasks show that our methods achieve consistent improvements over prior methods. In particular, our methods achieve #1 ranking in terms of both ROC-AUC and PRC-AUC on the AI Cures Open Challenge for drug discovery related to COVID-19. Our software is released as part of the MoleculeX library under AdvProp.
연구 동기 및 목표
- 그래프 및 시퀀스 표현을 통합하는 통합형 종합 프레임워크를 개발하여 분자의 성질 예측 성능을 향상시키는 것.
- 분자의 성질 예측에서 극도로 불균형한 데이터셋 문제를 새로운 AUC 중심의 최적화 손실 함수를 통해 해결하는 것.
- 대규모 비라벨링된 분자 시퀀스에서의 자기지도 사전학습을 통합하여 모델의 일반화 능력과 성능을 향상시키는 것.
- 실제 세계의 제약 조건 하에서 약물 발견 분야에서 새로운 최신 기준 성능을 확립하는 것.
- 재현 가능하고 확장 가능한 연구를 위해 MoleculeX 라이브러리 내에서 공개된 모듈식 툴세트(AdvProp)를 제공하는 것.
제안 방법
- 노드, 엣지, 부분그래프, 전체 분자 그래프를 포함한 다중 수준의 정보 집계를 통해 계층적 구조적 의존성을 포착하는 다중 수준 메시지 전파 신경망(ML-MPNN)을 제안한다.
- 대규모 비라벨링된 SMILES 시퀀스에서 사전학습하기 위해 마스킹된 임베딩 복구 작업과 대비 학습을 활용하는 순서 기반 모델인 대비-BERT를 도입한다.
- 정밀도-재현율 곡선 아래 면적(PRC-AUC) 최적화를 위해 사용하는 서브티튜션 손실 함수를 적용하며, 특히 정확도-정밀도(AP) 기반의 서브티튜션 손실과 마진 기반 순위 매칭을 통해 불균형 데이터에서의 모델 강인성을 향상시킨다.
- 표준 교차 엔트로피 손실을 대체하여 AUC 지표를 직접 최적화하기 위해 SOAP-ADAM 및 PESG를 활용한 확률적 최적화 기법을 적용한다.
- 마스킹 토큰 예측과 그 맥락 임베딩 간 코사인 유사도를 기반으로 한 대비 손실 함수를 적용하여 시퀀스 모델의 표현 학습을 향상시킨다.
- RDKit를 통해 추출한 200차원의 전역 분자 특징을 2층의 MLP를 통해 그래프 수준의 표현과 통합하여 최종 예측을 수행한다.
실험 결과
연구 질문
- RQ1그래프 및 시퀀스 딥러닝 모델을 통합한 통합 프레임워크가 기존 최신 기준 방법을 초월하여 분자의 성질 예측 성능을 향상시킬 수 있는가?
- RQ2기존의 교차 엔트로피 손실과 비교해 볼 때, 새로운 AUC 중심 최적화 손실 함수는 극도로 불균형한 분자 성질 데이터셋 처리에 얼마나 효과적인가?
- RQ3마스킹된 임베딩 복구를 통한 자기지도 사전학습은 분류 성능 향상에 얼마나 기여하는가?
- RQ4기존 메시지 전파 방식과 비교해 다중 수준 메시지 전파가 더 풍부한 구조적 정보를 포착할 수 있는가, 그리고 성능 향상에 기여하는가?
- RQ5그래프 및 시퀀스 모델링의 조합이 상호보완적인 신호를 제공하여 다양한 분자 예측 과제에서 일관된 성능 향상을 이끌어낼 수 있는가?
주요 결과
- AdvProp는 AI Cures Open Challenge 코로나19 약물 발견 대회에서 ROC-AUC 및 PRC-AUC 모두 #1 등수를 기록하여 제출된 모든 방법을 압도적으로 앞섰다.
- 제안된 ML-MPNN 모델은 분자의 성질 예측 벤치마크에서 최신 기준 성능을 보였으며, 특히 다중 그래프 수준에서의 복잡한 구조적 의존성을 포착하는 데 뛰어난 성능을 보였다.
- 마스킹된 임베딩 복구 기반의 대비-BERT 모델은 하류 과제에서 뛰어난 성능을 기록하여 대규모 비라벨링된 SMILES 데이터에서의 자기지도 사전학습의 효과를 입증하였다.
- 특히 AP 기반의 서브티튜션 손실을 포함한 AUC 최적화 손실 함수는 불균형 데이터셋에서의 모델 성능을 크게 향상시켰으며, 정밀도-재현율 공간에서 두드러진 효과를 보였다.
- 그래프 수준의 표현과 전역 분자 특징의 통합은 다양한 데이터셋과 과제에서 일관된 성능 향상을 이끌어냈다.
- MoleculeX 라이브러리를 통해 AdvProp를 오픈소스로 공개함으로써, 제안된 모델과 도구의 재현 가능하고 확장 가능한 약물 발견 연구 활용이 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.