[논문 리뷰] Mathematical deep learning for pose and binding affinity prediction and ranking in D3R Grand Challenges
이 논문은 D3R 그랜드 챌린지에서 단백질-리간드 결합 친화도를 예측하고 순위를 매기기 위해 다중 척도 가중 색상 그래프와 원소별 지속 호몰로지, 기계학습 모델을 통합한 수학적 딥러닝 프레임워크를 제시한다. 이 접근법은 D3R GC3의 공식 26개 과제 중 10개에서 1위를 차지했고, GC2에서 절대 자유 에너지 예측에서 상위 순위를 기록하여 약물 개발 응용 분야에서 뛰어난 예측 능력을 입증하였다.
Advanced mathematics, such as multiscale weighted colored graph and element specific persistent homology, and machine learning including deep neural networks were integrated to construct mathematical deep learning models for pose and binding affinity prediction and ranking in the last two D3R grand challenges in computer-aided drug design and discovery. D3R Grand Challenge 2 (GC2) focused on the pose prediction and binding affinity ranking and free energy prediction for Farnesoid X receptor ligands. Our models obtained the top place in absolute free energy prediction for free energy Set 1 in Stage 2. The latest competition, D3R Grand Challenge 3 (GC3), is considered as the most difficult challenge so far. It has 5 subchallenges involving Cathepsin S and five other kinase targets, namely VEGFR2, JAK2, p38-$α$, TIE2, and ABL1. There is a total of 26 official competitive tasks for GC3. Our predictions were ranked 1st in 10 out of 26 official competitive tasks.
연구 동기 및 목표
- 컴퓨터 지원 약물 설계에서 결합 친화도 예측 정확도를 향상시키기 위한 수학적 딥러닝 프레임워크를 개발하는 것.
- 가상 스크리닝에서 스코어링 함수의 한계를 해결하기 위해 고급 위상수학적 및 그래프 이론적 기술자를 통합하는 것.
- 고품질의 결정 구조가 없을 경우 저차원 위상수학적 및 기하학적 표현을 활용하여 예측 성능을 향상시키는 것.
- 대규모 약물 개발 챌린지에서 다양한 단백질 타겟과 리간드 집합에 대해 모델의 성능을 체계적으로 평가하는 것.
- 현재 도킹 프로토콜의 주요 한계를 규명하고 포지션 예측 오차를 스코어링 성능에서 분리함으로써 결합 친화도 예측 정확도를 향상시키는 것.
제안 방법
- 다중 척도 가중 색상 그래프(MWCG)를 사용해 단백질-리간드 복합체를 다중 척도에서 표현하여 원자 수준의 상호작용과 유연성을 캡처하는 것.
- 원소별 지속 호몰로지(PH)를 적용하여 생분자 구조의 기하학적 및 연결 특성을 포함한 위상적 불변량을 추출하는 것.
- 원자 반지름을 기반으로 한 필터링 파rameter를 사용해 위상적 구조의 가족을 생성함으로써 생분자 형태와 공동 형성의 체계적 분석을 가능하게 하는 것.
- 이러한 수학적 기술자를 기계학습 모델(예: 랜덤 포레스트 및 딥 컨volution 네트워크)에 통합하여 회귀 및 순위 매기기 과제를 수행하는 것.
- 다양한 리간드 포지션을 입력 스코어링 모델에 제공하기 위해 크로스도킹, 프리-IFD, 제약 IFD 등의 여러 도킹 프로토콜을 탐색하는 것.
- 위상수학적 및 그래프 기반 기술자와 물리적 및 경험적 기술자를 결합하여 다양한 단백질-리간드 복합체에서 일반화 및 예측 정확도를 향상시키는 것.
실험 결과
연구 질문
- RQ1다중 척도 가중 색상 그래프와 원소별 지속 호몰로지가 단백질-리간드 결합 친화도 예측에 효과적이고 저차원의 기술자로 기능할 수 있는가?
- RQ2알제브라적 위상수학과 딥러닝을 통합함으로써 전통적인 스코어링 함수에 비해 결합 친화도 순위 매기기 및 자유 에너지 예측 정확도가 어떻게 향상되는가?
- RQ3포지션 예측 오차가 가상 스크리닝에서 기계학습 기반 스코어링 함수의 성능을 얼마나 제한하는가?
- RQ4수학적 딥러닝 모델이 D3R GC3와 같은 대규모 약물 개발 챌린지에서 다양한 도전적인 타겟에서 최첨단 성능을 달성할 수 있는가?
- RQ5결정 구조가 가용하지 않을 경우, 어떤 도킹 프로토콜이 후속 친화도 예측에 가장 신뢰할 수 있는 포지션을 제공하는가?
주요 결과
- D3R 그랜드 챌린지 3에서, 모델은 공식 26개 과제 중 10개에서 1위를 기록하였으며, 카테프신 S 및 ABL1 서브챌린지에서 상위 순위를 기록하였다.
- 카테프신 S 서브챌린지에서, 모델(접수 ID uuihe)은 Kd > 10 μM를 제외한 경우 페어링 순위 매기기에서 Kendall’s τ = 0.57, 스피어만 상관계수 = 0.76를 기록하였고, 활성/비활성 분류에서는 MCC = 0.78를 기록하였다.
- GC3의 Set 1에 대한 절대 자유 에너지 예측에서, 모델(접수 ID vwbp8)은 MCC = 1.0을 기록하여 가능한 최고의 점수를 기록하였으며, 이는 완벽한 예측 성능를 의미한다.
- GC3의 Set 2에서, 모델(접수 ID 5g8ed)은 RMSE가 1.02 kcal/mol(제곱오차 = 1.04)로 가장 낮아 모든 다른 제출물보다 뛰어난 성능을 보였다.
- D3R GC2에서, 모델은 Set 1의 스테이지 2 자유 에너지 예측에서 Kendall’s τ = 0.41을 기록하여 두 스테이지 모두에서 가장 높은 점수를 기록하였다.
- 포지션 예측 오차를 제외한 결과, 카테프신 S 서브챌린지에서 모델의 Kendall’s τ는 0.21에서 0.54로 향상되었으며, 이는 현재의 친화도 예측에서 포지션 정확도가 주요 한계 요소임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.