Skip to main content
QUICK REVIEW

[논문 리뷰] DrugCLIP: Contrastive Protein-Molecule Representation Learning for Virtual Screening

Bowen Gao, Qiang Bo|arXiv (Cornell University)|2023. 10. 10.
Computational Drug Discovery Methods인용 수 7
한 줄 요약

DrugCLIP는 유사도 기반의 대조 학습 프레임워크를 제안하여 가상 스크리닝을 밀도 높은 검색 문제로 재정의한다. 단백질-분자 쌍 임베딩을 약물 결합 친화도 레이블 없이 학습시켜, DUD-E 및 LIT-PCBA 벤치마크에서 최신 기술 수준의 제로샷 성능을 달성한다. 기존 도킹 및 지도 학습 방법보다 훨씬 빠른 추론 속도를 보이며, 특히 대규모 스크리닝에서 뛰어난 성능을 발휘한다.

ABSTRACT

Virtual screening, which identifies potential drugs from vast compound databases to bind with a particular protein pocket, is a critical step in AI-assisted drug discovery. Traditional docking methods are highly time-consuming, and can only work with a restricted search library in real-life applications. Recent supervised learning approaches using scoring functions for binding-affinity prediction, although promising, have not yet surpassed docking methods due to their strong dependency on limited data with reliable binding-affinity labels. In this paper, we propose a novel contrastive learning framework, DrugCLIP, by reformulating virtual screening as a dense retrieval task and employing contrastive learning to align representations of binding protein pockets and molecules from a large quantity of pairwise data without explicit binding-affinity scores. We also introduce a biological-knowledge inspired data augmentation strategy to learn better protein-molecule representations. Extensive experiments show that DrugCLIP significantly outperforms traditional docking and supervised learning methods on diverse virtual screening benchmarks with highly reduced computation time, especially in zero-shot setting.

연구 동기 및 목표

  • 대규모 가상 스크리닝에서 전통적인 분자 도킹의 높은 계산 비용과 느린 추론 속도를 해결한다.
  • 결합 친화도 데이터에 의존하는 지도 학습 방법의 데이터 부족 문제와 낮은 일반화 능력을 극복한다.
  • 가상 스크리닝을 밀도 높은 검색 문제로 재정의하여, 수십억 개의 화합물 라이브러리에서 효율적이고 확장 가능한 스크리닝을 가능하게 한다.
  • BioLip 및 ChEMBL에서 확보한 대규모 비라벨 단백질-분자 쌍을 활용해 강력한 표현을 사전 학습한다.
  • 단백질 유전자 동일성을 기반으로 한 생물학적으로 영감을 받은 데이터 증강 전략(HomoAug)을 도입하여 표현 학습의 성능을 향상시킨다.

제안 방법

  • 가상 스크리닝을 밀도 높은 검색 문제로 재정의: 단백질 파손을 쿼리로 삼아 대규모 라이브러리에서 가장 유사한 분자를 검색한다.
  • 양성(결합) 쌍과 부정 쌍 간의 유사도를 최대화하고, 부정 쌍 간의 유사도를 최소화하기 위해 대조 학습을 사용해 단백질 및 분자용 별도의 인코더를 훈련한다.
  • 명시적인 결합 친화도 점수 없이도 결합이 알려진 단백질-분자 쌍의 표현을 정렬하는 대조 손실 함수를 사용한다.
  • 진화적 동일성을 기반으로 단백질-분자 쌍을 합성하는 데이터 증강 방법인 HomoAug을 도입하여 일반화 능력을 향상시킨다.
  • 사전에 분자 표현을 계산하고 저장하여, 쿼리 단백질 표현을 사전에 저장된 분자 표현과 빠르게 매칭함으로써 온라인 추론 속도를 향상시킨다.
  • 대규모 스크리닝 작업에서 단백질 구조 예측을 위해 사전 학습된 모델(예: AlphaFold2)과 파cket 탐지에 Fpocket을 활용한다.

실험 결과

연구 질문

  • RQ1명시적인 결합 친화도 레이블 없이 대조 표현 학습이 지도 학습 방법보다 가상 스크리닝 성능에서 뛰어나게 할 수 있는가?
  • RQ2가상 스크리닝을 밀도 높은 검색 문제로 재정의하면 수십억 개의 화합물 라이브러리에서 효율적이고 고속의 스크리닝이 가능한가?
  • RQ3제안된 HomoAug 데이터 증강 전략이 모델의 일반화 능력과 제로샷 성능을 어떻게 향상시키는가?
  • RQ4실제 신약 개발 상황에서 DrugCLIP는 Glide와 같은 상용 도킹 도구를 얼마나 뛰어나게 성능을 내는가?
  • RQ5이 모델은 주어진 분자를 사용해 잠재적 단백질 타겟을 찾는 타겟 낚시와 같은 다른 신약 개발 작업으로 확장 가능한가?

주요 결과

  • DrugCLIP는 DUD-E 및 LIT-PCBA 벤치마크에서 기존 도킹 및 지도 학습 기반 베이스라인을 모두 뛰어넘는 최신 기술 수준의 제로샷 성능을 달성한다.
  • 의약학 전문가의 인간 평가에서 DrugCLIP의 상위 10개 분자 예측이 Glide의 결과보다 80%의 경우에서 더 선호되었다.
  • 모델은 분자 5억 개 이상의 파손-리간드 쌍을 수분 내로 순서를 매길 수 있었으며, 활성 학습 기반 도킹을 사용할 경우 추정 기준 CPU 1년이 소요되는 작업을 훨씬 빠르게 수행하였다.
  • DrugCLIP는 신장에서 발현되는 후각 기능 GPCR에 대한 잠재적 리간드를 성공적으로 식별하였으며, 특히 2-노네날과 결합하는 OR2T5와 p-크레졸과 결합하는 OR2T11를 발견하였다. 이들은 알려진 요독성 물질이다.
  • 도킹 자세 검증 결과, 수소 결합, 비극성 상호작용, π–π 상호작용 등 생물학적으로 타당한 상호작용이 확인되어 생물학적 타당성을 뒷받침한다.
  • 모델는 타겟 낚시 작업에서도 강력한 일반화 능력을 보였으며, 주어진 분자에 대해 잠재적 타겟을 식별하는 데 도킹 방법을 능가하는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.