Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Chemical Space with Score-based Out-of-distribution Generation

Seul Lee, Jaehyeong Jo|arXiv (Cornell University)|2022. 06. 06.
Computational Drug Discovery Methods인용 수 5
한 줄 요약

이 논문은 분자의 학습 분포를 초월한 제어 가능한 탐색을 가능하게 하는 스코어 기반 확산 모델인 Molecular Out-of-distribution Diffusion (MOOD)을 제안한다. 학습된 분포 외부의 분포를 조절하기 위해 학습 가능한 초매개변수 λ를 통합하고, 성능 예측기의 기울기를 활용함으로써 MOOD는 새로운 고친결합성 분자를 생성한다. 이는 기존 최고 성능 모델보다도 높은 친결합성과 신규성 성능를 기록하면서도 추가적인 계산 비용이 발생하지 않는다.

ABSTRACT

A well-known limitation of existing molecular generative models is that the generated molecules highly resemble those in the training set. To generate truly novel molecules that may have even better properties for de novo drug discovery, more powerful exploration in the chemical space is necessary. To this end, we propose Molecular Out-Of-distribution Diffusion(MOOD), a score-based diffusion scheme that incorporates out-of-distribution (OOD) control in the generative stochastic differential equation (SDE) with simple control of a hyperparameter, thus requires no additional costs. Since some novel molecules may not meet the basic requirements of real-world drugs, MOOD performs conditional generation by utilizing the gradients from a property predictor that guides the reverse-time diffusion process to high-scoring regions according to target properties such as protein-ligand interactions, drug-likeness, and synthesizability. This allows MOOD to search for novel and meaningful molecules rather than generating unseen yet trivial ones. We experimentally validate that MOOD is able to explore the chemical space beyond the training distribution, generating molecules that outscore ones found with existing methods, and even the top 0.01% of the original training pool. Our code is available at https://github.com/SeulLee05/MOOD.

연구 동기 및 목표

  • 기존 분자 생성 모델의 탐색 범위가 제한되어 있어 주로 학습 데이터셋에 유사한 분자를 생성하는 문제를 해결하기 위해.
  • QED나 벌점 부여된 logP와 같은 단순한 분자 성질에 의존할 경우 종종 무의미하거나 약물 유사성이 낮은 분자가 생성되는 문제를 해결하기 위해.
  • 높은 친결합성, 약물 유사성, 합성 가능성과 같은 복잡한 실제 약물 발견 기준을 동시에 만족하는 새로운 분자를 효과적으로 다중 목표로 생성하기 위해.
  • 추가 계산 비용 없이 학습 분포를 초월한 화학적 공간 탐색을 가능하게 하는 방법을 개발하기 위해.

제안 방법

  • 학습 데이터 분포에서의 탈리도를 조절할 수 있는 초매개변수 λ를 활용한 새로운 OOD 제어 역방향 확산 과정을 제안하며, 이는 스코어 기반 생성 모델에서 수행된다.
  • 가벼운 성능 예측기의 기울기를 활용한 기반 기반 조건부 생성 기법을 도입하여 역방향 확산 과정이 화학적 공간 내 고성능 영역으로 유도되도록 한다.
  • 확률적 미분 방정식(SDE) 프레임워크를 활용하며, OOD 제어는 수정된 이동항을 통해 스코어 함수를 λ로 스케일링함으로써 통합된다.
  • 무작위 노이즈에서 시작하여 점진적으로 노이즈를 제거하여 유효한 분자 구조로 수렴하는 노이즈 제거 확산 과정을 사용하며, OOD 제어를 통해 낮은 밀도의 분포 외부 영역으로의 탐색이 가능해진다.
  • OOD 제어와 성능 기울기 유도를 결합하여 동시에 새로운 분자 생성과 원하는 분자 성질(예: 단백질-리간드 친결합성) 최적화를 동시에 추진한다.
  • 강화 학습 기반 또는 반복 오라클 기반 접근 방식과 달리, 추가적인 추론 또는 학습 오버헤드 없이 λ 조정만으로도 비용 없이 OOD 생성을 달성한다.

실험 결과

연구 질문

  • RQ1스코어 기반 확산 모델이 학습 분포를 초월하여 새로운 분자와 화학적으로 의미 있는 분자를 효과적으로 생성할 수 있는가?
  • RQ2OOD 제어 메커니즘에서 초매개변수 λ는 분자 신규성과 성능 최적화 사이의 균형에 어떻게 영향을 미치는가?
  • RQ3OOD 제어 확산과 성능 기울기 유도를 조합하면 학습 세트 상위 0.01%의 분자보다 더 높은 친결합성을 가지는 분자를 생성할 수 있는가?
  • RQ4제안된 방법은 기존 최고 성능 모델보다 추가 계산 비용 없이 새로운 고친결합성 분자를 더 잘 생성할 수 있는가?
  • RQ5이 방법은 학습 분자와 구조적으로 다를 뿐만 아니라 고약물 유사성과 고합성 가능성을 갖춘 분자를 생성할 수 있는가?

주요 결과

  • PARP1 타겟에서 MOOD는 7.017%의 높은 새로운 효과 분자 비율을 기록하여 LIMO(0.455%) 및 기타 기준 모델을 크게 앞섰다.
  • MOOD는 -10.865 kcal/mol의 친결합성을 가지는 분자를 생성하여 ZINC250k 학습 세트 상위 0.01%를 초월했다.
  • λ = 0.04일 때 MOOD는 84.18%의 높은 신규성과 높은 성능 점수 간의 최적 균형을 달성하여 λ = 0.03 및 λ = 0.05보다 뛰어난 성능를 보였다.
  • 모든 학습 분자와 비교해도 유의미한 서브구조 유사성이 없었으며, 가장 유사한 경우조차도 이는 진정한 OOD 생성을 확인한다.
  • 3,000개 분자를 생성하는 데 걸리는 시간은 682.4초로, 랜덤 기준 모델과 유사했으며, FREED와 같은 고비용 오라클 기반 방법(17,063.7초)을 뛰어넘었다.
  • Dockstring F2 벤치마크에서 MOOD는 -3.920의 점수를 기록하여 LIMO(-0.318)와 FREED(-3.391)보다 유의미하게 뛰어나, 다중 목표 최적화 능력이 뛰어나다는 것을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.