[논문 리뷰] Retrieval-based Controllable Molecule Generation
이 논문은 사전에 훈련된 생성 모델을 태스크에 특화된 미세조정 없이도 작동하도록, 소량의 예시 분자로 유도하는 검색 기반 프레임워크인 RetMol을 제안한다. 자기지도 학습 기반의 유사도 목표와 반복적 개선을 통해 입력 분자와 예시 분자를 검색하고 융합함으로써, SARS-CoV-2 메인 프로테아제 억제제 설계와 같은 도전적인 실세계 시나리오에서도 원하는 성질을 가진 분자를 생성하는 데 있어 최신 기술 수준의 성능을 달성한다.
Generating new molecules with specified chemical and biological properties via generative models has emerged as a promising direction for drug discovery. However, existing methods require extensive training/fine-tuning with a large dataset, often unavailable in real-world generation tasks. In this work, we propose a new retrieval-based framework for controllable molecule generation. We use a small set of exemplar molecules, i.e., those that (partially) satisfy the design criteria, to steer the pre-trained generative model towards synthesizing molecules that satisfy the given design criteria. We design a retrieval mechanism that retrieves and fuses the exemplar molecules with the input molecule, which is trained by a new self-supervised objective that predicts the nearest neighbor of the input molecule. We also propose an iterative refinement process to dynamically update the generated molecules and retrieval database for better generalization. Our approach is agnostic to the choice of generative models and requires no task-specific fine-tuning. On various tasks ranging from simple design criteria to a challenging real-world scenario for designing lead compounds that bind to the SARS-CoV-2 main protease, we demonstrate our approach extrapolates well beyond the retrieval database, and achieves better performance and wider applicability than previous methods. Code is available at https://github.com/NVlabs/RetMol.
연구 동기 및 목표
- 라벨이 부여된 활성 분자가 제한된 데이터가 부족한 환경에서 제어 가능한 분자 생성의 과제를 해결한다.
- 기존 방법들이 광범위한 미세조정이 필요하거나 현대적 아키텍처와 호환되지 않는 고정된 잠재 공간 모델에 의존하는 한계를 극복한다.
- 최소한의 모델 적응으로 다양한 분자 설계 과제에 일반화할 수 있도록 한다.
- 기본 생성 모델의 선택에 관계없이 작동하며, 실세계 약물 발견 환경에서 효율적으로 작동하는 프레임워크를 개발한다.
제안 방법
- 예시 분자를 사용해 생성 모델을 유도하기 위해 사전 훈련된 생성 모델(예: BART 기반)과 검색 모듈을 통합한다.
- 구조적 유사성과 성질 유사성 기반으로 입력 분자와 예시 분자를 검색하고 융합하는 검색 기반 메커니즘을 설계한다.
- 입력 분자의 잠재 공간에서 가장 가까운 이웃을 예측하는 자기지도 학습 목표를 통해 검색 모듈을 훈련한다.
- 동적으로 생성된 분자와 검색 데이터베이스를 업데이트하는 반복적 개선 과정을 구현하여 일반화 능력을 향상시킨다.
- 다중 제약 조건 최적화에서 수렴성과 성공률을 향상시키기 위해, 더 어려운 제약 조건(예: 도킹 친화도)을 더 쉽게 만족하는 제약 조건보다 우선순위를 높이는 속성 완화 순서를 사용한다.
- 생성 모델과 분리된 검색 기반 메커니즘을 통해 그래프 기반 아키텍처(예: HierG2G)를 포함한 다양한 생성 모델과의 호환성을 확보한다.
실험 결과
연구 질문
- RQ1태스크에 특화된 미세조정 없이도 검색 기반 접근이 강력한 제어 가능한 분자 생성 성능을 달성할 수 있는가?
- RQ2제한된 활성 분자를 가진 실세계 약물 설계 과제에 프레임워크가 얼마나 잘 일반화되는가?
- RQ3다중 제약 조건 최적화에서 속성 완화 순서가 검색 성공률과 수렴성에 어떤 영향을 미치는가?
- RQ4Transformer 기반 아키텍처를 초월한 다양한 생성 모델에 대해 프레임워크가 효과적으로 적용될 수 있는가?
- RQ5효율성과 성능 측면에서 검색 기반 융합 메커니즘은 엔드 투 엔드 미세조정 또는 잠재 공간 최적화와 어떻게 비교되는가?
주요 결과
- RetMol은 펜알티드 로그P 및 QED 최적화를 포함한 여러 제어 가능한 생성 과제에서 최신 기술 수준의 성능을 달성하며, 미세조정 없이도 베이스라인 방법을 능가한다.
- SARS-CoV-2 메인 프로테아제 억제제 설계 과제에서 RetMol은 개선된 결합 친화도를 가진 분자를 성공적으로 생성하여 실세계 적용 가능성을 입증했다.
- 검색 모듈은 계산 오버헤드를 거의 추가하지 않으며, 평균적으로 분자당 0.0006초의 추가 시간만 소요된다(기본 모델 대비 0.00402s 대비 0.00343s).
- 입력 분자와 그 10번째로 가까운 이웃 간의 평균 코사인 유사도는 0.35로, 낮은 순위에서도 검색된 분자가 여전히 구조적으로 관련성이 있음을 시사한다.
- HierG2G를 포함한 다양한 기본 생성 모델에서 RetMol은 높은 성능 유지를 보이며, 아키텍처 간 호환성과 일반화 능력을 확인한다.
- 더 어려운 제약 조건(예: 도킹 친화도)을 더 쉽게 만족하는 제약 조건(예: 유사도)보다 먼저 완화함으로써 QED 과제에서 성공률이 11% 향상되었다(89.5% 대비 78.5%), 전략의 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.