[논문 리뷰] Improving Small Molecule Generation using Mutual Information Machine
MolMIM는 SMILES 문자열에서 정보적이고 군집화된 고정 크기의 잠재 공간을 학습하기 위해 상호정보량 기반 학습(Mutual Information Machine, MIM)을 사용하는 소분자 생성을 위한 확률적 오토인코더이다. CMA-ES를 통한 간단한 잠재 공간 최적화를 통해 높은 품질, 유효성, 유일성, 새로운 분자의 생성을 가능하게 하며, 강화 학습이나 복잡한 아키텍처 없이도 단일 및 다중 성능 최적화에서 최신 기술 수준의 성능을 달성한다.
We address the task of controlled generation of small molecules, which entails finding novel molecules with desired properties under certain constraints (e.g., similarity to a reference molecule). Here we introduce MolMIM, a probabilistic auto-encoder for small molecule drug discovery that learns an informative and clustered latent space. MolMIM is trained with Mutual Information Machine (MIM) learning, and provides a fixed length representation of variable length SMILES strings. Since encoder-decoder models can learn representations with ``holes'' of invalid samples, here we propose a novel extension to the training procedure which promotes a dense latent space, and allows the model to sample valid molecules from random perturbations of latent codes. We provide a thorough comparison of MolMIM to several variable-size and fixed-size encoder-decoder models, demonstrating MolMIM's superior generation as measured in terms of validity, uniqueness, and novelty. We then utilize CMA-ES, a naive black-box and gradient free search algorithm, over MolMIM's latent space for the task of property guided molecule optimization. We achieve state-of-the-art results in several constrained single property optimization tasks as well as in the challenging task of multi-objective optimization, improving over previous success rate SOTA by more than 5\% . We attribute the strong results to MolMIM's latent representation which clusters similar molecules in the latent space, whereas CMA-ES is often used as a baseline optimization method. We also demonstrate MolMIM to be favourable in a compute limited regime, making it an attractive model for such cases.
연구 동기 및 목표
- 약물 유사성과 타겟 친화성 등의 성능 제약 조건 하에서 제어 가능한 소분자 생성의 과제를 해결하기 위해.
- 명시적인 성능 감독 없이도 유사한 분자를 군집화하는 조밀하고 정보적인 화학적으로 의미 있는 잠재 공간을 학습하기 위해.
- 잠재 공간 내에서 단순한 기울기 없는 탐색을 통해 효율적이고 효과적인 분자 최적화를 가능하게 하기 위해.
- 계산 자원이 제한된 조건에서도 단일 및 다중 목표 분자 최적화 과제에서 뛰어난 성능을 달성하기 위해.
- 간단한 최적화 전략인 CMA-ES가 잘 구성된 잠재 공간과 결합될 경우 더 복잡한 방법보다도 뛰어난 성능을 낼 수 있음을 보여주기 위해.
제안 방법
- MolMIM는 가변 길이의 SMILES 문자열을 고정 크기의 잠재 표현으로 매핑하기 위해 Perceiver 인코더와 Transformer 디코더를 사용한다.
- 모델는 입력 분자와 그 잠재 코드 간의 상호정보량을 최대화하는 상호정보량 기반 학습(Mutual Information Machine, MIM)을 사용해 훈련된다.
- 임의의 잠재 공간 변형으로 인한 유효하지 않은 샘플을 줄이고 조밀한 잠재 공간을 촉진하기 위해 MIM 학습에 새로운 확장을 도입한다.
- 성능 기반 분자 생성을 위해 CMA-ES, 즉 기울기 없는 블랙박스 최적화 알고리즘을 사용해 잠재 공간을 최적화한다.
- 훈련 중에 강화 학습이나 명시적인 화학적 성능 레이블이 필요 없으며, 대신 비지도 사전 훈련에 의존한다.
- 잠재 코드의 변형을 통해 새로운 분자를 생성하며, 유효성은 모델이 학습한 밀도와 군집화로 보장된다.
실험 결과
연구 질문
- RQ1자기지도 학습 및 MIM로 훈련된 오토인코더는 명시적인 성능 감독 없이도 화학적으로 유사한 분자를 군집화하는 조밀하고 정보적인 잠재 공간을 학습할 수 있는가?
- RQ2잘 구성된 잠재 공간에 적용될 경우, CMA-ES와 같은 단순한 기울기 없는 최적화 방법이 더 복잡한 최적화 전략을 능가하는가?
- RQ3기존의 고정 크기 및 가변 크기 모델과 비교해 MolMIM는 생성된 분자의 유효성, 유일성, 신규성에서 얼마나 향상되었는가?
- RQ4QED, SA 점수, 타겟 억제 등의 상충되는 제약 조건이 존재하는 다중 목표 최적화 과제에서 MolMIM의 효과는 어떠한가?
- RQ5계산 자원이 제한된 환경에서도 MolMIM은 높은 성능을 유지할 수 있는가? 이는 실제 약물 발견 파이프라인에 실용적인가?
주요 결과
- MolMIM는 예시 기반 초기화를 사용한 다중 목표 최적화에서 99.2%의 성공률을 기록하여, 신규성과 다양성 면에서 JANUS와 FaST를 모두 능가했다.
- 단일 성능 최적화에서 MolMIM는 logP, QED, SA 점수에서 최신 기술 수준의 성능을 달성했으며, 최고 성능 버전에서 유효성 97.5%와 신규성 71.1%를 기록했다.
- 49회 재시작 버전(MolMIM E†)을 사용한 다중 목표 최적화에서 49%의 성공률를 기록했으며, 높은 신규성과 다양성을 유지했다.
- MolMIM의 잠재 공간은 임의의 변형에서도 고품질의 생성을 가능하게 하였으며, E 버전에서 유효성 98.3%와 신규성 55.1%를 기록하여 조밀하고 강력한 표현을 나타냈다.
- 강화 학습 없이도 경쟁 가능한 성능를 달성했으며, 이는 잠재 공간의 품질이 복잡한 최적화 알고리즘보다 더 중요하다는 것을 보여주었다.
- MolMIM가 학습한 잠재 공간은 암묵적으로 유사한 분자를 군집화하며, CMA-ES와 같은 단순한 탐색 방법조차도 효율적인 최적화를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.