[논문 리뷰] Application of generative autoencoder in de novo molecular design
이 논문은 plusieurs generative autoencoder 아키텍처(VAE 및 AAE 변형)를 평가하여 de novo 분자 설계를 위한 잠재 공간 구조 보존을 보여주고, 예측 DRD2 활성을 목표로 하는 베이지안 최적화를 가능하게 한다.
A major challenge in computational chemistry is the generation of novel molecular structures with desirable pharmacological and physiochemical properties. In this work, we investigate the potential use of autoencoder, a deep learning methodology, for de novo molecular design. Various generative autoencoders were used to map molecule structures into a continuous latent space and vice versa and their performance as structure generator was assessed. Our results show that the latent space preserves chemical similarity principle and thus can be used for the generation of analogue structures. Furthermore, the latent space created by autoencoders were searched systematically to generate novel compounds with predicted activity against dopamine receptor type 2 and compounds similar to known active compounds not included in the training set were identified.
연구 동기 및 목표
- 화합물이 연속 잠재 공간에 매핑되고 자동인코더로 재구성될 수 있는지 탐구한다.
- 잠재 공간이 화학적 유사성 원리를 보존하는지 평가한다.
- 잠재 공간 표현을 사용하여 원하는 특성을 가진 새로운 화합물을 생성할 수 있는지 평가한다.
- 교사 강제 여부가 있는/없는 VAE 및 Gaussian/Uniform 선험을 가진 AAE 등 다양한 오토인코더 아키텍처를 비교한다.
- DRD2 목표 활성을 위한 QSAR 모델에 의해 안내되는 잠재 공간에서의 베이지안 최적화를 시연한다.
제안 방법
- ChEMBL SMILES 데이터를 사용하여 NoTeacher VAE, Teacher VAE, Gauss AAE, Uniform AAE 등 다중 오토인코더 모델을 훈련하고 56차원 잠재 공간으로 매핑한다.
- 시퀀스 생성 중 SMILES 유효성을 향상시키기 위해 teacher forcing을 사용한다.
- 잠재 선험을 강제하기 위해 판별기를 추가하여 적대적 자동인코더를 구현한다(가우시안 또는 균일).
- SMILES를 35개 토큰으로 토큰화하고 디코더 출력의 샘플링으로 새 SMILES를 생성하며 RDKit으로 검증한다.
- 잠재 공간에서 DRD2 활성 SVM 모델을 목표로 하는 베이지안 최적화를 적용하여 높은 점수를 받는 화합물을 식별한다.
- 생성된 구조를 필터링하여 원환 고리 크기가 8 원자를 초과하지 않도록 하고 SMILES 유효성을 보장한다.
실험 결과
연구 질문
- RQ1생성적 오토인코더에서 화합물이 연속 잠재 공간으로 정확하게 매핑되고 재구성될 수 있는가?
- RQ2잠재 공간이 근접 화학적 유사성을 보존하여 유사체 탐색이 가능하게 하는가?
- RQ3잠재 공간 생성을 QSAR 모델과 결합하여 DRD2에 대해 예측된 활성을 가진 새로운 화합물을 발견할 수 있는가?
- RQ4다른 AE 아키텍처가 재구성, 생성된 SMILES의 유효성, 잠재 공간의 매끄러움에 어떤 영향을 미치는가?
- RQ5합성 가능성을 유지하면서 잠재 공간 탐색을 고활성 후보로 이끄는 데 베이지안 최적화가 효과적인가?
주요 결과
- 네 가지 모델 모두 학습 데이터에서 높은 문자 재구성을 달성하며, 교사 강제가 적용된 모델이 생성 모드에서 더 높은 비율의 유효한 SMILES를 얻는다.
- Uniform AAE는 가장 높은 비율의 유효한 SMILES를 제공하고 Celecoxib 유사체가 학습에서 제거되었을 때에도 매끄러운 잠재 공간을 유지한다.
- Celecoxib에 대한 잠재 공간 인접성이 생성 화합물의 구조적 유사성이 더 높다는 것과 상관되어 국부적으로 유사성 원리를 뒷받침한다.
- Uniform AAE 잠재 공간에서의 BO 유도 탐색은 높은 예측 DRD2 활성을 가진 구조와 알려진 활성 화합물과의 합리적 유사성을 가진 구조를 산출한다.
- BO 접근법은 Pactive 값이 0.5 이상인 후보를 많이 식별하고, 생성된 활성 화합물의 상당 부분이 확인된 활성 화합물과 합리적인 유사성을 가진다.
- Celecoxib 유사체를 학습에서 제외해도 Uniform AAE는 Celecoxib 이웃 영역을 효과적으로 재구성하여 잠재 표현의 견고함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.