[논문 리뷰] ChemoVerse: Manifold traversal of latent spaces for novel molecule discovery
이 논문은 분자의 생성 모델에서 고차원이고 희박한 잠재 공간을 효율적으로 탐색하기 위한 모델에 종속되지 않는 프레임워크인 ChemoVerse를 제안한다. 이는 도메인 특화 히우리스틱에 따라 지도된 리만 다양체 보간을 통해 잠재 공간을 유도적 탐색한다. 문법 변동 자동인코더와 k-d 트리, Yen의 알고리즘을 결합하여, 더 높은 약물 유사성과 목표 특성을 갖춘 유효한 분자의 효율적인 생성을 가능하게 하며, 선형 보간보다도 신규성과 구조적 타당성에서 뛰어난 성능을 보인다.
In order to design a more potent and effective chemical entity, it is essential to identify molecular structures with the desired chemical properties. Recent advances in generative models using neural networks and machine learning are being widely used by many emerging startups and researchers in this domain to design virtual libraries of drug-like compounds. Although these models can help a scientist to produce novel molecular structures rapidly, the challenge still exists in the intelligent exploration of the latent spaces of generative models, thereby reducing the randomness in the generative procedure. In this work we present a manifold traversal with heuristic search to explore the latent chemical space. Different heuristics and scores such as the Tanimoto coefficient, synthetic accessibility, binding activity, and QED drug-likeness can be incorporated to increase the validity and proximity for desired molecular properties of the generated molecules. For evaluating the manifold traversal exploration, we produce the latent chemical space using various generative models such as grammar variational autoencoders (with and without attention) as they deal with the randomized generation and validity of compounds. With this novel traversal method, we are able to find more unseen compounds and more specific regions to mine in the latent space. Finally, these components are brought together in a simple platform allowing users to perform search, visualization and selection of novel generated compounds.
연구 동기 및 목표
- 분자의 설계를 위한 생성 모델의 고차원적이고 희박한 잠재 공간에서의 무작위적이고 비효율적인 탐색 문제를 해결하기 위해.
- 특정 원하는 성질을 갖는 새로운 유효한 분자를 발견하기 위해 지능적이고 유도적인 잠재 화학 공간 탐색을 가능하게 하기 위해.
- 피어프린트 유사도, 합성 가능성, 약물 유사성, 결합 활성도와 같은 도메인 특화 히우리스틱을 탐색 과정에 통합하기 위해.
- 검색, 시각화, 생성된 화합물의 선택을 지원하는 확장 가능한 모델에 종속되지 않는 가상 스크리닝 플랫폼을 개발하기 위해.
제안 방법
- SMILES로 인코딩된 분자의 고품질 유효한 잠재 표현을 생성하기 위해 문법 변동 자동인코더(GVAEs)를 사용하였으며, 이는 주의 메커니즘을 통합한 변형도 포함하였다.
- 잠재점 간의 야코비안 거리를 계산하여 국소 기하학적 왜곡을 모델링하고, 잠재 공간 내에서의 구조적 유사성을 유지하였다.
- 야코비안 거리를 간선 가중치로 사용하여 k차원 트리(k-d tree)를 구축함으로써, 잠재 다양체 내에서 로그 시간 복잡도로 효율적인 탐색을 가능하게 하였다.
- Tanimoto 피어프린트 유사도, 합성 가능성(SA) 점수, QED 약물 유사성, 결합 활성도와 같은 다수의 도메인 히우리스틱을 간선 가중치에 통합하여 유도적 경로 탐색을 수행하였다.
- Yen의 알고리즘에 A* 탐색을 적용하여 k-d 트리 내에서 소스와 목적지 점 사이의 최단 경로를 계산하였으며, 원하는 분자 성질을 갖는 경로를 우선순위로 삼았다.
- 계산된 경로를 따라 등거리 보간을 수행하고, 생성기로 잠재 벡터를 복호화하여 새로운 유효한 분자를 생성하였다.
실험 결과
연구 질문
- RQ1히우리스틱 기반 경로 탐색과 함께 리만 다각체 보간이 무작위 또는 선형 샘플링에 비해 희박한 잠재 공간 내에서 새로운 유효한 분자의 발견에 얼마나 효과적인가?
- RQ2다양한 분자 성질 히우리스틱(예: Tanimoto 유사도, SA 점수, QED, 결합 활성도)의 통합이 원하는 화학적 영역으로 향하는 유도적 탐색에 얼마나 효과적인가?
- RQ3다양체 탐색이 선형 보간에 비해 생성된 화합물의 구조적 타당성과 다양성 측면에서 어느 정도 뛰어나게 되는가?
- RQ4이 프레임워크는 높은 잠재력을 지닌 새로운 약물 유사 화합물이 포함된 기존에 탐색되지 않은 잠재 화학 공간 영역을 식별하고 탐색할 수 있는가?
주요 결과
- 피어프린트 유사도와 Yen의 알고리즘을 통한 다양체 탐색은 당뇨병 약물과 폐암 약물의 잠재 영역 사이에서 156개의 유효하고 새로운 화합물을 생성한 반면, 100개의 점을 사용한 선형 보간은 단 3개의 유효한 화합물만 생성하였다.
- 주의 메커니즘을 통합한 문법 VAE는 낮은 비유효 분자 생성 비율을 보이며, 잠재 공간 샘플링에서 개선된 구조적 타당성을 입증하였다.
- 야코비안 기반 거리로 구성된 k-d 트리는 효율적인 로그 시간 탐색을 가능하게 하여, 브루트 포스 방법에 비해 뚜렷한 런타임 성능 향상을 이룩하였다.
- 히우리스틱 기반 가중치 경로 탐색을 통해 고약물 유사성과 높은 결합 활성도를 갖는 화합물이 많은 잠재 공간 영역을 타겟으로 한 탐색이 가능해졌다.
- 소스 및 목적지 점을 변형함으로써 여러 개의 서로 다른 경로를 발견할 수 있었으며, 이는 새로운 화합물 생성의 다양성을 증가시켰다.
- 플랫폼은 잠재 공간 내 관심 영역을 성공적으로 시각화하고 경계를 설정하여 특정 구조적 및 기능적 특성을 갖는 화합물에 대한 집중적 탐색을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.