[논문 리뷰] Faster and more diverse de novo molecular optimization with double-loop reinforcement learning using augmented SMILES
이 논문은 SMILES 증강을 통한 이중 루프 강화 학습 프레임워크를 제안하여 새로운 분자의 생성을 가속화하고 다양화한다. 내부 루프에서 비표준 SMILES 변종을 생성함으로써, 이 방법은 반복 과정 동안 분자의 평가 점수를 재사용하여 계산 비용을 절감하고 샘플 다양성, 재현 가능성, 리간드 유사도를 향상시킨다. 최적의 성능을 달성하기 위해 5~10회의 증강을 시행한다.
Using generative deep learning models and reinforcement learning together can effectively generate new molecules with desired properties. By employing a multi-objective scoring function, thousands of high-scoring molecules can be generated, making this approach useful for drug discovery and material science. However, the application of these methods can be hindered by computationally expensive or time-consuming scoring procedures, particularly when a large number of function calls are required as feedback in the reinforcement learning optimization. Here, we propose the use of double-loop reinforcement learning with simplified molecular line entry system (SMILES) augmentation to improve the efficiency and speed of the optimization. By adding an inner loop that augments the generated SMILES strings to non-canonical SMILES for use in additional reinforcement learning rounds, we can both reuse the scoring calculations on the molecular level, thereby speeding up the learning process, as well as offer additional protection against mode collapse. We find that employing between 5 and 10 augmentation repetitions is optimal for the scoring functions tested and is further associated with an increased diversity in the generated compounds, improved reproducibility of the sampling runs and the generation of molecules of higher similarity to known ligands.
연구 동기 및 목표
- 강화 학습 기반의 새로운 분자 생성에서 반복적인 분자 평가의 높은 계산 비용을 해결하기 위해.
- 생성 모델의 모드 붕괴를 완화하고 분자 설계를 위한 샘플 다양성을 향상시키기 위해.
- 여러 학습 반복 동안 분자 수준의 평가 점수를 재사용하여 강화 학습의 효율성과 재현 가능성을 향상시키기 위해.
- SMILES 증강이 최적화 속도, 다양성, 알려진 리간드와의 유사도에 미치는 영향을 탐색하기 위해.
제안 방법
- 외부 루프는 정책 최적화, 내부 루프는 SMILES 증강을 수행하는 이중 루프 강화 학습 구조를 사용한다.
- 다양성을 높이기 위해 무작위화 기법을 사용해 표준 SMILES에서 비표준 SMILES 변종을 생성한다.
- 외부 루프에서 이전에 계산된 분자 점수를 여러 내부 루프 학습 단계에 걸쳐 재사용하여 중복 평가를 줄인다.
- 다중 목적 평가 함수를 적용하여 정책 업데이트를 원하는 성질을 가진 분자 쪽으로 이끌어간다.
- 내부 루프 반복 수(5~10회)를 최적화하여 속도, 다양성, 성능 간의 균형을 맞춘다.
- 증강된 SMILES로부터 누적 보상을 기반으로 정책 그래เดียน트 방법을 사용해 생성 모델을 업데이트한다.
실험 결과
연구 질문
- RQ1이중 루프 RL 프레임워크에서 SMILES 증강이 분자 최적화의 속도와 효율성에 어떤 영향을 미치는가?
- RQ2다양성과 계산 비용을 균형 잡는 데 최적의 SMILES 증강 반복 수는 얼마인가?
- RQ3기존의 RL 접근 방식과 비교해 이 방법이 모드 붕괴를 얼마나 줄이고 샘플 다양성을 얼마나 향상시키는가?
- RQ4이 방법이 약물 발견에서 알려진 리간드와의 유사도에 어떤 영향을 미치는가?
- RQ5여러 내부 루프 반복 동안 분자 점수를 재사용하면 학습의 재현 가능성과 수렴성이 향상되는가?
주요 결과
- 5~10회의 SMILES 증강 반복 수가 테스트된 평가 함수 전반에서 최적의 성능, 다양성, 최적화 속도의 균형을 이룩했다.
- 여러 학습 단계에 걸쳐 점수를 재사용함으로써 분자 평가 호출 횟수를 크게 줄였다.
- 기존 방법과 비교해 생성된 분자들이 알려진 리간드와 더 높은 유사도를 보였으며, 이는 약물 발견에서의 관련성 향상을 시사한다.
- 여러 샘플링 런 동안 높은 재현 가능성을 보였고, 출력 분포의 분산을 줄였다.
- 내부 루프 증강이 효과적으로 모드 붕괴를 완화하여 더 다양한 분자 구조를 생성했다.
- 이중 루프 프레임워크는 더 빠른 수렴과 화학적 공간 탐색의 더 효율적인 수행을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.