Skip to main content
QUICK REVIEW

[논문 리뷰] Molecular De Novo Design through Deep Reinforcement Learning

Marcus Olivecrona, Thomas Blaschke|arXiv (Cornell University)|2017. 04. 25.
Computational Drug Discovery Methods참고 문헌 35인용 수 7
한 줄 요약

이 논문은 SMILES 기반의 순차적 생성 모델(RNN)을 강화학습을 통해 조정하여 원하는 성질을 가진 분자를 설계하는 데에 사용되는 딥 강화학습 프레임워크인 REINVENT를 제안한다. 이는 확장된 에피소딕 리크릿리뷰를 사용하며, 기존의 REINFORCE 및 이전의 강화학습 방법에 비해 뛰어난 성능을 보이며, DRD2에 대해 예측된 활성 물질의 95% 이상을 생성하였다. 또한 학습 중에 볼 수 없었던 알려진 활성 물질을 복원하였다.

ABSTRACT

This work introduces a method to tune a sequence-based generative model for molecular de novo design that through augmented episodic likelihood can learn to generate structures with certain specified desirable properties. We demonstrate how this model can execute a range of tasks such as generating analogues to a query structure and generating compounds predicted to be active against a biological target. As a proof of principle, the model is first trained to generate molecules that do not contain sulphur. As a second example, the model is trained to generate analogues to the drug Celecoxib, a technique that could be used for scaffold hopping or library expansion starting from a single molecule. Finally, when tuning the model towards generating compounds predicted to be active against the dopamine receptor type 2, the model generates structures of which more than 95% are predicted to be active, including experimentally confirmed actives that have not been included in either the generative model nor the activity prediction model.

연구 동기 및 목표

  • 특정 선호되는 성질(예: 생활성, 약물 유사성 등)을 가진 분자를 생성할 수 있는 분자 신규 설계 방법을 개발하는 것.
  • 규칙 기반 및 역방향 QSAR 방법의 한계를 극복하기 위해, 유연하고 데이터 기반의 접근 방식을 사용하여 고정된 반응 또는 변환 규칙을 피하는 것.
  • 강화학습 기반의 분자 생성 기법을 향상시키기 위해, 훈련의 안정성과 이전 지식의 유지에 기여하는 확장된 에피소딕 리크릿리뷰를 도입하는 것.
  • 쿼리 분자(예: 세레코시비브)의 유사체를 생성하고, 학습 데이터에 포함되지 않은 생물학적 타겟(예: DRD2)에 대해 실험적으로 확인된 활성 물질을 발견할 수 있는 능력을 입증하는 것.

제안 방법

  • ChEMBL에서 추출한 SMILES 문자열을 기반으로 사전에 훈련된 RNN(Prior)을 사용하여 화학적으로 타당한 분자의 분포를 모델링한다.
  • 에이전트 네트워크는 Prior의 복제본으로 초기화되며, 원하는 성질을 가진 분자를 생성하기 위해 강화학습을 통해 미세조정된다.
  • 이 방법은 확장된 에피소딕 리크릿리뷰를 사용한다. 이는 이전 모델의 가능성과 분자의 성질에 기반한 보상 신호를 조합한 수정된 정책 기반 경량 방법이다.
  • 보상 함수는 활성도, cLogP, QED 등의 성질을 평가하기 위해 예측 모델(SVM 또는 DNN 등)을 사용하여 정의된다.
  • 에이전트는 정책 기반 경량 최적화를 통해 훈련되며, 토큰의 시퀀스에 대해 시간 역행 전파(BPTT)를 통해 기울기를 계산한다.
  • 이 방법은 하이퍼파rameter에 대해 강건하며, 수동으로 보상 형상 조정이 필요 없어 보상 오용의 위험을 줄인다.

실험 결과

연구 질문

  • RQ1딥 강화학습 프레임워크가 특정 선호되는 성질을 가진 분자를 효과적으로 생성하기 위해 생성 RNN를 조정하는 데에 효과적인가?
  • RQ2확장된 에피소딕 리크릿리뷰는 분자 생성 과제에서 기존의 REINFORCE 및 이전의 강화학습 방법에 비해 어떻게 비교되는가?
  • RQ3학습 데이터에서 제외된 분자(예: 세레코시비브)의 고급 유사체를 모델이 생성할 수 있는가?
  • RQ4생성 모델이나 활성도 예측 모델에 포함되지 않은 분자들에 대해, 생물학적 타겟(예: DRD2)에 대해 실험적으로 확인된 활성 물질을 발견할 수 있는가?
  • RQ5학습률 및 노이즈 스케일과 같은 하이퍼파rameter의 변화에 대해 이 방법은 얼마나 강건한가?

주요 결과

  • 모델은 도파민 수용체 D2에 대해 예측된 활성 물질의 95% 이상을 생성하였으며, 무작위 샘플링 및 기준 방법에 비해 뚜렷이 뛰어난 성능을 보였다.
  • 학습 데이터에서 생성 모델이나 활성도 예측 모델 양쪽 모두에 포함되지 않은 알려진 활성 화합물들조차도 성공적으로 복원하였다.
  • 기존의 REINFORCE 및 이전의 강화학습 방법에 비해 뛰어난 성능을 보였으며, 특히 새로운 목표를 학습하면서도 이전 분포를 유지하는 데서 두각을 나타냈다.
  • 세레코시비브의 구조적으로 다양한 유사체를 생성하였으며, 이는 훈련 세트에 포함되지 않은 유사체도 포함하여 화학적 공간의 효과적인 탐색을 보여주었다.
  • 이 방법은 하이퍼파rameter 설정에 대해 강건하였으며, 학습률 및 노이즈 스케일 σ의 다양한 값에서도 일관된 성능을 보였다.
  • 확장된 에피소딕 리크릿리뷰의 사용은 안정적인 훈련과 이전 지식을 잃는 위험 감소를 가능하게 하였으며, 이는 보상 중심의 강화학습 방법과는 대조되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.