Skip to main content
QUICK REVIEW

[논문 리뷰] Retrosynthetic Planning with Dual Value Networks

Guoqing Liu, Di Xue|arXiv (Cornell University)|2023. 01. 31.
AI-based Problem Solving and Planning인용 수 5
한 줄 요약

이 논문은 단일 단계 반응 예측기를 완전한 합성 경로 최적화를 위해 훈련하는 강화학습 프레임워크인 이중 가치 네트워크를 통한 계획(PDVN)을 제안한다. 정확도 외에도 전체 합성 경로를 고려하여 성능을 향상시킨다. 합성 가능성과 비용을 위한 두 개의 별도 가치 네트워크와 이중 분지 정책 네트워크를 사용함으로써, 성공률을 높이고(예: USPTO에서 85.79%에서 98.95%로), 경로 길이와 모델 호출 횟수를 줄이며, USPTO 및 과도한 도전 과제를 포함한 다양한 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Retrosynthesis, which aims to find a route to synthesize a target molecule from commercially available starting materials, is a critical task in drug discovery and materials design. Recently, the combination of ML-based single-step reaction predictors with multi-step planners has led to promising results. However, the single-step predictors are mostly trained offline to optimize the single-step accuracy, without considering complete routes. Here, we leverage reinforcement learning (RL) to improve the single-step predictor, by using a tree-shaped MDP to optimize complete routes. Specifically, we propose a novel online training algorithm, called Planning with Dual Value Networks (PDVN), which alternates between the planning phase and updating phase. In PDVN, we construct two separate value networks to predict the synthesizability and cost of molecules, respectively. To maintain the single-step accuracy, we design a two-branch network structure for the single-step predictor. On the widely-used USPTO dataset, our PDVN algorithm improves the search success rate of existing multi-step planners (e.g., increasing the success rate from 85.79% to 98.95% for Retro*, and reducing the number of model calls by half while solving 99.47% molecules for RetroGraph). Additionally, PDVN helps find shorter synthesis routes (e.g., reducing the average route length from 5.76 to 4.83 for Retro*, and from 5.63 to 4.78 for RetroGraph). Our code is available at \url{https://github.com/DiXue98/PDVN}.

연구 동기 및 목표

  • 기존의 기계학습 기반 합성 반전 방법이 단일 단계 예측기의 정확도 향상에만 집중하며 전체 합성 경로를 고려하지 않는 한계를 해결하기 위해.
  • 완전한 합성 경로 품질을 최적화하는 강화학습을 통해 단일 단계 예측기를 훈련시켜 다단계 계획자 성능을 향상시키기 위해.
  • 합성 반전 목표를 합성 가능성과 비용이라는 두 가지 별개의 가치 함수로 분해하여 보다 효과적인 정책 학습을 가능하게 하기 위해.
  • 경로의 완전성과 효율성을 최적화하면서도 단일 단계 예측 정확도를 유지하기 위해 이중 분지 네트워크 아키텍처를 사용하기 위해.
  • 표준 벤치마크, 특히 USPTO, ChEMBL-1000, GDB17-1000에서 최신 기술 수준의 성능을 입증하기 위해.

제안 방법

  • PDVN은 수순 결정 문제로 모델링된 합성 반전 계획을 수순 결정 문제로 모델링하기 위해 트리형 마르코프 결정 과정(MDP)을 사용한다.
  • 현재 네트워크를 사용하여 합성 경험을 시뮬레이션하는 계획 단계와, 훈련 타겟을 추출하고 네트워크를 업데이트하는 업데이트 단계를 번갈아 수행한다.
  • 합성 가능성 예측을 위한 하나, 합성 비용 예측을 위한 다른 하나인 두 개의 별도 가치 네트워크를 사용한다.
  • 이중 분지 정책 네트워크는 고정된 사전 훈련된 모델과 경로 품질을 최적화하는 반응 확률 분포를 학습할 수 있는 가용한 분지가 결합되어 단일 단계 정확도를 유지한다.
  • PUCT 알고리즘을 수정하여 트리 탐색에서 두 가지 가치 네트워크를 모두 사용하고, 고품질, 저비용, 합성 가능한 경로로의 탐색을 이끌어낸다.
  • 시뮬레이션된 경로에서의 경험 재생을 통해 온라인으로 훈련을 수행함으로써 정책 및 가치 네트워크의 지속적인 향상을 가능하게 한다.

실험 결과

연구 질문

  • RQ1강화학습이 단일 단계 반응 예측기의 성능을 단일 단계 정확도를 넘어서 전체 합성 경로 최적화로 향상시킬 수 있는가?
  • RQ2합성 가능성과 비용 가치 네트워크로 합성 반전 목표를 분해하면 더 나은 경로 품질과 성공률을 달성할 수 있는가?
  • RQ3이중 분지 정책 네트워크는 더 나은 다단계 경로를 생성하는 동시에 높은 단일 단계 예측 정확도를 유지할 수 있는가?
  • RQ4기본 기반 계획자들과 비교해 복잡하고 다양한 데이터셋인 ChEMBL-1000과 GDB17-1000에서 PDVN의 성능은 어떠한가?
  • RQ5각 구성 요소(합성 가능성 vs. 비용 가치 네트워크)가 성능 향상에 기여하는 정도는 어느 정도인가?

주요 결과

  • USPTO 190 테스트 세트에서 PDVN은 Retro*의 성공률을 85.79%에서 98.95%로 높여, 경로 완성도를 크게 향상시켰다.
  • RetroGraph의 경우, 모델 호출 수를 절반으로 줄였고 99.47%의 분자들을 해결하여 최신 기술 수준의 성능을 달성했다.
  • Retro*의 평균 경로 길이는 5.76에서 4.83단계로, RetroGraph의 경우 5.63에서 4.78단계로 감소하여 더 짧고 효율적인 경로를 생성함을 시사한다.
  • ChEMBL-1000에서 PDVN은 Retro*가 기존 기반 모델 대비 762개에서 835개로 분자 해결 수를 늘렸고, GDB17-1000에서는 해결 가능한 분자 수를 95개에서 269개로 증가시켰다.
  • 절단 실험 결과, 합성 가능성 및 비용 가치 네트워크 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성공률이 떨어지고 경로 길이가 증가한다.
  • 사례 연구 결과, PDVN은 화학적으로 타당한 경로를 생성하며, 이전에 해결되지 않았던 분자들에 대해서도 원래 경로보다 한 단계 더 짧은 경로를 생성함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.