Skip to main content
QUICK REVIEW

[논문 리뷰] Sample-efficient Multi-objective Molecular Optimization with GFlowNets

Yiheng Zhu, Jialu Wu|arXiv (Cornell University)|2023. 02. 08.
Computational Drug Discovery Methods인용 수 6
한 줄 요약

이 논문은 근사 파레토 프론트에서 다양하고 고급도 높은 분자 후보를 생성하기 위해 초원형 네트워크 기반 GFlowNet을 사용하는 샘플 효율적인 다목적 베이지안 최적화 프레임워크인 HN-GFN을 제안한다. 선호도 벡터에 조건을 두고 후행 유사 오폐리스트라트지( hindsight-like off-policy strategy)를 활용함으로써, HN-GFN은 다양한 분자 최적화 벤치마크에서 샘플 효율성과 성능을 향상시키며, 기존 방법들을 능가하는 후보의 품질과 다양성을 확보한다.

ABSTRACT

Many crucial scientific problems involve designing novel molecules with desired properties, which can be formulated as a black-box optimization problem over the discrete chemical space. In practice, multiple conflicting objectives and costly evaluations (e.g., wet-lab experiments) make the diversity of candidates paramount. Computational methods have achieved initial success but still struggle with considering diversity in both objective and search space. To fill this gap, we propose a multi-objective Bayesian optimization (MOBO) algorithm leveraging the hypernetwork-based GFlowNets (HN-GFN) as an acquisition function optimizer, with the purpose of sampling a diverse batch of candidate molecular graphs from an approximate Pareto front. Using a single preference-conditioned hypernetwork, HN-GFN learns to explore various trade-offs between objectives. We further propose a hindsight-like off-policy strategy to share high-performing molecules among different preferences in order to speed up learning for HN-GFN. We empirically illustrate that HN-GFN has adequate capacity to generalize over preferences. Moreover, experiments in various real-world MOBO settings demonstrate that our framework predominantly outperforms existing methods in terms of candidate quality and sample efficiency. The code is available at https://github.com/violet-sto/HN-GFN.

연구 동기 및 목표

  • 비용이 많이 들고 상충되는 목적이 존재하는 환경에서 샘플 효율적이고 다목적 분자 최적화를 해결하기 위해.
  • 후보 생성 과정에서 목적 공간(트레이드오프)과 탐색 공간(분자 구조) 양쪽에서 다양성을 향상시키기 위해.
  • 재학습 없이도 여러 목적으로 일반화 가능한 통합된 선호도 조건부 확보 함수 최적화기 개발을 위해.
  • 다른 선호도 조건 간에 고성능 분자를 공유함으로써 오폐리스트라트지 전략을 사용해 학습을 가속화하기 위해.

제안 방법

  • 선호도 벡터에 조건을 두어 분자 그래프를 생성하는 초원형 네트워크 기반 GFlowNet(HN-GFN)을 훈련함으로써, 다양한 목표 간의 트레이드오프를 민첩하게 탐색할 수 있도록 한다.
  • 다양한 선호도 벡터에 대해 동일한 공유 초원형 네트워크를 사용하여 스칼라화된 목표의 분포에 걸쳐 통합된 훈련을 가능하게 한다.
  • 후행 유사 오폐리스트라트지 전략은 한 선호도 조건에서 얻은 고성능 분자를 다른 선호도 조건의 정책 향상에 재사용함으로써 수렴 속도를 가속화한다.
  • 이 방법은 대체 모델이 불확실성을 추정하고 HN-GFN이 확보 함수를 최적화하여 정보성 있고 다양한 후보 배치를 선택하는 베이지안 최적화 루프와 통합된다.
  • 보상 함수는 스칼라화(예: 가중합 또는 티비체프)를 통해 정의되며, 파레토 프론트 탐색을 장려하기 위해 선호도 벡터는 딜리클레 분포에서 샘플링된다.
  • 프레임워크는 GSK3β, JNK3, QED 및 SA 점수를 포함한 다성분 약물 설계와 같은 합성 및 실제 분자 최적화 작업에서 평가된다.
Figure 1: MOBO loop for molecular optimization using a surrogate model $\mathcal{M}$ for uncertainty estimation and HN-GFN for acquisition function optimization. In each round, the policy $\pi_{\theta}$ is trained with reward function $R_{\lambda}$ , where $\lambda$ is sampled from $\operatorname{Di
Figure 1: MOBO loop for molecular optimization using a surrogate model $\mathcal{M}$ for uncertainty estimation and HN-GFN for acquisition function optimization. In each round, the policy $\pi_{\theta}$ is trained with reward function $R_{\lambda}$ , where $\lambda$ is sampled from $\operatorname{Di

실험 결과

연구 질문

  • RQ1재학습 없이도 단일 통합 GFlowNet 모델이 여러 상충되는 분자 목표 간의 다양한 트레이드오프를 효과적으로 탐색할 수 있는가?
  • RQ2후행 경험 재현 기반 오폐리스트라트지 학습은 다목적 분자 생성에서 샘플 효율성을 어떻게 향상시키는가?
  • RQ3Pareto 프론트 품질과 후보 다양성 측면에서 HN-GFN은 기존의 확보 함수 최적화기보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ4스칼라화 함수의 선택(예: 가중합 대비 티비체프)은 비볼록 Pareto 프론트 영역에서 HN-GFN의 성능에 영향을 미치는가?
  • RQ5복잡한 다목적 설정에서 선호도 분포와 목표 난이도 수준의 변화에 대해 HN-GFN은 얼마나 강건한가?

주요 결과

  • HN-GFN은 도전적인 GSK3β+JNK3+QED+SA 벤치마크에서 히퍼볼륨(HV) 0.416 ± 0.023을 달성하여 MARS(0.304 ± 0.075)와 P-MOCO를 크게 능가한다.
  • GSK3β+JNK3 설정에서는 다양성 점수(Div) 0.810 ± 0.003, 더 복잡한 다목적 설정에서는 0.744 ± 0.008를 기록하여 후보 다양성 측면에서 뛰어난 성능을 보였다.
  • 후행 유사 오폐리스트라트지 전략은 HN-GFN 학습을 가속화하여 평균 상위 20개 보상치를 증가시켰으며, 일반화와 전문화 사이의 최적 균형을 이루기 위해 γ=0.2가 선택되었다.
  • 선호도 샘플링에 α=(3,4,2,1)의 딜리클레 분포를 사용할 경우, 특히 어려운 최적화 시나리오에서 균일한 α=(1,1,1,1)보다 더 뛰어난 성능을 보였다.
  • 실제로 가중합(WS) 스칼라화가 티비체프보다 우수한 성능을 보였으며, 이는 HN-GFN이 비연속성의 문제를 가진 티비체프 함수에도 비볼록 Pareto 프론트를 효과적으로 탐색할 수 있음을 시사한다.
Figure 2: Left : The distribution of Top-100 $\text{JNK}3$ scores. Right : The progression of the average Top-20 rewards over the course of training of the HN-GFN in optimizing $\text{GSK3}\beta$ and $\text{JNK}3$ .
Figure 2: Left : The distribution of Top-100 $\text{JNK}3$ scores. Right : The progression of the average Top-20 rewards over the course of training of the HN-GFN in optimizing $\text{GSK3}\beta$ and $\text{JNK}3$ .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.