[논문 리뷰] It Takes Two to Tango: Directly Optimizing for Constrained Synthesizability in Generative Molecular Design
이 논문은 화학 원리에 기반한 TANGO라는 새로운 밀도 보상 함수를 소개하며, 제약 조건이 있는 합성 가능성에 직접 최적화되는 생성 분자 모델을 강화 학습을 통해 개선한다. 이는 특정 상업용 구조 블록을 강제로 포함시키면서 다중 매개변수 최적화 목표를 충족하는 분자를 생성할 수 있도록 한다. 이는 다중 매개변수 최적화 목표를 충족하면서도 특정 상업용 구조 블록을 강제로 포함시키는 최초의 프레임워크로, 시작 물질, 중간체, 분기 합성 제약 조건 모두에서 최신 기술 수준의 성능을 보여주었다.
Constrained synthesizability is an unaddressed challenge in generative molecular design. In particular, designing molecules satisfying multi-parameter optimization objectives, while simultaneously being synthesizable and enforcing the presence of specific commercial building blocks in the synthesis. This is practically important for molecule re-purposing, sustainability, and efficiency. In this work, we propose a novel reward function called TANimoto Group Overlap (TANGO), which uses chemistry principles to transform a sparse reward function into a dense and learnable reward function -- crucial for reinforcement learning. TANGO can augment general-purpose molecular generative models to directly optimize for constrained synthesizability while simultaneously optimizing for other properties relevant to drug discovery using reinforcement learning. Our framework is general and addresses starting-material, intermediate, and divergent synthesis constraints. Contrary to most existing works in the field, we show that incentivizing a general-purpose (without any inductive biases) model is a productive approach to navigating challenging optimization scenarios. We demonstrate this by showing that the trained models explicitly learn a desirable distribution. Our framework is the first generative approach to tackle constrained synthesizability.
연구 동기 및 목표
- 시작 물질, 중간체, 분기 합성 제약 조건을 포함한 제약 조건이 있는 합성 가능성에 직접 최적화하는 생성 분자 모델을 해결하는 데 있어 해결되지 않은 도전 과제를 다루기 위해.
- 희박한 보상에서 행동 가능한 신호로 전환할 수 있는 밀도 높고 학습 가능한 보상 함수를 개발하기 위해.
- 특정 약물 발견 관련 성질을 최적화하면서도 유도적 편향 없이 일반 목적의 생성 모델이 합성 가능한 분자 분포를 학습할 수 있도록 하기 위해.
- 특정 아키텍처 제약 조건을 부여하는 것보다 일반 목적의 모델을 인cent라이징하는 것이 복잡한 다중 목표 분자 설계 문제를 해결하는 데 효과적인 접근임을 보여주기 위해.
- 프레임워크가 높은 도킹 점수와 높은 QED 값을 가진 분자를 생성하면서도 합성 경로에서 강제로 포함된 빌딩 블록을 확보할 수 있음을 보여주기 위해.
제안 방법
- 생성된 분자의 기능기능기능 그룹과 강제로 포함된 빌딩 블록의 기능기능기능 그룹 간의 겹침을 수량화하는 화학에 기반한 밀도 보상 함수인 TANimoto 그룹 오버랩(TANGO)을 제안한다.
- 합성 가능성을 평가하고 보상 함수를 안내하기 위해 리트로합성 모델을 오라클로 사용하며, 생성된 분자가 합성 가능하도록 보장한다.
- 다양한 분자 성질(예: 도킹 점수, QED)과 합성 가능성을 동시에 최적화하는 강화 학습 프레임워크에 TANGO를 통합한다.
- 시작 물질, 중간체, 분기 합성에 이르기까지 다양한 합성 제약 조건을 적용하고, 강제로 포함된 빌딩 블록을 포함한다.
- 유도적 편향이 없는 일반 목적의 생성 모델을 사용하고, 아키텍처 제약 조건이 아닌 보상 형상화를 통해 합성 가능성을 학습하도록 한다.
- 10개의 랜덤 시드를 기반으로 다양한 구성(예: 오라클 예산과 QED 강제 조건의 변화)을 사용하여 접근 방식을 검증한다.

실험 결과
연구 질문
- RQ1유도적 편향이 없는 일반 목적의 생성 모델이 아키텍처 제약 없이도 합성 가능한 분자 분포를 효과적으로 학습시킬 수 있는가?
- RQ2TANGO와 같은 밀도 높고 화학에 기반한 보상 함수가 강화 학습을 통해 다중 매개변수 최적화를 충족하고 특정 빌딩 블록을 강제로 포함하는 분자를 효과적으로 이끌 수 있는가?
- RQ3단일 훈련 제약 조건 내에서 약물 발견 관련 성질(예: 도킹 점수, QED)과 제약 조건이 있는 합성 가능성을 동시에 최적화할 수 있는가?
- RQ4다양한 종류의 합성 제약 조건—시작 물질, 중간체, 분기 합성—에 따라 프레임워크의 성능은 어떻게 달라지는가?
- RQ5오라클 예산을 늘리면 강제로 포함된 빌딩 블록을 가진 분자를 생성하는 데 성공률이 향상되는가? 그리고 이는 실질적으로 확장 가능한가?
주요 결과
- TANGO 프레임워크는 시작 물질, 중간체, 분기 합성 제약 조건을 포함한 모든 테스트 구성에서 강제로 포함된 빌딩 블록을 가진 분자를 성공적으로 생성했으며, 10개의 시드 중 4개에서 10,000개의 오라클 예산 내에서 최소한 하나의 유효한 분자를 확보했다.
- 15,000개의 오라클 예산을 사용한 결과, 분기 블록의 성공률이 10개의 시드 중 5개로 상승하여, 컴퓨팅 자원을 늘일수록 성능 향상이 이루어짐을 입증했다.
- 10,000개의 오라클 예산 하에서 강제로 포함된 블록을 가진 분자의 평균 도킹 점수는 -8.48 ± 0.25 (M=2694)였으며, 높은 결합 친화력 잠재력을 나타낸다.
- 도킹 점수 최고 구간(DS < -10)에 속한 분자의 평균 QED 값은 0.84 ± 0.10이었으며, 이는 높은 약물 유사성임을 나타낸다.
- QED 강제 조건이 없을 경우 성공률은 10개의 시드 중 3개로 떨어졌지만, 15,000개의 오라클 예산을 사용하면 10개의 시드 중 4개로 상승하여 QED는 유용하지만 필수적인 제약 조건은 아님을 보여주었다.
- 10,000개의 오라클 예산 하에서 성공적으로 생성된 분자의 평균 반응 단계 수는 3.68 ± 1.08였으며, 실현 가능한 합성 경로임을 나타낸다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.