[논문 리뷰] Assessing the Extrapolation Capability of Template-Free Retrosynthesis Models
이 연구는 USPTO-480k에서 유래한 다양성 있는 외부 분포(OOD) 반응 데이터셋을 구축하여, 템플릿 기반 반응 합성 모델의 외삽 능력을 평가한다. 결과적으로 이러한 모델은 새로운 반응 템플릿을 생성할 수는 있으나, OOD 반응에서의 상위 10개 정확도는 1% 미만이며, 예측한 새로운 반응의 절반 이상이 화학적으로 비합리적임을 드러냈다. 연구 결과는 향후 모델 설계에 화학적 타당성을 통합하여 미지의 반응 공간을 신뢰성 있게 탐색할 수 있도록 해야 한다고 주장한다.
Despite the acknowledged capability of template-free models in exploring unseen reaction spaces compared to template-based models for retrosynthesis prediction, their ability to venture beyond established boundaries remains relatively uncharted. In this study, we empirically assess the extrapolation capability of state-of-the-art template-free models by meticulously assembling an extensive set of out-of-distribution (OOD) reactions. Our findings demonstrate that while template-free models exhibit potential in predicting precursors with novel synthesis rules, their top-10 exact-match accuracy in OOD reactions is strikingly modest (< 1%). Furthermore, despite the capability of generating novel reactions, our investigation highlights a recurring issue where more than half of the novel reactions predicted by template-free models are chemically implausible. Consequently, we advocate for the future development of template-free models that integrate considerations of chemical feasibility when navigating unexplored regions of reaction space.
연구 동기 및 목표
- 템플릿 기반 반응 합성 모델이 훈련 데이터의 분포 외부에 있는 반응을 정확하게 예측할 수 있는지 평가하는 것.
- 외부 분포 설정에서 템플릿 기반 모델이 생성한 반응 템플릿의 신규성과 화학적 타당성을 조사하는 것.
- 이러한 모델이 알려진 반응 템플릿을 초월하여 실제로 새로운 타당한 합성 경로를 발견할 수 있는 정도를 평가하는 것.
- 현재 템플릿 기반 모델이 새로운 반응 공간에서 화학적으로 타당한 새로운 반응을 생성하는 데에 있어 가지는 한계를 규명하는 것.
제안 방법
- USPTO-50k 훈련 세트와 어떤 일반화된 반응 템플릿(GRT)도 공유하지 않는 반응을 USPTO-480k 테스트 세트에서 추출하여 외부 분포(OOD) 반응 데이터셋을 정제했다.
- GRT를 사용하여 훈련 데이터의 반응 템플릿 분포를 표현하고, 템플릿 유사도가 낮은 반응을 OOD 반응으로 식별했다.
- 상위 10개 예측 정확도 및 왕복 정확도 지표를 사용하여, 상위 3개의 최신 템플릿 기반 모델(Transformer, Retroformer, Chemformer)을 내부 분포(ID) 및 OOD 반응에서 평가했다.
- ID 및 OOD 세트에서 상위 10개 예측의 유효성, 유일성, 신규성을 분석하여 외삽 행동을 평가했다.
- 모델이 생성한 새로운 반응 템플릿의 질적 분석을 통해 화학적 타당성을 평가하였으며, 특히 이국적인 기능기 변환 또는 탈리브 기능기 패턴에 초점을 맞췄다.
- 모델의 OOD 반응 성능을 알려진 반응 규칙과 비교하여, 훈련 분포를 초월해 일반화할 수 있는지 평가했다.

실험 결과
연구 질문
- RQ1템플릿 기반 반응 합성 모델은 훈련 중에 본 바 없는 새로운 반응 템플릿을 사용하는 반응의 합성 경로를 정확하게 예측할 수 있는가?
- RQ2템플릿 기반 모델의 상위 10개 예측 정확도는 내부 분포(ID) 반응과 외부 분포(OOD) 반응 간에 어떻게 비교되는가?
- RQ3템플릿 기반 모델이 생성한 새로운 반응 템플릿의 화학적 타당성은 어느 정도인가?
- RQ4템플릿 기반 모델은 OOD 타겟에 대해 ID 타겟보다 더 많은 유일하고 새로운 반응을 생성하는가? 이는 외부 분포로의 외삽을 尝시는가?
- RQ5외부 분포 설정에서 템플릿 기반 모델이 흔히 생성하는 화학적으로 비합리적인 반응 패턴은 무엇인가?
주요 결과
- 모든 테스트된 템플릿 기반 모델의 외부 분포(OOD) 반응에서 상위 10개 정확도는 1% 미만으로, 알려진 새로운 경로를 재현할 능력이 매우 제한됨을 시사한다.
- 템플릿 기반 모델이 OOD 반응에서 예측한 새로운 반응의 50% 이상이 화학적으로 비합리적이며, 일반적인 문제로는 떠나는 기능기로 핵형물이 사용되거나 C–N 단일 결합이 직접 잘리는 경우가 포함된다.
- 정확도가 낮음에도 불구하고, 템플릿 기반 모델은 ID 타겟보다 OOD 타겟에서 더 많은 유일하고 새로운 반응을 생성하며, 훈련 분포를 초월해 외삽하려는 시도를 하고 있음을 시사한다.
- Chemformer는 ID 반응에서 최고의 유효성(98.6%)을 기록했지만, 유일성(15.6%)과 신규성(1.4%)은 가장 낮아 공통 패tern에 과적합된 것으로 나타났다.
- Retroformer와 Transformer는 Chemformer보다 더 많은 새로운 템플릿을 생성했지만, OOD 예측 정확도는 비례적으로 향상되지 않아, 실제로 새로운 경우에 대한 일반화 능력이 떨어지는 것으로 나타났다.
- 최고 성능을 보인 모델(Retroformer)의 OOD 반응에서의 왕복 정확도는 단 4.8%에 불과하여, 예측된 기초 물질에서 타당한 반응 경로를 재구성하는 데 있어 신뢰성이 매우 낮음을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.