Skip to main content
QUICK REVIEW

[논문 리뷰] RetCL: A Selection-based Approach for Retrosynthesis via Contrastive Learning

Hankook Lee, Sung Soo Ahn|arXiv (Cornell University)|2021. 05. 03.
Machine Learning in Materials Science참고 문헌 36인용 수 7
한 줄 요약

이 논문은 그래프 신경망과 하드 음성 마이닝을 활용한 대조 학습을 사용하여 대량의 후보 집합에서 상용으로 구할 수 있는 반응물을 선택하는 선택 기반 역합성 프레임워크인 RetCL을 제안한다. RetCL은 USPTO-50k에서 71.3%의 상위-1 정확한 매칭 정확도를 달성하여 이전 방법들을 뛰어넘으며, 예측할 수 없는 반응 템플릿으로의 일반화 능력도 효과적으로 확보한다.

ABSTRACT

Retrosynthesis, of which the goal is to find a set of reactants for synthesizing a target product, is an emerging research area of deep learning. While the existing approaches have shown promising results, they currently lack the ability to consider availability (e.g., stability or purchasability) of the reactants or generalize to unseen reaction templates (i.e., chemical reaction rules). In this paper, we propose a new approach that mitigates the issues by reformulating retrosynthesis into a selection problem of reactants from a candidate set of commercially available molecules. To this end, we design an efficient reactant selection framework, named RetCL (retrosynthesis via contrastive learning), for enumerating all of the candidate molecules based on selection scores computed by graph neural networks. For learning the score functions, we also propose a novel contrastive training scheme with hard negative mining. Extensive experiments demonstrate the benefits of the proposed selection-based approach. For example, when all 671k reactants in the USPTO {database} are given as candidates, our RetCL achieves top-1 exact match accuracy of $71.3\%$ for the USPTO-50k benchmark, while a recent transformer-based approach achieves $59.6\%$. We also demonstrate that RetCL generalizes well to unseen templates in various settings in contrast to template-based approaches.

연구 동기 및 목표

  • 기존의 역합성 모델이 반응물의 가용성 고려 및 예측할 수 없는 반응 템플릿으로의 일반화 능력에 한계를 보이는 문제를 해결한다.
  • 실제 적용 가능성을 확보하기 위해 사전 정의된 상용 분자 집합에서의 선택 문제로 역합성을 재정의한다.
  • 템플릿 기반 및 템플릿 프리 기반 기준보다 성능과 강건성을 향상시키는 확장 가능한 일반화 프레임워크를 개발한다.
  • 각 단계에서 실현 가능하고 가용한 반응물을 추천함으로써 다단계 역합성 계획에 효과적으로 통합할 수 있도록 한다.
  • 새로운 하드 음성 마이닝 전략을 통해 대규모 후보 집합에 대한 대조 학습의 확장성 문제를 해결한다.

제안 방법

  • 목표 분자를 고려하여, 사전에 정해진 대규모 상용 분자 집합에서 반응물을 선택하는 선택 작업으로 역합성을 재정의한다.
  • 제품 및 후보 반응물의 분자 임베딩을 계산하기 위해 그래프 신경망(GNNs)을 사용한다.
  • 제품과 반응물의 임베딩 간 코사인 유사도를 통해 선택 점수를 계산하여 후보를 순위 매긴다.
  • 양성(정확한) 반응물-제품 쌍을 가까이 오게 하고 음성 쌍을 멀리 떼는 대조 학습 목적 함수를 사용해 점수 함수를 학습한다.
  • 어려운 음성 예제에 집중함으로써 학습 효율성과 모델의 분류 능력을 향상시키기 위해 하드 음성 마이닝을 통합한다.
  • 최대 671,518개의 후보 반응물을 효율적으로 처리할 수 있는 확장 가능한 학습 파이프라인을 설계하여 USPTO와 같은 대규모 데이터셋에의 구현을 가능하게 한다.

실험 결과

연구 질문

  • RQ1선택 기반의 역합성 접근 방식이 반응물의 가용성을 보장함으로써 정확도와 실용성을 향상시킬 수 있는가?
  • RQ2하드 음성 마이닝을 통한 대조 학습은 예측할 수 없는 반응 템플릿으로의 일반화 능력을 어떻게 향상시키는가?
  • RQ3작은 후보 집합에서 훈련된 모델이 훨씬 더 큰 테스트 후보 집합으로 일반화되는 정도는 어느 정도인가?
  • RQ4제안된 프레임워크가 템플릿 프리 생성 모델과 결합되었을 때 다단계 역합성 계획을 어떻게 향상시킬 수 있는가?
  • RQ5기존의 선택 기반 및 생성 기반 접근 방식과 비교해 RetCL의 성능과 추론 속도는 어떠한가?

주요 결과

  • RetCL은 USPTO-50k 벤치마크에서 71.3%의 상위-1 정확한 매칭 정확도를 달성하여 최근의 트랜스포머 기반 방법(59.6%)과 강력한 기준(Chen 등, 2019)보다 11.7% 높다.
  • 예측할 수 없는 반응 템플릿으로의 일반화 능력이 뛰어나 USPTO-full 데이터셋에서 39.9%의 정확도를 기록하였으며, 이는 최신의 템플릿 기반 방법(26.7%)보다 뚜렷이 높다.
  • USPTO-50k에서 유래한 작은 후보 집합(91,297개 분자)에서 훈련된 RetCL도 매우 큰 테스트 후보 집합(671,518개 분자)으로의 일반화가 효과적으로 이루어져 분포 이탈에 대한 강건성을 입증한다.
  • 다단계 역합성에서 RetCL은 템플릿 프리 트랜스포머 모델의 성공률을 91.05%에서 96.84%로 향상시켜 매 단계에서 고급도의 가용 반응물을 제공함으로써 성능을 향상시켰다.
  • RetCL은 추론당 1초 미만으로 결과를 도출하여 Bayesian-Retro가 단일 예측을 위해 약 6시간(6×10⁵개의 전방 평가)이 소요되는 것과 비교해 훨씬 뛰어난 속도를 확보한다.
  • 제거 실험을 통해 대조 학습과 하드 음성 마이닝이 대규모 후보 환경에서 성능 향상에 핵심적인 역할을 한다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.