Skip to main content
QUICK REVIEW

[논문 리뷰] Augmented Transformer Achieves 97% and 85% for Top5 Prediction of Direct and Classical Retro-Synthesis.

Igor V. Tetko, Pavel Karpov|arXiv (Cornell University)|2020. 03. 05.
Computational Drug Discovery Methods참고 문헌 33인용 수 9
한 줄 요약

이 논문은 입력 및 타겟 데이터에 SMILES 시퀀스 증강을 적용하여 데이터 기억 현상을 줄이고 일반화 능력을 향상시킨 증강된 Transformer 모델을 제안한다. 이 방법은 고전적 역합성 예측에서 가장 큰 조각을 예측할 때 USPTO-MIT 분리 세트에서 97%의 Top-5 정확도와 USPTO-50k 테스트 세트에서 85.4%의 정확도를 달성한다.

ABSTRACT

We investigated the effect of different augmentation scenarios on predicting (retro)synthesis of chemical compounds using SMILES representation. We showed that augmentation of not only input sequences but also, importantly, of the target data eliminated the effect of data memorization by neural networks and improved their generalization performance for prediction of new sequences. The Top-5 accuracy was 85.4% for the prediction of the largest fragment (thus identifying principal transformation for classical retro-synthesis) for USPTO-50k test dataset and was achieved by a combination of SMILES augmentation and beam search. The same approach also outperformed best published results for prediction of direct reactions from the USPTO-MIT test set. Our model achieved 90.4% Top-1 and 96.5% Top-5 accuracy for its most challenging mixed set and 97% Top-5 accuracy for the USPTO-MIT separated set. The appearance frequency of the most abundantly generated SMILES was well correlated with the prediction outcome and can be used as a measure of the quality of reaction prediction.

연구 동기 및 목표

  • 신경망에서 화학 반응 예측 시 데이터 기억 현상을 해결하기 위해.
  • 시퀀스 증강을 활용해 역합성 예측의 일반화 성능을 향상시키기 위해.
  • 고전적 역합성에서 주요 전환을 식별하는 데 있어 Top-5 정확도를 향상시키기 위해.
  • 입력 및 타겟 데이터 증강이 모델 일반화에 미치는 영향을 평가하기 위해.
  • 모델의 해석 가능성과 관련해 SMILES 생성 빈도와 예측 품질 간의 상관관계를 분석하기 위해.

제안 방법

  • 데이터 기억 효과를 줄이기 위해 입력 및 타겟 시퀀스 양쪽에 SMILES 시퀀스 증강을 적용하기 위해.
  • 예측 다양성과 정확도를 향상시키기 위해 추론 중에 범용 검색(beam search)을 사용하기 위해.
  • 증강된 데이터를 기반으로 Transformer 기반 모델을 훈련시어 일반화 능력을 향상시키기 위해.
  • 기준 데이터셋에서 Top-1 및 Top-5 정확도를 측정하여 예측 품질을 평가하기 위해.
  • 예측 신뢰도의 지표로 가장 자주 생성된 SMILES의 빈도를 분석하기 위해.
  • USPTO-50k 및 USPTO-MIT 테스트 세트에서 성능을 평가하며, 혼합 및 분리된 반응 세트를 포함하기 위해.

실험 결과

연구 질문

  • RQ1입력 및 타겟 시퀀스 양쪽을 증강하면 역합성 예측의 일반화 성능이 향상되는가?
  • RQ2데이터 증강이 화학 반응 예측에서 신경망의 기억 현상을 줄일 수 있는가?
  • RQ3SMILES 증강이 고전적 역합성에서 가장 큰 조각을 식별하는 데 있어 Top-5 정확도에 어떤 영향을 미치는가?
  • RQ4범용 검색과 데이터 증강이 결합될 때 예측 성능 향상에 어떻게 기여하는가?
  • RQ5생성된 SMILES의 빈도는 예측 품질을 신뢰할 만한 지표로 사용될 수 있는가?

주요 결과

  • 모델은 직접 반응 예측에 대해 USPTO-MIT 분리 테스트 세트에서 97%의 Top-5 정확도를 달성했다.
  • USPTO-50k 테스트 세트에서는 가장 큰 조각을 예측할 때 85.4%의 Top-5 정확도를 기록하여 주요 전환을 식별하는 데 성공했다.
  • 모델은 USPTO-MIT 테스트 세트에서 이전에 발표된 결과를 초월하여 가장 과제가 까다로운 혼합 세트에서 Top-1 정확도 90.4% 및 Top-5 정확도 96.5%를 달성했다.
  • 가장 자주 생성된 SMILES의 출현 빈도는 정확한 예측 결과와 강하게 상관관계가 있었다.
  • 입력 및 타겟 시퀀스의 동시 증강은 기억 현상을 크게 줄이고 모델의 일반화 능력을 향상시켰다.
  • SMILES 증강과 범용 검색의 조합이 다양한 기준 데이터셋에서 최신 기술 수준의 성능을 달성하는 데 핵심이 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.