Skip to main content
QUICK REVIEW

[논문 리뷰] Data Transfer Approaches to Improve Seq-to-Seq Retrosynthesis

Katsuhiko Ishiguro, Kazuya Ujihara|arXiv (Cornell University)|2020. 10. 02.
Machine Learning in Materials Science참고 문헌 39인용 수 4
한 줄 요약

이 논문은 시퀀스-투-시퀀스 역합성 모델의 성능을 향상시키기 위해 데이터 전이 기법—특히 사전 훈련 후 미세조정, 동시 훈련, 자기 훈련—을 조사한다. USPTO-50K 데이터셋을 사용하여, 더 크고 청소된 데이터셋에서의 사전 훈련이 테스트 정확도를 크게 향상시킴을 보여주며, n=10 및 n=20에서 최신 기술 수준(SotA) 성능을 달성한다. 잘못된 경우에도 상위 1개 예측의 99% 이상이 화학적으로 타당한 것으로 나타났다.

ABSTRACT

Retrosynthesis is a problem to infer reactant compounds to synthesize a given product compound through chemical reactions. Recent studies on retrosynthesis focus on proposing more sophisticated prediction models, but the dataset to feed the models also plays an essential role in achieving the best generalizing models. Generally, a dataset that is best suited for a specific task tends to be small. In such a case, it is the standard solution to transfer knowledge from a large or clean dataset in the same domain. In this paper, we conduct a systematic and intensive examination of data transfer approaches on end-to-end generative models, in application to retrosynthesis. Experimental results show that typical data transfer methods can improve test prediction scores of an off-the-shelf Transformer baseline model. Especially, the pre-training plus fine-tuning approach boosts the accuracy scores of the baseline, achieving the new state-of-the-art. In addition, we conduct a manual inspection for the erroneous prediction results. The inspection shows that the pre-training plus fine-tuning models can generate chemically appropriate or sensible proposals in almost all cases.

연구 동기 및 목표

  • 엔드 투 엔드 시퀀스-투-시퀀스 역합성 모델의 성능을 향상시키기 위해 데이터 전이 방법이 효과적인지 조사하는 것.
  • 작고 노이즈가 많은 역합성 데이터셋에서 표준 데이터 전이 접근법—사전 훈련 후 미세조정, 동시 훈련, 자기 훈련—의 효과를 평가하는 것.
  • 수작업 검토를 통해 모델 예측의 화학적 타당성과 실용적 유용성을 평가하는 것.
  • 더 크고 품질이 높은 데이터셋에서의 지식 전이가 목표 역합성 작업에서 일반화 능력과 정확도를 향상시킬 수 있는지 확인하는 것.

제안 방법

  • 저자들은 세 가지 데이터 전이 방법을 적용한다: 대규모 청소된 데이터셋(USPTO-Full)에서 사전 훈련한 후, 목표 데이터셋(USPTO-50K)에서 미세조정; 두 데이터셋을 동시에 사용하는 동시 훈련; 그리고 목표 모델의 가짜 레이블을 활용한 자기 훈련.
  • 기본 모델은 SMILES 형식의 반응 데이터로 훈련된 오프더셰프 Transformer 아키텍처이며, 역합성을 기계 번역 문제로 간주한다.
  • 사전 훈련 단계에서는 전체 USPTO-Full 데이터셋을 사용해 일반 반응 패턴을 학습하고, 이후 더 작은 USPTO-50K 데이터셋에서 미세조정을 통해 작업 특화 분포에 적응시킨다.
  • 모델 성능은 n=1, 3, 5, 10, 20, 50에서의 n-best 정확도를 사용해 평가되며, 기존 최신 기술 수준 모델과의 결과를 비교한다.
  • 오류 예측의 수작업 검토를 통해 생성된 반응물 조합의 화학적 타당성을 평가한다.
  • 추가로, 데이터 증강 크기와 훈련 동역학의 영향을 분석하기 위한 아블레이션 스터디를 수행하며, 1-best와 n-best 정확도 곡선의 차이를 고려한다.

실험 결과

연구 질문

  • RQ1작거나 노이즈가 많은 데이터셋에서 데이터 전이 기법이 시퀀스-투-시퀀스 역합성 모델의 성능을 향상시킬 수 있는가?
  • RQ2사전 훈련 후 미세조정, 동시 훈련, 자기 훈련 중 어느 방법이 예측 정확도 향상에 가장 높은 기여를 하는가?
  • RQ3전이된 모델이 잘못된 경우에도 얼마나 많은 비율로 화학적으로 타당한 반응물 제안을 하는가?
  • RQ4증강 데이터셋의 크기가 전이된 모델의 일반화 성능에 어떤 영향을 미치는가?
  • RQ5전이 방법이 어려운 반응 유형—특히 결합/고리 형성 반응—을 포함한 주요 반응 유형 전반에서 예측 정확도를 향상시키는가?

주요 결과

  • 사전 훈련 후 미세조정 기법이 USPTO-50K 데이터셋에서 최신 기술 수준 성능을 달성하며, n=10 및 n=20에서 각각 87.4%와 89.6%의 n-best 정확도로 이전 모델을 초월한다.
  • 모델은 1-best 정확도 57.4%를 기록하여 베이스라인 Transformer 모델보다 유의미하게 향상되었으며, 여러 이전 최신 기술 수준 모델을 뛰어넘었다.
  • 수작업 검토 결과, 상위 1개 예측의 99% 이상이 잘못된 경우에도 화학적으로 타당하거나 타당한 것으로 확인되었다.
  • 사전 훈련 후 미세조정 접근법은 모든 10개 주요 반응 유형에서 클래스별 정확도를 향상시켰으며, 특히 어려운 결합 및 고리 형성 반응의 예측을 크게 향상시켰다.
  • 1-best 및 n-best 정확도 곡선은 훈련 중에 다르게 변화하는 경향을 보였으며, 특히 단일 훈련 베이스라인에서 두드러져, 훈련 모니터링 전략의 재평가가 필요함을 시사한다.
  • USPTO-Full 데이터셋은 USPTO-50K로 전이 가능하며, 이는 소규모 또는 편향된 데이터셋에 대해 데이터 전이 기법의 광범위한 적용 잠재력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.