[논문 리뷰] SemiRetro: Semi-template framework boosts deep retrosynthesis prediction
SemiRetro는 반복 가능한 반-템플릿 프레임워크를 제안하여 템플릿 기반의 정확성과 템플릿 프리의 확장성을 결합한다. 전체 반응 템플릿을 재사용 가능한 반-템플릿으로 분해하고, 중심 식별을 위한 유도적 관계 그래프 어텐션(DRGAT) 레이어와 반-템플릿 분류를 위한 자기 수정 모듈을 통합한다. 이는 150개의 반-템플릿으로 USPTO-50k 데이터의 98.9%를 커버하면서도, 정확성, 확장성, 학습 효율성 측면에서 템플릿 기반 및 템플릿 프리 방법을 모두 능가하는 최고 수준의 정확도(기존 클래스 기준 74.7%, 미지 클래스 기준 73.1%)를 달성한다.
Recently, template-based (TB) and template-free (TF) molecule graph learning methods have shown promising results to retrosynthesis. TB methods are more accurate using pre-encoded reaction templates, and TF methods are more scalable by decomposing retrosynthesis into subproblems, i.e., center identification and synthon completion. To combine both advantages of TB and TF, we suggest breaking a full-template into several semi-templates and embedding them into the two-step TF framework. Since many semi-templates are reduplicative, the template redundancy can be reduced while the essential chemical knowledge is still preserved to facilitate synthon completion. We call our method SemiRetro, introduce a new GNN layer (DRGAT) to enhance center identification, and propose a novel self-correcting module to improve semi-template classification. Experimental results show that SemiRetro significantly outperforms both existing TB and TF methods. In scalability, SemiRetro covers 98.9\% data using 150 semi-templates, while previous template-based GLN requires 11,647 templates to cover 93.3\% data. In top-1 accuracy, SemiRetro exceeds template-free G2G 4.8\% (class known) and 6.0\% (class unknown). Besides, SemiRetro has better training efficiency than existing methods.
연구 동기 및 목표
- 후보 반응 예측에서 템플릿 기반 방법의 정확성과 템플릿 프리 방법의 확장성 간의 상충 관계를 해결한다.
- 템플릿 중복을 줄이면서도 필수 화학 지식을 유지하여 더 나은 시노닉트 완성도 향상한다.
- 반-템플릿을 이중 단계의 템플릿 프리 프레임워크에 통합하여 모델의 해석 가능성과 학습 효율성을 향상시킨다.
- 새로운 신경 구성 요소인 DRGAT와 자기 수정 모듈을 통해 중심 식별 및 반-템플릿 분류를 향상시킨다.
- USPTO-50k 벤치마크에서 정확성과 확장성 양면에서 최고 성능을 달성한다.
제안 방법
- 전체 반응 템플릿을 더 단순하고 재사용 가능한 반-템플릿으로 분해하여 중복을 줄이고 화학 지식을 유지한다.
- 반-템플릿을 이중 단계의 템플릿 프리 프레임워크에 통합한다: 먼저 반응 중심을 식별하고(중심 식별), 그 다음 시노닉트를 완성한다(시노닉트 완성).
- 더 정확한 중심 식별을 위해 분자의 특징 표현을 향상시키기 위해 유도적 관계 그래프 어텐션 네트워크(DRGAT)를 제안한다.
- 학습 가능한 트랜스포머와 사전 분포 필터링을 결합한 자기 수정 모듈을 도입하여 반-템플릿 분류를 정밀하게 개선하고 예측 신뢰도를 향상시킨다.
- 중심 식별과 시노닉트 완성에서의 상위-k 예측을 조합한 확률 트리를 사용하여 종단 간 후보 반응 결과를 생성한다.
- 예측된 잔여물과 시노닉트에서 반응물 재구성하기 위해 잔여물 부착 알고리즘을 적용한다.
실험 결과
연구 질문
- RQ1반-템플릿 프레임워크는 후보 반응 예측에서 템플릿 기반 방법의 정확성과 템플릿 프리 방법의 확장성 간 균형을 효과적으로 달성할 수 있는가?
- RQ2반-템플릿를 통해 템플릿 중복을 줄임으로써 정확도를 유지하면서 데이터 커버리지와 모델 효율성을 얼마나 향상시킬 수 있는가?
- RQ3DRGAT과 자기 수정 모듈의 통합은 기존 방법에 비해 중심 식별 및 반-템플릿 분류를 얼마나 향상시키는가?
- RQ4제안된 프레임워크는 최고 수준의 모델과 비교해 기존 반응 유형과 미지 반응 유형 모두에서 일관된 성능 향상을 달성하는가?
- RQ5완전한 템플릿이나 순수하게 템플릿 프리 접근 방식 대비 반-템플릿을 사용할 경우 정확도, 학습 효율성, 해석 가능성 간의 상충 관계는 어떻게 나타나는가?
주요 결과
- SemiRetro는 단지 150개의 반-템플릿로 USPTO-50k 데이터셋의 98.9%를 커버하며, 템플릿 기반 모델인 GLN이 11,647개의 템플릿이 필요로 하는 93.3% 커버리지에 비해 뚜렷한 승리를 거둔다.
- 상위-1 정확도에서 SemiRetro는 기존 클래스 기준 74.7%, 미지 클래스 기준 73.1%를 기록하여, 템플릿 프리 모델인 G2G보다 각각 4.8%, 6.0% 높다.
- 자기 수정 모듈은 이를 제거한 아블레이트 모델 대비 상위-1 정확도를 3.2% 향상시켜 예측 신뢰도 향상에 핵심적인 역할을 한다는 것을 입증한다.
- SemiRetro는 G2G, RetroXpert, GLN보다 최소 6배 빠른 속도로 학습되며, 더 높은 정확도를 유지하면서도 뛰어난 학습 효율성을 보여준다.
- DRGAT 레이어는 비교 모델들 중에서 가장 높은 중심 식별 정확도를 달성하여 전체 성능 향상에 기여한다.
- SemiRetro는 G2G나 RetroXpert와 같은 순수 템플릿 프리 모델보다 반-템플릿를 통해 화학 전환 패턴을 명시적으로 인코딩함으로써 더 높은 해석 가능성을 확보한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.