[논문 리뷰] CLIPZyme: Reaction-Conditioned Virtual Screening of Enzymes
CLIPZyme는 반응 표현과 효소 구조 간의 대조적 정렬을 학습하여 주어진 반응에 대해 효소 후보를 순위 매기며, EC 기반 선별을 능가하고 EC 예측기와 결합했을 때 결과를 개선합니다.
Computational screening of naturally occurring proteins has the potential to identify efficient catalysts among the hundreds of millions of sequences that remain uncharacterized. Current experimental methods remain time, cost and labor intensive, limiting the number of enzymes they can reasonably screen. In this work, we propose a computational framework for in-silico enzyme screening. Through a contrastive objective, we train CLIPZyme to encode and align representations of enzyme structures and reaction pairs. With no standard computational baseline, we compare CLIPZyme to existing EC (enzyme commission) predictors applied to virtual enzyme screening and show improved performance in scenarios where limited information on the reaction is available (BEDROC$_{85}$ of 44.69%). Additionally, we evaluate combining EC predictors with CLIPZyme and show its generalization capacity on both unseen reactions and protein clusters.
연구 동기 및 목표
- 자연적으로 발생하는 효소의 확장 가능한 인실리코 스크리닝을 통해 새로운 반응의 촉매를 식별한다.
- 반응 인코더와 단백질 인코더를 개발하여 CLIP 스타일 목적에 따라 정렬되어 예측 활성을 기준으로 효소를 순위를 매길 수 있도록 한다.
- EC 기반 예측기 대비 성능을 평가하고 부분 반응 정보 상황에서 평가한다.
- 테르펜 합성효소를 포함한 보지 않은 반응 및 단백질 클러스터에 일반화될 수 있는지 평가한다.
제안 방법
- 반응을 반응물-생성물 그래프와 원자-매핑 데이터를 사용하는 가상 전이상태 그래프를 결합해 인코딩하고, TS 그래프를 두 번째 DMPNN으로 인코딩해 반응 임베딩을 도출한다.
- 알파폴드(AlphaFold) 예측 구조로부터 E(n)-등변 그래프 신경망(EGNN)을 사용해 단백질 임베딩을 생성하고 ESM-2 시퀀스 임베딩으로 초기화한다.
- 정확한 반응-효소 쌍의 코사인 유사도를 최대화하고 음성(부정) 예에 대해 최소화하는 대조 학습 objective로 반응 인코더와 단백질 인코더를 학습한다.
- 반응과 반응의 임베딩 공간에서 효소를 공유 표현으로 나타내어 주어진 반응에 대한 효소의 Retrieval-스타일 순위를 가능하게 한다(가상 스크리닝).
- 원자 매핑 반응과 AlphaFold 구조를 포함하는 EnzymeMap 기반 데이터셋을 사용하며, 기준은 EC-prediction(CLEAN) 및 CLIPZyme와의 조합으로 개선된 순위를 포함한다.
- BEDROC(alpha=85) 및 강화 요소(EF)로 평가하고 다양한 반응 인코딩 및 단백질 표현 간의 차이를 비교한다.
실험 결과
연구 질문
- RQ1CLIPZyme가 반응 및 단백질 구조 임베딩을 사용하여 특정 반응에 대한 촉매 활성이 있는 효소를 효과적으로 순위 매길 수 있는가?
- RQ2구조 기반의 반응 표현 대 SMILES/CGR 표현 중 어떤 것이 가상 스크리닝 성능에 영향을 미치는가?
- RQ3EC 예측과 CLIPZyme를 결합하면 EC 정보 수준에 따라 스크리닝 성능이 향상되는가?
- RQ4CLIPZyme가 보지 않은 반응과 학습 세트와 다른 단백질에 얼마나 일반화되는가, 테르펜 합성효소 및 주석되지 않은 효소를 포함하여?
주요 결과
- CLIPZyme는 EnzymeMap 테스트 선별에서 BEDROC 85가 44.69%로 EC-예측 기반의 벤치마크를 능가한다.
- CLIPZyme를 CLEAN(EC 예측기)와 결합하면 EC 수준에 관계없이 검색 성능이 일관되게 향상된다(예: Level 1에서 소스 결합 시 BEDROC 85가 0.96%에서 57.03%로 증가).
- 가상전이상 기반의 반응 표현이 언어 기반 SMILES 표현보다 더 강한 성능(BEDROC 85 44.69%)을 보인다.
- 구조를 활용한 EGNN 기반 단백질 인코딩이 스크리닝 작업에서 시퀀스만(E-ESM-2) 기반 벤치마크보다 우수하다.
- 테르펜 합성효소 데이터셋은 강건한 성능(BEDROC 85 72.46%)을 보이고, 주석되지 않은 EnzymeMap 반응도 의미 있는 랭킹(BEDROC 85 42.94%)을 생성한다.
- 훈련 데이터와 매우 유사한 단백질을 제외하면 성능이 감소하지만, 상위 후보에 대한 랭킹 유용성은 여전히 유지된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.