[논문 리뷰] Retrieval-Enhanced Mutation Mastery: Augmenting Zero-Shot Prediction of Protein Language Model
이 논문은 단일 서열, 국소 구조, 진화적 정보를 분리된 교차 attention 및 동원 서열 검색을 통해 통합함으로써 제로샷 돌연변이 효과 예측 성능을 향상시키는 리트리ieval 강화형 단백질 언어 모델인 ProtREM을 제안한다. 이 모델은 ProteinGym에서 217개의 실험, 200만 개 이상의 돌연변이에 대해 최신 기술 수준의 성능을 달성하였으며, 향상된 DNA 중합효소 및 VHH 항체 돌연변이에 대한 시뮬레이션 및 실험실 검증을 성공적으로 수행하였다.
Enzyme engineering enables the modification of wild-type proteins to meet industrial and research demands by enhancing catalytic activity, stability, binding affinities, and other properties. The emergence of deep learning methods for protein modeling has demonstrated superior results at lower costs compared to traditional approaches such as directed evolution and rational design. In mutation effect prediction, the key to pre-training deep learning models lies in accurately interpreting the complex relationships among protein sequence, structure, and function. This study introduces a retrieval-enhanced protein language model for comprehensive analysis of native properties from sequence and local structural interactions, as well as evolutionary properties from retrieved homologous sequences. The state-of-the-art performance of the proposed ProtREM is validated on over 2 million mutants across 217 assays from an open benchmark (ProteinGym). We also conducted post-hoc analyses of the model's ability to improve the stability and binding affinity of a VHH antibody. Additionally, we designed 10 new mutants on a DNA polymerase and conducted wet-lab experiments to evaluate their enhanced activity at higher temperatures. Both in silico and experimental evaluations confirmed that our method provides reliable predictions of mutation effects, offering an auxiliary tool for biologists aiming to evolve existing enzymes. The implementation is publicly available at https://github.com/tyang816/ProtREM.
연구 동기 및 목표
- 기존 단백질 언어 모델이 돌연변이 효과 예측을 위해 서열, 구조, 진화적 정보를 동시에 통합하지 못하는 격차를 메운다.
- 저처리량 실험 환경에서 단일 및 다중 위치 돌연변이에 대한 제로샷 예측의 신뢰도를 향상시킨다.
- 검색된 동원 서열을 활용하여 진화적 표현을 강화하고 예측된 3D 구조의 정확도 부족을 보완하는 통합 프레임워크를 개발한다.
- 고처리량 벤치마크 평가와 기능 효소에 대한 대상 지향적 실험실 실험을 통해 모델의 예측 능력을 검증한다.
- 생물학자들이 최소한의 실험 비용으로 功能 향상된 단백질 변종을 설계할 수 있도록 공개 도구를 제공한다.
제안 방법
- ProtREM은 단백질 서열과 국소 3D 구조적 특징을 서열 토큰과 구조 토큰으로 인코딩하며, 국소 구조는 2048개의 고유한 구조 토큰으로 군집화된다.
- 분리된 다중 헤드 교차 attention 레이어는 BERT 스타일의 사전 훈련 프레임워크에서 서열 및 구조 표현을 통합한다.
- 동원 서열은 Jackhmmer를 통해 검색되며, 정렬 기반 토크나이제이션을 통해 진화적 로짓으로 변환된다.
- 모델은 구조적, 서열적, 진화적 표현을 융합하여 각 잔기 돌연변이의 적합도 점수를 생성한다.
- 사전 훈련은 전체 단백질 서열에 대해 마스킹 언어 모델링 목표를 사용하며, 서열, 구조, 진화 신호를 동시에 최적화한다.
- 모델는 ProteinGym의 고처리량 DMS 데이터로 파인튜닝되며, 벤치마크 및 저처리량 실험 데이터셋에서 평가된다.
실험 결과
연구 질문
- RQ1대규모 DMS 데이터를 활용하여 다양한 단백질과 실험에서 ProtREM이 기존 모델을 일관되게 능가하는가?
- RQ2정확한 기능 측정이 가능한 저처리량 실험 환경에서 ProtREM의 일반화 능력은 얼마나 높은가?
- RQ3실제 효소 공학 응용에서 ProtREM이 기능 향상된 돌연변이를 설계하는 데 얼마나 효과적인가?
- RQ4예측된 3D 구조에 의존하는 모델과 비교해 검색된 동원 서열의 통합이 예측 신뢰도 향상에 얼마나 기여하는가?
- RQ5ProtREM은 열안정성 또는 활성 향상이 입증된 새로운 고성능 돌연변이를 식별할 수 있는가?
주요 결과
- ProtREM은 ProteinGym 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 217개의 실험과 200만 개 이상의 돌연변이에서 기존 방법을 초월하는 스피어만 상관계수(ρ)를 기록하였다.
- 저처리량 실험 데이터에서 더 높은 예측 신뢰도를 보였으며, 안정성과 결합 친화도 향상이 입증된 VHH 항체의 유익한 돌연변이를 성공적으로 식별하였다.
- phi29 DNA 중합효소에서 설계한 10개의 돌연변이에 대한 실험실 검증 결과, 열역학적 안정성(Tm 값)이 증가하여 열안정성이 향상된 것이 확인되었다.
- 검색된 동원 서열의 통합은 진화적 표현을 향상시켜 예측된 3D 구조의 정확도 부족에 대한 의존도를 감소시켰다.
- 후행 분석 결과 ProtREM은 보존된, 돌연변이가 불가능한 영역을 효과적으로 식별하고 기능적으로 중요한 돌연변이를 우선순위로 선정함을 보였다.
- 구현 코드는 https://github.com/tyang816/ProtREM 에 공개되어 있어 재현성과 공동 연구 활용이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.