Skip to main content
QUICK REVIEW

[논문 리뷰] xTrimoABFold: De novo Antibody Structure Prediction without MSA

Yining Wang, Xumeng Gong|arXiv (Cornell University)|2022. 11. 30.
Monoclonal and Polyclonal Antibodies Research인용 수 5
한 줄 요약

xTrimoABFold는 다중 서열 정렬(MSA)을 회피하기 위해 사전 훈련된 항체 언어 모델(ALM)과 효율적인 이보포머/구조 모듈을 활용하는 새로운 엔드 투 엔드 딥 러닝 모델을 제안한다. 이 모델은 AlphaFold2 및 기타 최신 기술 대비 RMSD에서 30% 이상 향상된 최고 수준의 정확도를 달성하면서도 151배 빠른 속도로 작동한다.

ABSTRACT

In the field of antibody engineering, an essential task is to design a novel antibody whose paratopes bind to a specific antigen with correct epitopes. Understanding antibody structure and its paratope can facilitate a mechanistic understanding of its function. Therefore, antibody structure prediction from its sequence alone has always been a highly valuable problem for de novo antibody design. AlphaFold2, a breakthrough in the field of structural biology, provides a solution to predict protein structure based on protein sequences and computationally expensive coevolutionary multiple sequence alignments (MSAs). However, the computational efficiency and undesirable prediction accuracy of antibodies, especially on the complementarity-determining regions (CDRs) of antibodies limit their applications in the industrially high-throughput drug design. To learn an informative representation of antibodies, we employed a deep antibody language model (ALM) on curated sequences from the observed antibody space database via a transformer model. We also developed a novel model named xTrimoABFold to predict antibody structure from antibody sequence based on the pretrained ALM as well as efficient evoformers and structural modules. The model was trained end-to-end on the antibody structures in PDB by minimizing the ensemble loss of domain-specific focal loss on CDR and the frame-aligned point loss. xTrimoABFold outperforms AlphaFold2 and other protein language model based SOTAs, e.g., OmegaFold, HelixFold-Single, and IgFold with a large significant margin (30+\% improvement on RMSD) while performing 151 times faster than AlphaFold2. To the best of our knowledge, xTrimoABFold achieved state-of-the-art antibody structure prediction. Its improvement in both accuracy and efficiency makes it a valuable tool for de novo antibody design and could make further improvements in immuno-theory.

연구 동기 및 목표

  • 약물 발견 분야에서 정확하고 고속의 신규 항체 구조 예측의 핵심적인 필요를 해결한다.
  • 특히 CDR 영역에서 성능이 떨어지는 MSA 기반 모델(예: AlphaFold2)의 한계를 극복한다.
  • 계산 비용이 큰 MSA 생성에 의존하지 않고도 높은 정확도를 달성하는 방법을 개발한다.
  • 항체-항원 결합에서 핵심적인 功能 영역인 CDR 루프에서 기존 모델이 성능을 발휘하지 못하는 문제를 개선한다.

제안 방법

  • 도메인 특화된 시퀀스 표현을 캡처하기 위해 관찰된 항체 공간(OAS) 데이터베이스를 기반으로 항체 전용 언어 모델(AntiBERTy)을 사전 훈련한다.
  • 사전 훈련된 ALM을 이보포머 및 구조 모듈과 통합하여 단일 시퀀스에서 엔드 투 엔드로 3차원 구조를 예측한다.
  • 시퀀스 유사성과 구조 유사성을 모두 활용해 고품질의 구조 템플릿을 검색하기 위한 다중 모odal 템플릿 검색 알고리즘을 설계한다.
  • 도메인 특화된 포인트 손실과 전체 구조에 대한 프레임 정렬된 포인트 손실을 조합한 하이브리드 손실을 최적화에 활용한다.
  • 두 단계 훈련 파이프라인을 활용: OAS에서 ALM을 사전 훈련하고, PDB 애너테이션 기반 항체 구조에서 전체 모델을 미세 조정한다.
  • 데이터 증강과 신뢰도 기반 마스킹을 활용한 앙상블 훈련을 통해 일반화 능력을 향상시키고 분산을 줄인다.

실험 결과

연구 질문

  • RQ1MSA 없이도 일반 단백질 언어 모델보다 특화된 항체 언어 모델이 항체 구조 예측에서 우월한 성능을 낼 수 있는가?
  • RQ2CDR 영역에 포인트 손실을 도입함으로써 도전적인 루프 구조에서의 예측 정확도가 크게 향상되는가?
  • RQ3시퀀스와 구조 유사성을 기반으로 한 효율적인 다중 모달 템플릿 검색이 구조 정확도와 수렴 속도를 향상시키는가?
  • RQ4제안된 방법이 MSA 기반 모델(예: AlphaFold2)에 비해 항체 예측에서 정확도와 추론 속도 면에서 어느 정도 뛰어나게 되는가?

주요 결과

  • xTrimoABFold는 국소 정렬 기준 CDR3-RMSD가 0.7439 ± 0.0003, 전역 정렬 기준 2.5934 ± 0.0211를 기록하여 AlphaFold2 및 기타 SOTA 모델 대비 RMSD에서 30% 이상 향상되었다.
  • 정확도를 유지하면서도 AlphaFold2 대비 151배 빠른 속도로 작동하여 고속 약물 설계에 적합하다.
  • 일반 PLM(예: ESM-2) 대비 특화된 항체 언어 모델(AntiBERTy) 사용으로 성능 향상이 뚜렷하게 관찰되어 도메인 특화 사전 훈련의 가치를 확인했다.
  • CDR 전용 포인트 손실 도입으로 예측 분산이 감소하고 CDR 루프에서 정확도가 향상되었으며, 추론 분석에서 RMSD가 최대 0.2–0.3 Å 감소했다.
  • 다중 모달 검색을 통한 템플릿 통합으로 성능이 추가로 향상되었으며, 평균 약 0.15 Å의 RMSD 감소 효과를 보였고, 특히 CDR 영역에서 두드러졌다.
  • xTrimoABFold는 MSA에 의존하지 않고도 항체 구조 예측에서 SOTA 성능을 달성한 최초의 모델로, 정확도와 효율성의 새로운 기준을 설정했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.