Skip to main content
QUICK REVIEW

[논문 리뷰] Inverse folding for antibody sequence design using deep learning

Frédéric A. Dreyer, Daniel Cutting|arXiv (Cornell University)|2023. 10. 30.
Monoclonal and Polyclonal Antibodies Research인용 수 19
한 줄 요약

저자들은 ProteinMPNN을 미세 조정하여 AbMPNN을 생성합니다. 이는 항체 특이적 역접힘 모델로, SAbDab 및 OAS 유래 데이터로 학습하고 구조 예측 및 Rosetta 인터페이스 에너지로 평가함으로써 CDR-H3를 특히 중심으로 시퀀스 회복성과 설계 가능성을 향상시킵니다.

ABSTRACT

We consider the problem of antibody sequence design given 3D structural information. Building on previous work, we propose a fine-tuned inverse folding model that is specifically optimised for antibody structures and outperforms generic protein models on sequence recovery and structure robustness when applied on antibodies, with notable improvement on the hypervariable CDR-H3 loop. We study the canonical conformations of complementarity-determining regions and find improved encoding of these loops into known clusters. Finally, we consider the applications of our model to drug discovery and binder design and evaluate the quality of proposed sequences using physics-based methods.

연구 동기 및 목표

  • 3D 백본 구조로부터의 항체 서열 설계에 대한 동기 부여 및 해결 방안 제시.
  • 항체 데이터로 ProteinMPNN을 미세 조정하여 항체 특이적 역접힘 모델을 개발합니다.
  • 항체의 잔기 회복, 설계 가능성 및 인터페이스 안정성의 개선을 평가합니다.
  • 정형 CDR 루프 인코딩 및 생 germline 분포 호환성 검토.
  • 다운스트림 항체 설계 및 의약품 발견 응용을 위한 모델 가중치를 제공합니다.

제안 방법

  • 항체용 구조화된 그래프 신경망과 순서에 독립적인 디코딩을 갖춘 ProteinMPNN 아키텍처를 적용합니다.
  • 두 개의 항체 데이터셋(SAbDab 항원결합 분절 및 ABodyBuilder2가 예측한 OAS 페어드 헤비/라이트 체인)에 대해 미세 조정합니다.
  • CD-HIT 클러스터링을 사용하여 비중복 학습/검증/테스트 분할을 만들고 데이터셋 간 분리를 보장합니다.
  • Adam 옵티마이저로 학습하고 검증 손실이 정체되면 학습률을 축소합니다( OAS: 10 에폭 후 x10; SAbDab: 10 에폭 후 x10 ).
  • ABodyBuilder2로 구조를 예측한 후 자기일관성 RMSD로 설계 가능성을 평가하고 Rosetta로 인터페이스 에너지를 평가하며 CDR 전체의 잔기 회복을 측정하고 SCALOP으로 정형 클러스터링을 분석합니다.
Figure 1: Overview of an antibody structure and its domains.
Figure 1: Overview of an antibody structure and its domains.

실험 결과

연구 질문

  • RQ1항체 특이적 미세 조정이 일반 ProteinMPNN에 비해 항체 CDR 루프에서 아미노산 시퀀스 회복을 향상시키나요?
  • RQ2구조 자기일관성 및 Rosetta 인터페이스 에너지로 측정한 설계 가능성에 대해 AbMPNN은 어떻게 영향을 미치나요?
  • RQ3AbMPNN이 항체의 정형 CDR 루프 구성을 더 잘 회복하고 생식선 분포와의 정렬성을 높일 수 있나요?
  • RQ4프레임워크 및 CDR 영역의 유효성 및 ANARCI 주석에 대한 항체 중심 훈련의 영향은 무엇인가요?
  • RQ5모델이 항체 약물 발견 및 바인더 설계 응용을 얼마나 잘 지원할 수 있나요?

주요 결과

  • AbMPNN은 ProteinMPNN에 비해 CDR-H3 RMSD 중앙값 자기일관성에서 약 20% 향상을 보입니다.
  • AbMPNN 시퀀스의 40%가 native 시퀀스의 인터페이스 에너지 5 kcal/mol 이내인 반면, ProteinMPNN은 20.5%입니다.
  • CDR 루프 전반의 시퀀스 회복은 AbMPNN에서 약 60%로 개선되고, ProteinMPNN에서는 약 40%입니다.
  • AbMPNN은 비-H3 CDR에서 정형 클러스터 회복에 큰 향상을 달성합니다.
  • 모든 AbMPNN 예측은 ANARCI에 의해 항체로 인식되며, ProteinMPNN 예측은 프레임워크 오류로 인해 주석 불가한 시퀀스가 16.8%를 차지합니다.
  • AbMPNN으로 생식선 매칭 분포가 개선되어 ProteinMPNN에서 관찰된 ANARCI 주석 실패를 감소시킵니다.
Figure 2: Schematic representation of the data processing steps and model architecture.
Figure 2: Schematic representation of the data processing steps and model architecture.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.