Skip to main content
QUICK REVIEW

[논문 리뷰] Reprogramming Pretrained Language Models for Antibody Sequence Infilling

Igor Melnyk, Vijil Chenthamarakshan|arXiv (Cornell University)|2022. 10. 05.
Monoclonal and Polyclonal Antibodies Research인용 수 8
한 줄 요약

이 논문은 사전에 훈련된 영어 BERT 모델을 항체 서열 보정에 적응시키는 모델 재프로그래밍 방법인 ReprogBert를 소개한다. 특히 매우 다양성이 높은 CDR-H3 영역을 대상으로 한다. 원래의 언어 모델의 가중치를 동결하면서 영어와 아미노산 임베딩 간의 선형 투영을 학습함으로써, ReprogBert는 기존의 기준 모델 대비 두 배 이상 높은 서열 다양성을 달성하면서도 구조적 무결성이나 자연스러움을 훼손하지 않으며, 동시에 in silico에서 항원 결합 특이성과 바이러스 중화 능력을 향상시킨다.

ABSTRACT

Antibodies comprise the most versatile class of binding molecules, with numerous applications in biomedicine. Computational design of antibodies involves generating novel and diverse sequences, while maintaining structural consistency. Unique to antibodies, designing the complementarity-determining region (CDR), which determines the antigen binding affinity and specificity, creates its own unique challenges. Recent deep learning models have shown impressive results, however the limited number of known antibody sequence/structure pairs frequently leads to degraded performance, particularly lacking diversity in the generated sequences. In our work we address this challenge by leveraging Model Reprogramming (MR), which repurposes pretrained models on a source language to adapt to the tasks that are in a different language and have scarce data - where it may be difficult to train a high-performing model from scratch or effectively fine-tune an existing pre-trained model on the specific task. Specifically, we introduce ReprogBert in which a pretrained English language model is repurposed for protein sequence infilling - thus considers cross-language adaptation using less data. Results on antibody design benchmarks show that our model on low-resourced antibody sequence dataset provides highly diverse CDR sequences, up to more than a two-fold increase of diversity over the baselines, without losing structural integrity and naturalness. The generated sequences also demonstrate enhanced antigen binding specificity and virus neutralization ability. Code is available at https://github.com/IBM/ReprogBERT

연구 동기 및 목표

  • 항체 설계를 위한 딥러닝 모델에서 낮은 서열 다양성 문제, 특히 매우 변동성이 높은 CDR-H3 영역을 해결한다.
  • 모델를 다시 훈련하거나 작은 데이터셋에서 훈련할 경우 성능을 제한하는 항체 서열-구조 쌍의 데이터 부족 문제를 극복한다.
  • 모델 재프로그래밍을 통해 사전에 훈련된 언어 모델을 활용하여 최소한의 훈련으로 고품질이고 다양한 CDR 서열 생성을 가능하게 한다.
  • 항원 결합 및 바이러스 중화 등의 기능적 특성을 향상시키면서도, 생성된 서열의 구조적 무결성과 자연스러움을 유지한다.

제안 방법

  • 사전에 훈련된 영어 BERT 모델(원본 도메인)을 단백질 서열 보정(목표 도메인)에 재사용하기 위해 모델 재프로그래밍을 적용한다.
  • 영어 토큰과 아미노산 임베딩 간의 변환을 위해 학습 가능한 선형 투영 행렬 θ ∈ ℝ^{|Vt|×|Vs|} 및 γ ∈ ℝ^{|Vs|×|Vt|}을 도입한다.
  • 원래 BERT 모델의 가중치를 동결하고, 훈련 중에는 오직 투영 행렬과 목표 도메인 아미노산 임베딩만을 미세조정한다.
  • CDR 보정을 마스크된 언어 모델링 작업으로 설정하여, 고정된 영역의 맥락을 이용해 마스크된 CDR 영역을 예측한다.
  • 이중 매핑을 사용한다: fθ는 단백질 서열을 원본 언어 공간으로 변환하고, gγ는 예측 결과를 목표 단백질 공간으로 다시 매핑한다.
  • y_t = gγ(M(fθ(x_t)))를 통해 서열을 생성한다. 여기서 M은 동결된 BERT 모델이며, 이는 구조적 입력 없이도 효율적인 서열 전용 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1모델 재프로그래밍은 대규모 사전 훈련된 언어 모델을 저자원 단백질 서열 보정 작업(예: CDR 설계)에 효과적으로 적응시킬 수 있는가?
  • RQ2ReprogBert는 데이터가 적은 환경에서 기존의 서열 기반 및 그래프 기반 생성 모델보다 더 높은 서열 다양성을 달성하는가?
  • RQ3새로운 CDR 서열을 생성할 때 모델이 구조적 무결성과 서열 자연스러움을 어느 정도 유지하는가?
  • RQ4재프로그래밍된 모델은 항원 결합 특이성 및 바이러스 중화 능력 등의 기능적 특성을 향상시킬 수 있는가?
  • RQ5CDR 보정 벤치마크에서 ReprogBert의 성능은 작업 적응형 및 도메인 적응형 미세조정 기준 모델과 비교해 어떻게 되는가?

주요 결과

  • ReprogBert는 최신 기준 모델 대비 저자원 항체 데이터셋에서 서열 다양성 2배 이상 향상시켰다.
  • 높은 구조적 무결성과 자연스러운 서열을 유지하며, 정확한 CDR 서열 복원과 실제 구조에서 낮은 RMSD를 기록했다.
  • 항원 결합 특이성과 바이러스 중화 능력을 향상시켜, CoV-AbDab + SabDab 데이터셋에서 예측 중화 점수 76.7%를 달성했다.
  • 중화 예측에서 ProtBert(74.7%)와 EnglishBert(71.0%)를 모두 초월하여 기능적 성능이 뛰어나다는 것을 입증했다.
  • 재프로그래밍을 통해 학습된 아미노산 임베딩은 의미 있는 생물학적 군집을 보이며, 영어 토큰 임베딩에서 효과적인 매핑을 가능하게 했다.
  • 이 방법은 매우 자원 효율적이며, 사전에 훈련된 언어 모델의 거대한 사전 훈련을 활용하면서도, 두 개의 작은 투영 행렬과 단백질 임베딩만을 미세조정하면 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.