[논문 리뷰] Deciphering antibody affinity maturation with language models and weakly supervised learning
이 논문은 558M 시퀀스로 훈련된 항체 특화 언어 모델 AntiBERTy를 도입하고, 약한 감독 MIL 프레임워크를 사용해 레퍼토리 내 결합 잔기를 식별한다. 또한 레퍼토리 임베딩이 친화성 성숙 경로를 드러내고 MIL 어텐션이 VRC01-class 항체의 paratope 잔기에 로컬라이즈된다는 것을 보인다.
In response to pathogens, the adaptive immune system generates specific antibodies that bind and neutralize foreign antigens. Understanding the composition of an individual's immune repertoire can provide insights into this process and reveal potential therapeutic antibodies. In this work, we explore the application of antibody-specific language models to aid understanding of immune repertoires. We introduce AntiBERTy, a language model trained on 558M natural antibody sequences. We find that within repertoires, our model clusters antibodies into trajectories resembling affinity maturation. Importantly, we show that models trained to predict highly redundant sequences under a multiple instance learning framework identify key binding residues in the process. With further development, the methods presented here will provide new insights into antigen binding from repertoire sequences alone.
연구 동기 및 목표
- 레퍼토리 표현을 학습하기 위한 항체 중심 언어 모델 개발.
- 항체 서열의 임베딩을 통해 친화성 성숙 경로를 탐색한다.
- 다중 인스턴스 학습 프레임워크를 사용하여 결합/paratope 잔기를 식별한다.
- MIL 어텐션이 VRC01-class 항체의 알려진 paratope 영역과 일치함을 보여준다.
제안 방법
- 마스킹 언어 모델링을 사용하여 558M개의 비중복 항체 시퀀스에 대해 BERT 스타일 트랜스포머 인코더인 AntiBERTy를 학습한다.
- AntiBERTy 임베딩으로부터 k-NN 그래프와 evo-velocity 분석을 구성하여 레퍼토리의 진화를 연구한다.
- 매우 중복된(가능성 높은 결합) 시퀀스를 포함하는 배를 예측하기 위해 다중 인스턴스 학습 프레임워크를 사용한다.
- AntiBERTy로 시퀀스를 인코딩해 잔당 임베딩을 생성하고, 주의 기반 풀링과 MIL 분류기를 적용한다.
- 포지티브/네거티브 샘플링이 동일하게 이루어진 64개 시퀀스의 배를 대상으로 MIL 모델을 학습하고 교차 엔트로피 손실을 사용한다.
- 결합에 기여하는 잔기를 식별하기 위해 어텐션 맵을 분석하고 알려진 VRC01 gp120 복합체 구조와 대조한다.
실험 결과
연구 질문
- RQ1항체 특화 언어 모델이 면역 레퍼토리 내의 친화성 성숙 경로를 드러낼 수 있는가?
- RQ2AntiBERTy 임베딩을 사용하는 MIL 프레임워크가 레퍼토리 데이터의 항체에서 paratope 잔기를 식별하는가?
- RQ3MIL 어텐션 점수는 HIV-1VRC01-class 항체의 알려진 결합 영역(Paratope)에 로컬라이즈되는가?
- RQ4기부자별 및 결합된 레퍼토리에서 MIL 모델의 정량적 성능 특성은 무엇인가?
주요 결과
- AntiBERTy 임베딩은 레퍼토리 임베딩에서 원시체(germline)에서 매우 변형된 파생물까지의 연속적 경로를 드러내어 친화성 성숙과 일치한다.
- MIL 모델은 기부자 전반에 걸쳐 합리적인 정확도로 매우 중복된 시퀀스를 포함하는 배를 식별한다(일부 레퍼토리에서 AUROC 0.96까지).
- MIL 임베딩의 어텐션 맵은 여러 VRC01 항체에서 알려진 paratope 영역(H2 loop 및 다음 베타 가닥)에 로컬라이즈된다.
- 단일 인스턴스 MIL 예측이 결합 맥락에서 결정화된 10개의 VRC01 항체를 정확히 표시하여 방법을 검증한다.
- 결합 레퍼토리 MIL 모델은 AUROC 0.84 및 F1 최대 0.77을 달성하여 기부자 간 전이 가능한 신호를 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.