[논문 리뷰] ProGen2: Exploring the Boundaries of Protein Language Models
ProGen2는 10억 개가 넘는 시퀀스에서 학습된 최대 6.4B 파라미터의 단백질 언어 모델에 비해, 최첨단 perplexity를 달성하고, 실행 가능한 단백질을 생성하며, 제로샷 적합도 예측을 가능하게 한다.
Attention-based models trained on protein sequences have demonstrated incredible success at classification and generation tasks relevant for artificial intelligence-driven protein design. However, we lack a sufficient understanding of how very large-scale models and data play a role in effective protein model development. We introduce a suite of protein language models, named ProGen2, that are scaled up to 6.4B parameters and trained on different sequence datasets drawn from over a billion proteins from genomic, metagenomic, and immune repertoire databases. ProGen2 models show state-of-the-art performance in capturing the distribution of observed evolutionary sequences, generating novel viable sequences, and predicting protein fitness without additional finetuning. As large model sizes and raw numbers of protein sequences continue to become more widely accessible, our results suggest that a growing emphasis needs to be placed on the data distribution provided to a protein sequence model. We release the ProGen2 models and code at https://github.com/salesforce/progen.
연구 동기 및 목표
- 매우 대규모의 단백질 언어 모델(PLMs)이 생성, 구조 인식 생성, 그리고 적합도 예측 전반에서 어떻게 수행되는지 조사한다.
- 모델 품질에 미치는 학습 데이터 규모와 구성(게놈, 메타게놈, 면역 리포터리)의 영향을 평가한다.
- 특정 작업 미세 조정 없이도 구조 예측 및 기능적 대리자를 통해 생성 품질을 평가한다.
- 다양한 실험적 풍경과 항체 데이터셋에서 제로샷 적합도 예측 능력을 살펴본다.
제안 방법
- 단백질 서열에 대해 다음 토큰 예측으로 학습된 자기회귀 트랜스포머 아키텍처.
- 모델 크기: 151M, 764M, 2.7B, 6.4B 파라미터로 좌측-우측 인과 마스킹을 사용.
- 시퀀스 위치에 대한 로터리 위치 인코딩.
- SPMD 데이터/모델 병렬성을 위한 JAX 및 pjit으로 TPU-v3를 이용한 병렬화 학습.
- 전용 모델용 학습 데이터셋: Uniref90, BFD30, 대규모 항체 중심 세트(OAS).
- 평가: 보류 데이터에서의 perplexity, 생성 서열에 대한 AlphaFold2 구조 예측, Foldseek TMscore 비교, 그리고 다수 데이터셋에서의 제로샷 적합도 벤치마크.
실험 결과
연구 질문
- RQ1모델 크기가 커질수록 관찰된 단백질 서열의 분포를 포착하는 능력(다양한 동일성 임계값에서의 perplexity)이 어떻게 달라지는가?
- RQ2대규모 PLM이 작업 특이적 미세 조정 없이도 새롭고 구조적으로 타당한 단백질과 항체를 생성할 수 있는가?
- RQ3사전 학습된 모델이 다양한 단백질 풍경과 항체 데이터셋에서 정확한 제로샷 적합도 예측을 제공하는가?
- RQ4구조 초점 데이터셋에 대한 미세 조정이 생성 품질과 자연 단백질과의 구조적 유사성에 어떤 영향을 주는가?
주요 결과
- 더 큰 ProGen2 모델은 perplexity를 현저히 낮추어 분포 포착이 더 우수함을 시사한다.
- 생성된 단백질은 종종 그럴듯한 구조로 접히고 자연적인 접힘과 닮아 있지만, 서열 편차가 크거나 새로운 접힘도 관찰된다.
- 구조-아키텍처 데이터셋에 대한 미세 조정은 자연 서열 및 구조와의 유사성을 증가시키며, 샘플링 매개변수는 다양성과 유사성에 영향을 준다.
- 항체 생성 결과는 프롬프트 시퀀스가 학습 분포와 더 잘 정렬되고, 개발적 특성(응집성, 가용성)이 샘플링 선택에 따라 달라지는 경향을 보인다.
- 제로샷 적합도 예측 능력은 좁은, 넓은, 항체 특이적 풍경에서도 구조적 및 기능적 평가에 의해 뒷받침되어 시연된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.