Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing the efficiency of protein language models with minimal wet-lab data through few-shot learning

Ziyi Zhou, Liang Zhang|arXiv (Cornell University)|2024. 02. 03.
Machine Learning in BioinformaticsBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

이 논문은 단일 서열 돌연변이에 대한 수십 개의 실험실 측정값만을 사용하여 단일-샷 미세조정 전략인 FSFP를 제안한다. 메타-전이 학습, 학습-순서 정하기, 그리고 파rameter 효율적 미세조정을 결합함으로써, FSFP는 극도로 낮은 데이터 가용성 조건에서도 87개의 딥 돌연변이 스크리닝 데이터셋에서 예측 정확도를 크게 향상시킨다.

ABSTRACT

Accurately modeling the protein fitness landscapes holds great importance for protein engineering. Recently, due to their capacity and representation ability, pre-trained protein language models have achieved state-of-the-art performance in predicting protein fitness without experimental data. However, their predictions are limited in accuracy as well as interpretability. Furthermore, such deep learning models require abundant labeled training examples for performance improvements, posing a practical barrier. In this work, we introduce FSFP, a training strategy that can effectively optimize protein language models under extreme data scarcity. By combining the techniques of meta-transfer learning, learning to rank, and parameter-efficient fine-tuning, FSFP can significantly boost the performance of various protein language models using merely tens of labeled single-site mutants from the target protein. The experiments across 87 deep mutational scanning datasets underscore its superiority over both unsupervised and supervised approaches, revealing its potential in facilitating AI-guided protein design.

연구 동기 및 목표

  • 사전 훈련된 단백질 언어 모델이 단백질 적합도 지도를 예측할 때 제한된 성능과 해석 가능성 문제를 해결하기 위해.
  • 모델의 미세조정을 위해 대량의 레이블이 부여된 실험 데이터가 필요하다는 실용적 장벽을 극복하기 위해.
  • 특히 단일 서열 돌연변이 측정값 수십 개만으로도 높은 성능을 달성할 수 있는 훈련 전략을 개발하기 위해.
  • 데이터 부족 조건에서 단백질 언어 모델의 효율성과 일반화 능력을 향상시켜 AI 기반 단백질 설계에 기여하기 위해.
  • 메타학습, 순서 정하기 손실, 파rameter 효율적 미세조정을 통합하여 최소한의 데이터로도 목표 단백질에 최적화된 적응을 가능하게 하기 위해.

제안 방법

  • FSFP는 메타-전이 학습을 활용하여 소수의 레이블이 부여된 예시만으로도 새로운 단백질에 대해 단백질 언어 모델을 신속하게 적응시킨다.
  • 모델 예측이 단백질 변종의 상대적 적합도 순서와 일치하도록 하기 위해 학습-순서 정하기 손실 함수를 통합한다.
  • 파rameter 효율적 미세조정 기법을 사용하여 모델 파라미터의 소수의 부분만을 업데이트함으로써 계산 비용을 줄이고 과적합을 방지한다.
  • 다양한 단백질 가족을 대상으로 훈련하여 다양한 목표 단백질과 돌연변이 유형 간의 일반화 능력을 확보한다.
  • 사전 훈련된 단백질 언어 모델을 백본으로 활용하여 딥 돌연변이 스크리닝 실험에서의 최소한의 레이블 데이터로 미세조정한다.
  • 프레임워크는 확장 가능하며 제한된 실험적 검증이 가능한 다양한 단백질 공학 작업에 적용 가능하도록 설계되었다.

실험 결과

연구 질문

  • RQ1단지 수십 개의 레이블이 부여된 단일 서열 돌연변이에 의존할 때 단백질 언어 모델이 적합도 지도에 대해 높은 예측 정확도를 달성할 수 있는가?
  • RQ2메타학습, 순서 정하기 손실, 파rameter 효율적 미세조정을 결합함으로써 데이터 부족 조건에서 모델의 일반화 능력은 어떻게 향상되는가?
  • RQ3FSFP는 소수의 학습 조건에서 비지도 사전 훈련과 완전히 지도된 미세조정을 모두 능가하는가?
  • RQ4FSFP는 얼마나 다양한 단백질 가족과 돌연변이 유형에 대해 최소한의 실험 데이터로 일반화할 수 있는가?
  • RQ5학습-순서 정하기 손실의 통합이 단백질 적합도 점수에 대한 모델의 해석 가능성과 순위 정렬 성능을 향상시키는가?

주요 결과

  • FSFP는 단지 10~50개의 레이블이 부여된 단일 서열 돌연변이만으로도 87개의 딥 돌연변이 스크리닝 데이터셋에서 단백질 적합도 예측 정확도를 크게 향상시켰다.
  • 특히 낮은 데이터 환경에서 비지도 사전 훈련과 표준 지도 미세조정보다 뛰어난 성능을 보였다.
  • 다양한 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하여 다양한 단백질 가족 간의 뛰어난 일반화 능력을 입증했다.
  • 학습-순서 정하기 손실의 사용으로 생물학적 적합도 순서와의 일치도 향상되어 모델 예측의 해석 가능성이 향상되었다.
  • 파rameter 효율적 미세조정은 최소한의 계산 오버헤드로 효과적인 적응을 가능하게 하였고 과적합 위험도 감소시켰다.
  • 메타학습은 새로운 단백질에 대한 신속한 적응을 가능하게 하여 소수의 학습 시나리오에서의 방법의 강건성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.