[논문 리뷰] Reprogramming Pretrained Language Models for Protein Sequence Representation Learning
이 논문은 사전에 훈련된 영어 언어 모델을 단백질 서열 표현 학습을 위해 재프로그래밍하는 R2DL라는 프레임워크를 소개한다. 이는 영어 어휘 임베딩과 단백질 서열 임베딩 간의 희박한 선형 매핑을 학습하여, 다양한 단백질 성질 및 기능 예측 작업에서 표준 지도 학습 및 사전 훈련 기반 모델 대비 최대 10⁵배 높은 데이터 효율성을 달성한다. 이는 최신 기술 수준(SOTA)의 성능을 달성한다.
Machine Learning-guided solutions for protein learning tasks have made significant headway in recent years. However, success in scientific discovery tasks is limited by the accessibility of well-defined and labeled in-domain data. To tackle the low-data constraint, recent adaptions of deep learning models pretrained on millions of protein sequences have shown promise; however, the construction of such domain-specific large-scale model is computationally expensive. Here, we propose Representation Learning via Dictionary Learning (R2DL), an end-to-end representation learning framework in which we reprogram deep models for alternate-domain tasks that can perform well on protein property prediction with significantly fewer training samples. R2DL reprograms a pretrained English language model to learn the embeddings of protein sequences, by learning a sparse linear mapping between English and protein sequence vocabulary embeddings. Our model can attain better accuracy and significantly improve the data efficiency by up to $10^5$ times over the baselines set by pretrained and standard supervised methods. To this end, we reprogram an off-the-shelf pre-trained English language transformer and benchmark it on a set of protein physicochemical prediction tasks (secondary structure, stability, homology, stability) as well as on a biomedically relevant set of protein function prediction tasks (antimicrobial, toxicity, antibody affinity).
연구 동기 및 목표
- 단백질 기계 학습에서 레이블이 부족한 데이터 문제를 해결하기 위해 데이터 효율적인 표현 학습을 가능하게 하기 위해.
- 계산 비용이 높고 도메인 특화된 대규모 단백질 언어 모델의 사전 훈련을 대체할 수 있는 경량 대안을 개발하기 위해.
- 고성능이며 사전 구축된 영어 언어 모델을 단백질 서열에 재사용함으로써 도메인 간 전이 학습을 탐색하기 위해.
- 모델을 다시 훈련하지 않고도 단백질 표현 학습의 데이터 효율성을 향상시키기 위해.
- 최소한의 레이블된 데이터로 높은 성능을 내는 단백질 성질 및 기능 예측을 가능하게 하기 위해.
제안 방법
- R2DL는 토큰 임베딩과 단백질 서열 임베딩 간의 희박한 선형 변환을 학습하여 사전에 훈련된 영어 트랜스포머를 재프로그래밍한다.
- 이 방법은 k-SVD 기반의 사전 학습 기반 딕셔너리 학습을 사용하여 영어 언어 모델 임베딩에서 단백질 서열 임베딩으로의 희박한 매핑을 학습한다.
- L₀ 노름을 포함한 정규화된 목적 함수는 학습된 변환 행렬의 희박성을 강제하여 일반화 및 데이터 효율성을 향상시킨다.
- 프레임워크는 원본 언어 모델을 미세조정하지 않고, 학습된 매핑을 사용하여 단백질 서열에서 엔드 투 엔드로 훈련된다.
- 이 모델은 영어 언어 모델이 사전에 학습한 언어적 인덕티브 바이어스를 활용하여 단백질 서열 내에서 생물학적으로 의미 있는 표현을 포착한다.
- 이 접근법은 2차 구조, 안정성, 용해도, 동형성, 기능 예측(항균성, 독성, 항체 친화성 포함)을 포함한 여러 단백질 작업에서 평가된다.
![Figure 1 : Left: Descriptions of considered predictive tasks. We select the set of physicochemical property prediction tasks from the well-studied domains in [ 6 ] , and the biomedical function prediction tasks from works with biomedically relevant small-szied labeled datasets [ 3 ; 14 ] . Center: W](https://ar5iv.labs.arxiv.org/html/2301.02120/assets/new_figs/fig_1.png)
실험 결과
연구 질문
- RQ1사전에 훈련된 영어 언어 모델이 미세조정 없이도 의미 있는 단백질 서열 표현을 효과적으로 학습시킬 수 있는가?
- RQ2자연어에서 단백질 서열으로의 도메인 간 전이 학습이 단백질 기계 학습 작업에서 데이터 효율성을 얼마나 향상시킬 수 있는가?
- RQ3낮은 데이터 환경에서 R2DL의 성능은 표준 지도 학습 및 도메인 특화 사전 훈련과 비교해 어떻게 되는가?
- RQ4언어 모델 임베딩과 단백질 서열 간의 희박한 선형 매핑이 다양한 생물학적 작업에서 경쟁 가능한 성능을 낼 수 있는가?
- RQ5재프로그래밍된 기초 모델을 사용할 때 단백질 표현 학습에서 달성 가능한 데이터 효율의 상한선은 무엇인가?
주요 결과
- R2DL는 2차 구조, 안정성, 용해도, 동형성, 항균 활성, 독성, 항체 친화성 예측을 포함한 모든 평가된 단백질 예측 작업에서 최신 기술 수준의 성능를 달성한다.
- 표준 지도 학습 및 사전 훈련 기반 모델 대비 최대 10⁵배 높은 데이터 효율성을 확보하여, 극히 적은 레이블된 데이터로도 높은 정확도를 달성한다.
- 항균성 예측 작업에서 R2DL는 단 6,489개의 훈련 샘플로 88%의 정확도를 달성했으며, 이는 사전 훈련된 트랜스포머와 동일한 성능를 내지만 훨씬 적은 데이터 요구량을 보였다.
- 독성 예측 작업에서 R2DL는 단 8,153개의 레이블된 샘플을 사용해 93.78%의 정확도를 기록했으며, 낮은 데이터 환경에서 표준 지도 학습 방법을 능가했다.
- 동형성 분류 작업에서 R2DL는 10,438개의 훈련 샘플로 26%의 Top-1 정확도를 달성했으며, 이는 LSTM 기반 베이스라인과 동일한 성능를 보였지만 훨씬 더 효율적인 프레임워크를 제공했다.
- 이 프레임워크는 물리화학적 성질 예측 및 의학적으로 관련성이 높은 기능 예측을 포함한 다양한 생물학적 작업에 널리 적응 가능하며, 일관된 데이터 효율성 향상을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.