Skip to main content
QUICK REVIEW

[논문 리뷰] PepDoRA: A Unified Peptide Language Model via Weight-Decomposed Low-Rank Adaptation

Leyao Wang, Rishab Pulugurta|arXiv (Cornell University)|2024. 10. 28.
Machine Learning in Bioinformatics인용 수 4
한 줄 요약

PepDoRA는 100,000종의 다양하고 실험적으로 검증된 펩타이드를 대상으로 ChemBERTa-77M-MLM을 DoRA(Weight-Decomposed Low-Rank Adaptation)를 활용해 미세조정하는 통합 펩타이드 언어 모델이다. 이는 세포막 투과성, 용혈성, 비오염성 경향, 타겟 특이적 결합성과 같은 치료적 특성을 정확하게 예측할 수 있게 하여 일반 목적 및 펩타이드 전용 기준 모델을 모두 능가한다.

ABSTRACT

Peptide therapeutics, including macrocycles, peptide inhibitors, and bioactive linear peptides, play a crucial role in therapeutic development due to their unique physicochemical properties. However, predicting these properties remains challenging. While structure-based models primarily focus on local interactions, language models are capable of capturing global therapeutic properties of both modified and linear peptides. Protein language models like ESM-2, though effective for natural peptides, cannot however encode chemical modifications. Conversely, pre-trained chemical language models excel in representing small molecule properties but are not optimized for peptides. To bridge this gap, we introduce PepDoRA, a unified peptide representation model. Leveraging Weight-Decomposed Low-Rank Adaptation (DoRA), PepDoRA efficiently fine-tunes the ChemBERTa-77M-MLM on a masked language model objective to generate optimized embeddings for downstream property prediction tasks involving both modified and unmodified peptides. By tuning on a diverse and experimentally valid set of 100,000 modified, bioactive, and binding peptides, we show that PepDoRA embeddings capture functional properties of input peptides, enabling the accurate prediction of membrane permeability, non-fouling and hemolysis propensity, and via contrastive learning, target protein-specific binding. Overall, by providing a unified representation for chemically and biologically diverse peptides, PepDoRA serves as a versatile tool for function and activity prediction, facilitating the development of peptide therapeutics across a broad spectrum of applications.

연구 동기 및 목표

  • 자연적 및 수정된 펩타이드, 특히 사이클화나 비자연적 아미노산을 포함한 복잡한 수정을 가진 펩타이드를 효과적으로 표현하지 못하는 기존 모델의 격차를 메우기 위해.
  • ESM-2와 같은 단백질 언어 모델이나 ChemBERTa와 같은 화학 언어 모델이 생체활성 펩타이드의 기능적 및 물리화학적 특성을 포착하는 데 한계가 있음을 극복하기 위해.
  • 사전 훈련된 cLM의 강력한 화학 지식과 효율적인 미세조정을 결합한 통합 표현 프레임워크를 개발하기 위해.
  • 구조적 데이터 없이도 세포막 투과성, 용혈성, 비오염성과 같은 핵심 치료적 특성을 정확하게 예측할 수 있도록 하기 위해.
  • 함께 펩타이드-단백질 임베딩 학습을 통해 구조가 다양하거나 약물로 삼기 어려운 단백질을 표적으로 삼는 펩타이드 의약품 설계를 촉진하기 위해.

제안 방법

  • 가중치 분해된 저랭크 적응(DoRA)을 사용하여 사전 훈련된 ChemBERTa-77M-MLM 모델을 미세조정하는 방법으로, 가중치 업데이트를 저랭크 행렬로 분해하는 파rameter 효율적인 미세조정 기법을 활용한다.
  • 마스크된 언어 모델링 목적을 사용하여 100,000개의 다양하고 실험적으로 검증된 펩타이드 데이터셋(수정된 펩타이드 및 생체활성 선형 펩타이드 포함)을 훈련한다.
  • DoRA를 활용하여 ChemBERTa의 사전 훈련된 화학 지식을 유지하면서도 펩타이드 전용 기능적 특성에 맞게 적응시킨다.
  • CLIP 유사 아키텍처를 기반으로 한 대비 학습을 사용하여 펩타이드-단백질 통합 임베딩을 학습하고, 진짜 결합 쌍 간의余弦 유사도를 최대화한다.
  • 최종적으로 생성된 펩타이드 임베딩을 하류 회귀 및 분류 과제의 입력 특징으로 사용하며, 이는 세포막 투과성, 용혈성, 비오염성 예측을 포함한다.
  • DoRA 기반 적응의 효과성을 검증하기 위해 전체 미세조정, LoRA, PeptideCLM, PeptideBERT와 같은 기준 모델과의 성능 비교를 수행한다.

실험 결과

연구 질문

  • RQ1DoRA 기반 미세조정이 화학 언어 모델(ChemBERTa)을 다양한 수정 및 생체활성 펩타이드의 기능적 및 물리화학적 특성을 포착하도록 효과적으로 적응시킬 수 있는가?
  • RQ2PepDoRA는 세포막 투과성 및 용혈성과 같은 핵심 치료적 특성을 예측하는 데 있어 PeptideBERT 및 PeptideCLM과 같은 전용 펩타이드 모델보다 어떻게 비교되는가?
  • RQ3PepDoRA 임베딩은 특히 도전적인 또는 비정형 단백질 표적으로서의 결합 예측에 얼마나 정확하게 기여하는가?
  • RQ4PepDoRA가 별도의 모델 아키텍처 없이도 자연적 및 수정된 펩타이드 모두에 일반화되는 통합 표현을 학습할 수 있는가?
  • RQ5PepDoRA 임베딩을 사용한 대비 학습 프레임워크는 제로샷 또는 피카샷 설정에서 진짜와 비결합 펩타이드-단백질 쌍을 효과적으로 구분할 수 있는가?

주요 결과

  • 비오염성 분류 과제에서 PepDoRA는 87% 정확도, 70% F1 점수, 71% 재현율을 기록하여 PeptideBERT(87% 정확도, 69% F1, 67% 재현율)를 능가했다.
  • 용혈성 예측 과제에서 PepDoRA는 80% 정확도와 37% F1 점수를 기록하여 PeptideBERT(81% 정확도, 35% F1)를 약간 앞서며 재현율(27% 대 25%)에서도 유의미하게 높은 성능을 보였다.
  • 펩타이드-단백질 상호작용 예측 과제에서 PepDoRA는 이진 정확도 95.9%, Top-1 정확도 62.1%, Top 10% 정확도 86.1%를 기록하여 LoRA 미세조정된 ChemBERTa(95.1%, 60.0%, 84.9%)를 포함한 모든 기준 모델을 능가했다.
  • PepDoRA의 대비 학습 기반 결합 예측 성능은 특히 약물로 삼기 어려운 또는 구조가 유연한 표적으로서의 일반화 능력이 뛰어나다는 점을 보여주었다.
  • DoRA 기반 미세조정 전략은 ChemBERTa의 화학 지식을 유지하면서도 펩타이드 전용 과제에 높은 정밀도로 적응시켰으며, 전체 미세조정의 비용을 피할 수 있었다.
  • PepDoRA는 PeptideCLM-23M 모델(93.9% 이진 정확도, 47.3% Top-1 정확도)을 초월하여 펩타이드-단백질 상호작용 과제에서 더 넓은 적용 범위를 보였으며, 다양한 펩타이드 유형에 걸쳐 보편적인 적용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.