Skip to main content
QUICK REVIEW

[논문 리뷰] Peptide-GPT: Generative Design of Peptides using Generative Pre-trained Transformers and Bio-informatic Supervision

Aayush Shah, Chakradhar Guntuboina|arXiv (Cornell University)|2024. 10. 25.
Machine Learning in Bioinformatics인용 수 4
한 줄 요약

Peptide-GPT는 생물정보학적 필터링과 딥러닝 분류기를 사용하여 특정 생물학적 특성(용혈성, 비용혈성, 비오염성, 용해성)을 가진 펩타이드를 신규로 생성하기 위해 미세조정된 ProtGPT2 모델을 도입한다. 용혈성 예측에서 76.26%, 비용혈성에서 72.46%, 비오염성에서 78.84%, 용해성에서 68.06%의 정확도를 기록하며, 구조적 및 기능적 검증을 통한 NLP 기반 단백질 설계의 효과성을 입증한다.

ABSTRACT

In recent years, natural language processing (NLP) models have demonstrated remarkable capabilities in various domains beyond traditional text generation. In this work, we introduce PeptideGPT, a protein language model tailored to generate protein sequences with distinct properties: hemolytic activity, solubility, and non-fouling characteristics. To facilitate a rigorous evaluation of these generated sequences, we established a comprehensive evaluation pipeline consisting of ideas from bioinformatics to retain valid proteins with ordered structures. First, we rank the generated sequences based on their perplexity scores, then we filter out those lying outside the permissible convex hull of proteins. Finally, we predict the structure using ESMFold and select the proteins with pLDDT values greater than 70 to ensure ordered structure. The properties of generated sequences are evaluated using task-specific classifiers - PeptideBERT and HAPPENN. We achieved an accuracy of 76.26% in hemolytic, 72.46% in non-hemolytic, 78.84% in non-fouling, and 68.06% in solubility protein generation. Our experimental results demonstrate the effectiveness of PeptideGPT in de novo protein design and underscore the potential of leveraging NLP-based approaches for paving the way for future innovations and breakthroughs in synthetic biology and bioinformatics. Codes, models, and data used in this study are freely available at: https://github.com/aayush-shah14/PeptideGPT.

연구 동기 및 목표

  • 용혈성 활성, 용해성, 비오염성 행동과 같은 특정 기능적 특성을 지닌 펩타이드를 설계하기 위한 생성형 AI 모델 개발.
  • 생물정보학적 검증 단계(퍼플렉시티 순위, 볼록 Hull 필터링, pLDDT 기반 구조 예측)를 통합하여 생성된 서열의 구조적 타당성을 확보.
  • 과제별 분류기(_pePeptideBERT_ 및 _HAPPENN_)를 사용하여 생성된 펩타이드의 성능 평가를 통해 기능적 정확도 평가.
  • 특히 비오염성 단백질을 위한 알려진 단백질 공간의 외연부에 위치하는 새로운 펩타이드 서열의 발견을 가능하게 하기.
  • 재현 가능성 및 합성 생물학 및 생체공학 분야의 향후 발전을 위해 모델, 코드, 데이터를 오픈소스로 제공.

제안 방법

  • 용혈성, 비용혈성, 비오염성, 용해성 단백질의 실험적으로 확인된 4개의 별도 데이터셋에 대해 ProtGPT2를 미세조정.
  • 생성된 서열의 가능성과 일관성에 따라 퍼플렉시티 점수를 적용하여 순위를 매김.
  • 기존에 유효한 단백질 서열의 볼록 Hull을 사용하여 생물학적이거나 불안정한 서열을 제외.
  • ESMFold를 사용하여 3차원 구조를 예측하고, pLDDT > 70인 것만 유지하여 안정적이고 질서 있는 접힘을 확보.
  • 최종 서열을 PeptideBERT 및 HAPPENN을 사용하여 분류하여 기능적 특성을 평가하고 과제별 정확도 확보.
  • 샘플링 파라미터(최대 길이, top-k, 반복 펜alty)를 사용하여 5개의 랜덤 시드당 각 기능 성질별로 5,000개의 서열 생성.

실험 결과

연구 질문

  • RQ1미세조정된 생성형 프리트레인드 트랜스포머 모델이 용혈성 활성 또는 용해성과 같은 원하는 기능적 특성을 지닌 새로운 펩타이드 서열을 효과적으로 생성할 수 있는가?
  • RQ2퍼플렉시티, 볼록 Hull, pLDDT 기반의 생물정보학적 필터링 통합이 생성된 펩타이드의 구조적 타당성과 생물학적 타당성을 확보하는 데 얼마나 효과적인가?
  • RQ3특히 비오염성 서열의 경우, 생성된 펩타이드가 알려진 功能성 단백질의 분포와 잠재 공간에서 얼마나 일치하는가?
  • RQ4모델이 알려진 단백질 공간의 외연부에 위치하는 펩타이드를 생성할 수 있는가? 이는 새로운 기능적 모티프 발견을 가능하게 하는가?
  • RQ5PeptideBERT 및 HAPPENN과 같은 전용 분류기를 통해 평가했을 때 생성된 펩타이드의 기능적 정확도는 어떠한가?

주요 결과

  • Peptide-GPT는 용혈성 펩타이드 식별에서 76.26%의 정확도를 기록하여 표적 리틱 활성을 지닌 서열 생성에서 뛰어난 성능을 보였다.
  • 비용혈성 펩타이드 생성에서 72.46%의 정확도를 달성하여 용혈성 특성을 효과적으로 억제함을 시사했다.
  • 비오염성 펩타이드 생성에서 가장 높은 정확도인 78.84%를 기록하여 비특이적 결합을 저지하는 표면 특성을 강력하게 반영했다.
  • 용해성 펩타이드 생성에서 68.06%의 정확도를 기록하여 유리한 용해성 특성을 지닌 서열 생성 능력을 반영했다.
  • 비용혈성 과제에서 가장 높은 구조적 안정성을 보였으며, 유효한 서열의 44.46%가 pLDDT > 70을 확보하여 접힘된 구조에 대한 높은 신뢰도를 나타냈다.
  • t-SNE 시각화 결과 생성된 비오염성 서열이 알려진 단백질 공간의 경계에 위치해 있어 새로운 기능적 영역 탐색을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.