Skip to main content
QUICK REVIEW

[논문 리뷰] PSP: Million-level Protein Sequence Dataset for Protein Structure Prediction

Sirui Liu, Jun Zhang|arXiv (Cornell University)|2022. 06. 24.
Protein Structure and Dynamics인용 수 9
한 줄 요약

이 논문은 단백질 구조 예측을 위한 첫 번째 오픈소스 백만 수준의 단백질 서열 데이터셋인 PSP를 소개한다. 이 데이터셋은 진짜 구조 서열 570만 건과 디스틸레이션 서열 745만 건을 포함한다. 이는 최신 기술 수준의 모델을 벤치마크된 절차로 훈련시킬 수 있게 하며, 51개 단백질으로 구성된 검증 세트에서 87.2 lDDT와 90.1 TM 점수를 기록하여 CAMEO 대회에서 최고 성능을 달성한다.

ABSTRACT

Proteins are essential component of human life and their structures are important for function and mechanism analysis. Recent work has shown the potential of AI-driven methods for protein structure prediction. However, the development of new models is restricted by the lack of dataset and benchmark training procedure. To the best of our knowledge, the existing open source datasets are far less to satisfy the needs of modern protein sequence-structure related research. To solve this problem, we present the first million-level protein structure prediction dataset with high coverage and diversity, named as PSP. This dataset consists of 570k true structure sequences (10TB) and 745k complementary distillation sequences (15TB). We provide in addition the benchmark training procedure for SOTA protein structure prediction model on this dataset. We validate the utility of this dataset for training by participating CAMEO contest in which our model won the first place. We hope our PSP dataset together with the training benchmark can enable a broader community of AI/biology researchers for AI-driven protein related research.

연구 동기 및 목표

  • 단백질 구조 예측 분야에서 AI 모델을 훈련시키기 위한 대규모, 다양한, 고품질의 오픈소스 데이터셋이 부족한 문제를 해결하기 위해.
  • AlphaFold2와 같은 최신 기술 수준의 모델을 전면적으로 훈련시킬 수 있도록 포괄적이고 확장 가능하며 접근 가능한 데이터셋을 제공하기 위해.
  • 하이퍼파ram터, 훈련 비용, 단계별 정확도 지표를 포함한 상세한 재현 가능한 벤치마크 훈련 절차를 제공하기 위해.
  • 훈련 및 피지터링 중에 새로운 손실 함수와 데이터 샘플링 전략을 통해 모델 성능을 향상시키기 위해.
  • 데이터와 훈련 프로토콜을 공개하여 단체가 고급 단백질 구조 예측 도구에 더 넓게 접근할 수 있도록 하기 위해.

제안 방법

  • 높은 다양성과 품질을 갖춘 570만 건의 진짜 구조 서열과 745만 건의 디스틸레이션 서열을 포함한 대규모 데이터셋 구축.
  • 구조 예측을 위한 전체 입력 특징 포함: 아미노산 서열, MSA, 템플릿, 그리고 AlphaFold2의 atom37 형식에 따른 원자 수준의 좌표.
  • 두 부분으로 구성된 데이터 조직 방식: 진짜 구조 데이터셋과 디스틸레이션 데이터셋으로, 각각 256개의 압축된 부분으로 나누어 효율적인 저장과 접근을 가능하게 함.
  • 세부 하이퍼파ram터, 훈련 비용 추정치, 각 훈련 단계에서의 기대 정확도를 포함한 벤치마크 훈련 파이프라인 개발.
  • 모델 일반화를 향상시키기 위해 초기 훈련 단계에서 새로운 구조 관련 손실과 향상된 데이터 샘플링 전략을 통합.
  • 피지터링 단계에서 안정화된 위반 손실을 적용하여 모델의 신뢰도와 구조 정확도를 향상시킴.

실험 결과

연구 질문

  • RQ1백만 수준의 단백질 서열 데이터셋이 최신 기술 수준의 단백질 구조 예측 모델의 훈련과 성능 향상에 상당한 기여를 할 수 있는가?
  • RQ2세부 하이퍼파라미터와 단계별 메트릭을 포함한 포괄적인 오픈소스 훈련 벤치마크는 AI 기반 단백질 연구의 재현 가능성과 접근성에 어느 정도 기여하는가?
  • RQ3고품질의 디스틸레이션 서열과 다양한 진짜 구조의 포함이 모델의 일반화 능력과 정확도에 어떤 영향을 미치는가?
  • RQ4손실 함수와 데이터 샘플링 전략의 향상이 어떤 방식으로 구조 예측 모델의 성능 향상에 기여하는가?
  • RQ5커뮤니티가 접근 가능한 데이터셋과 훈련 절차는 CAMEO와 같은 실제 벤치마크에서 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • PSP 데이터셋은 570만 건의 진짜 구조 서열(10TB)과 745만 건의 디스틸레이션 서열(15TB)을 포함하여, 이와 같은 종류의 가장 큰 오픈소스 데이터셋이다.
  • 벤치마크 훈련 절차를 통해 최신 기술 수준의 모델을 세부 하이퍼파라미터, 훈련 비용, 각 단계에서의 기대 정확도를 포함해 전면적으로 훈련시킬 수 있다.
  • PSP로 훈련된 모델은 CAMEO 1개월 검증 세트(51개 서열)에서 90.1 TM 점수와 87.2 lDDT를 기록하여 AlphaFold2와 RoseTTAFold를 초월하는 성능을 보였다.
  • 새로운 구조 관련 손실과 향상된 데이터 샘플링 전략의 사용은 초기 훈련 단계에서 측정 가능한 성능 향상을 이끌어냈다.
  • 피지터링 단계에서 안정화된 위반 손실을 적용함으로써 모델의 신뢰도가 향상되고 구조 오류가 감소했다.
  • 데이터셋은 효율적인 저장과 접근을 위해 256개의 압축된 부분으로 나뉘어져 있으며, 표준 구조 예측 파이프라인과 완전히 호환된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.