Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive BLASTing through the Sequence Dataspace: Theories on Protein Sequence Embedding

Yoojin Hong, Jaewoo Kang|ArXiv.org|2009. 11. 03.
Genomics and Phylogenetic Studies참고 문헌 30인용 수 5
한 줄 요약

이 논문은 PSSM 기반 계통발생 프로파일링을 적응적으로 정렬을 다차원 데이터 공간에 매핑함으로써 가속화하는 히우리스틱 알고리즘인 Ada-BLAST을 소개한다. 이는 이전 방법 대비 최대 19배 빠른 속도 향상을 이룩하면서 민감도를 유지한다. 또한, 임베딩된 정렬 특징이 25% 이하의 일치율 영역에서 이차 구조와 산통막 단백질 도메인의 탐지 능력을 향상시킨다. 이는 PSSM 기반 기능적 및 진화적 추론 향상에 시퀀스 임베딩을 효과적으로 적용할 수 있음을 입증한다.

ABSTRACT

We theorize that phylogenetic profiles provide a quantitative method that can relate the structural and functional properties of proteins, as well as their evolutionary relationships. A key feature of phylogenetic profiles is the interoperable data format (e.g. alignment information, physiochemical information, genomic information, etc). Indeed, we have previously demonstrated Position Specific Scoring Matrices (PSSMs) are an informative M-dimension which can be scored from quantitative measure of embedded or unmodified sequence alignments. Moreover, the information obtained from these alignments is informative, even in the twilight zone of sequence similarity (<25% identity)(1-5). Although powerful, our previous embedding strategy suffered from contaminating alignments(embedded AND unmodified) and computational expense. Herein, we describe the logic and algorithmic process for a heuristic embedding strategy (Adaptive GDDA-BLAST, Ada-BLAST). Ada-BLAST on average up to ~19-fold faster and has similar sensitivity to our previous method. Further, we provide data demonstrating the benefits of embedded alignment measurements for isolating secondary structural elements and the classifying transmembrane-domain structure/function. We theorize that sequence-embedding is one of multiple ways that low-identity alignments can be measured and incorporated into high-performance PSSM-based phylogenetic profiles.

연구 동기 및 목표

  • 이전의 PSSM 기반 계통발생 프로파일링 방법에서의 계산 비효율성과 혼합 정렬에 의한 오염 문제를 해결하기 위해.
  • 낮은 시퀀스 일치율 영역에서 민감도를 유지하면서도 더 빠르고 적응적인 임베딩 전략을 개발하기 위해.
  • 임베딩된 정렬 측정치가 이차 구조 요소 및 산통막 도메인 분류에 기여하는 방식을 검증하기 위해.
  • 시퀀스 임베딩을 PSSM 기반 계통발생 프로파일 향상에 실용적이고 정량적인 방법으로 정립하기 위해.

제안 방법

  • 적응형 GDDA-BLAST(Ada-BLAST)는 정렬을 다차원 데이터 공간에 선택적으로 매핑하는 히우리스틱 임베딩 전략을 사용한다.
  • 이 방법은 계통발생 프로파일링을 위한 핵심 M차원 표현으로서 정렬에서 유도된 위치 특이 스코어 매트릭스(PSSMs)를 사용한다.
  • 노이즈가 많거나 품질이 낮은 정렬로 인한 오염을 줄이기 위해 동적 필터링 메커니즘을 적용하여 계산 효율성을 향상시킨다.
  • 알고리즘은 정보량이 높은 특징을 우선순위로 정렬 특징의 가중치를 적응적으로 조정한다.
  • 정렬 스코어와 물리화학적 성질을 통합된 벡터 공간으로 매핑하여 후속 PSSM 구축을 수행한다.
  • genomic, alignment, 물리화학적 데이터 등 다양한 데이터 유형을 하나의 상호운용 가능한 프레임워크에 통합하여 프로파일링 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1적응형 정렬 임베딩 전략은 정확도를 희생시키지 않고 PSSM 기반 계통발생 프로파일링의 속도와 민감도를 향상시킬 수 있는가?
  • RQ2임베딩된 정렬 특징은 낮은 시퀀스 일치율 영역에서 이차 구조 요소 탐지에 어떻게 기여하는가?
  • RQ3임베딩된 정렬 측정치는 산통막 도메인의 구조 및 기능 분류에 얼마나 기여하는가?
  • RQ4시퀀스 임베딩은 다양한 생물학적 데이터를 PSSM 기반 프로파일에 통합하는 데 신뢰성 있고 확장 가능한 방법인가?

주요 결과

  • Ada-BLAST은 이전의 임베딩 방법 대비 최대 19배 더 빠른 계산 속도를 달성하면서도 유사도 탐지 민감도는 유사하게 유지한다.
  • 임베딩된 정렬 측정치는 특히 시퀀스 일치율의 '-twilight zone'(25% 이하)에서 이차 구조 요소의 식별 능력을 크게 향상시킨다.
  • 고립된 정렬 패tern을 활용함으로써 산통막 도메인의 구조 및 기능 분류 정확도를 향상시킬 수 있다.
  • 정렬, 물리화학적 성질, 유전체 데이터 등 다양한 데이터 유형을 통합된 데이터 공간에 통합함으로써 PSSM 기반 계통발생 프로파일의 정보량이 향상된다.
  • 낮은 일치율을 보이는 단백질 시퀀스에서 진화적 및 기능적 관계를 포착하는 데 있어 시퀀스 임베딩이 신뢰할 수 있고 정량적인 방법으로 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.