Skip to main content
QUICK REVIEW

[논문 리뷰] TaxDiff: Taxonomic-Guided Diffusion Model for Protein Sequence Generation

Lin Zongying, Hao Li|arXiv (Cornell University)|2024. 02. 27.
Microbial Metabolic Engineering and Bioproduction인용 수 4
한 줄 요약

TaxDiff는 생물학적으로 안정된 단백질을 생성할 수 있도록 각 트랜스포머 블록에 분류학적 정보를 통합한 새로운 확산 모델로, 전역 및 국소적 어텐션을 패치화 메커니즘을 통해 조합함으로써 무조건적 및 분류학적 지도형 생성에서 최고 성능을 달성한다. 이는 기존 모델을 능가하는 구조적 지표를 확보하면서도 기존 확산 모델 대비 추론 시간을 25%로 줄였다.

ABSTRACT

Designing protein sequences with specific biological functions and structural stability is crucial in biology and chemistry. Generative models already demonstrated their capabilities for reliable protein design. However, previous models are limited to the unconditional generation of protein sequences and lack the controllable generation ability that is vital to biological tasks. In this work, we propose TaxDiff, a taxonomic-guided diffusion model for controllable protein sequence generation that combines biological species information with the generative capabilities of diffusion models to generate structurally stable proteins within the sequence space. Specifically, taxonomic control information is inserted into each layer of the transformer block to achieve fine-grained control. The combination of global and local attention ensures the sequence consistency and structural foldability of taxonomic-specific proteins. Extensive experiments demonstrate that TaxDiff can consistently achieve better performance on multiple protein sequence generation benchmarks in both taxonomic-guided controllable generation and unconditional generation. Remarkably, the sequences generated by TaxDiff even surpass those produced by direct-structure-generation models in terms of confidence based on predicted structures and require only a quarter of the time of models based on the diffusion model. The code for generating proteins and training new versions of TaxDiff is available at:https://github.com/Linzy19/TaxDiff.

연구 동기 및 목표

  • 무조건적 단백질 서열 생성의 한계를 해결하기 위해, 생물학적 응용에서 무작위 생성이 광범위한 필터링을 필요로 한다는 점을 다루기 위해.
  • 생물학적 분류학을 조건 신호로 통합하여 세밀한 제어가 가능한 단백질 설계를 가능하게 하기 위해.
  • 하이브리드 어텐션 메커니즘을 사용하여 생성된 단백질 서열의 구조 일관성과 모델링 정확도를 향상시키기 위해.
  • 기존 확산 기반 단백질 생성 모델 대비 성능을 유지하거나 향상시키면서도 추론 시간을 단축시키기 위해.

제안 방법

  • 노이즈 제거 트랜스포머 블록의 모든 레이어에 분류학적 제어 기능을 통합하여 종 또는 가족 분류 기반의 조건부 생성을 가능하게 한다.
  • 전체 서열에 대한 전역 어텐션과 고정 크기의 아미노산 패치(예: 16개 잔기)에 대한 국소 어텐션을 조합하는 패치화 어텐션 메커니즘을 제안한다.
  • 과도하게 세분화된 UniProt 분류를 가족 및 종 수준에서 재분류하여 훈련 안정성과 제어 정밀도를 향상시킨다.
  • EvoDiff와 유사한 확산 기반 생성 프레임워크를 채택하여 공통 잠재 공간 내에서 서열과 구조를 동시에 생성한다.
  • 무조건적 및 조건부 생성을 위한 공통 아키텍처를 사용하여 다양한 생물학적 설계 작업에 유연하게 적응할 수 있도록 한다.
  • 구조 예측 및 평가에 OmegaFold를 활용하며, pLDDT, TM-score, RMSD, Fident를 핵심 지표로 사용하여 생성된 서열 품질을 평가한다.

실험 결과

연구 질문

  • RQ1분류학적 정보는 생물학적으로 타당한 단백질 서열의 조건부 생성에 효과적으로 활용될 수 있는가?
  • RQ2전역 및 국소 어텐션 메커니즘의 조합은 생성된 단백질의 구조적 및 서열 수준의 품질에 어떤 영향을 미치는가?
  • RQ3패치화 어텐션 메커니즘은 표준 자기어텐션 대비 생성 효율성과 구조 일관성에 얼마나 기여하는가?
  • RQ4TaxDiff는 무조건적 및 분류학적 지도형 단백질 서열 생성 벤치마크에서 최신 기술 모델과 비교해 어떻게 성능을 내는가?
  • RQ5기존 확산 기반 모델 대비 TaxDiff는 더 높은 구조적 신뢰도와 더 낮은 추론 시간을 갖는 단백질 서열을 생성할 수 있는가?

주요 결과

  • 무조건적 단백질 서열 생성에서 TaxDiff는 기준 모델 대비 Fident 점수 7.13% 향상 및 TM-score 11.93% 향상하여, 구조 기반 모델조차도 뛰어넘는 성능을 달성했다.
  • 분류학적 지도형 생성에서 TaxDiff의 pLDDT 점수는 다른 서열 모델보다 유의미하게 높았으며, 자연 단백질 수준에 가까워 높은 구조적 신뢰도를 나타냈다.
  • 1,000개의 단백질 서열을 생성하는 데 단 24분이 소요되었으며, 이는 다른 확산 기반 모델 대비 1/4에서 2/3 수준의 시간으로, 뛰어난 추론 효율성을 입증했다.
  • 전역 및 국소 어텐션의 조합(방법 A)이 모든 지표에서 최고 성능을 보였으며, 국소 어텐션 전용(방법 E) 역시 표준 어텐션 설정을 능가하는 성능을 보였다.
  • 16개 아미노산 패치로 나누었을 때 구조 지표인 TM-score와 RMSD에서 최적의 결과를 얻었으며, 더 큰 패치(64개 잔기)는 Fident와 같은 서열 수준 지표에서 향상되었다.
  • 실험 결과, 단백질 서열에서 전체 서열 어텐션보다 국소 어텐션의 효과가 뛰어나다는 것이 확인되었으며, 이는 언어에서 '짧은 문장'과 유사한 고유한 국소 구조 패턴이 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.