Skip to main content
QUICK REVIEW

[논문 리뷰] Autoregressive Enzyme Function Prediction with Multi-scale Multi-modality Fusion

Dingyi Rong, Wenzhuo Zheng|arXiv (Cornell University)|2024. 08. 11.
Machine Learning in BioinformaticsBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

MAPred는 다중 척도 단백질 서열 및 3Di-구조 표현을 이중 경로 네트워크를 통해 융합하는 새로운 자동회귀 딥러닝 모델로, 효소의 EC 번호를 예측한다. 기준 데이터셋에서 기존 방법들을 능가하며 (New-392: F1 0.610, Price: F1 0.493, New-815: F1 0.680), 계층적 EC 번호 구조를 활용하고 기능적 부위에 주의를 기울임으로써 뛰어난 정확도를 보여준다.

ABSTRACT

Accurate prediction of enzyme function is crucial for elucidating biological mechanisms and driving innovation across various sectors. Existing deep learning methods tend to rely solely on either sequence data or structural data and predict the EC number as a whole, neglecting the intrinsic hierarchical structure of EC numbers. To address these limitations, we introduce MAPred, a novel multi-modality and multi-scale model designed to autoregressively predict the EC number of proteins. MAPred integrates both the primary amino acid sequence and the 3D tokens of proteins, employing a dual-pathway approach to capture comprehensive protein characteristics and essential local functional sites. Additionally, MAPred utilizes an autoregressive prediction network to sequentially predict the digits of the EC number, leveraging the hierarchical organization of EC classifications. Evaluations on benchmark datasets, including New-392, Price, and New-815, demonstrate that our method outperforms existing models, marking a significant advance in the reliability and granularity of protein function prediction within bioinformatics.

연구 동기 및 목표

  • 기존의 EC 번호 예측 모델이 단순히 서열 또는 구조에 의존하고 EC 번호의 계층적 성격을 忽시하는 한계를 해결하기 위해.
  • 3Di 토큰을 사용하여 주로 아미노산 서열과 3차원 구조 표현을 통합함으로써 기능 예측 정확도를 향상시키기 위해.
  • 주의 시각화를 통해 핵심 기능 잔류물질을 식별하여 모델의 해석 가능성 향상시키기 위해.
  • 전체 단백질 맥락과 국소 기능 모티프를 모두 포착하는 다중 척도, 다중 모달 프레임워크 개발하기 위해.
  • EC 번호 예측을 순차적이고 자동회귀적 작업으로 모델링함으로써 효소 기능 예측의 새로운 범주를 설정하기 위해.

제안 방법

  • MAPred는 단백질 서열에서 3Di 토큰을 생성하기 위해 ProstT5를 사용하여 3차원 단백질 기하학적 표현을 가능하게 한다.
  • 이중 경로 아키텍처를 적용: 상호 배치된 서열-3Di 상호작용 주의를 사용한 전역 특징 추출기와 컬러블 신경망(CNNs)을 사용한 국소 특징 추출기.
  • 모델은 EC 번호의 네 자릿수를 순차적으로 예측하는 자동회귀 예측 헤드를 적용하여 그들의 계층적 종속성을 모델링한다.
  • 서열 및 3Di 입력을 네트워크의 초기 단계에서 융합하여 공동 표현 학습을 가능하게 한다.
  • 주의 메커니즘을 사용하여 모델 예측을 해석하고, 3차원 단백질 구조상에 샐리언시 맵을 시각화하여 기능 영역을 식별한다.
  • 제거 실험을 통해 개별 구성 요소(전역 경로, 국소 경로, 자동회귀 헤드)를 비활성화하여 기여도를 평가한다.

실험 결과

연구 질문

  • RQ1서열과 3Di-구조 표현을 융합하는 다중 모달, 다중 척도 딥러닝 모델이 EC 번호 예측 정확도를 향상시킬 수 있는가?
  • RQ2EC 번호 예측을 자동회귀적 순차 작업으로 모델링하면 계층적 레이블 구조를 활용해 성능을 향상시킬 수 있는가?
  • RQ3모델은 촉매 중심 및 기질 결합 영역과 같은 생물학적으로 관련된 기능적 부위에 주의를 기울일 수 있는가?
  • RQ4전역 및 국소 특징 추출 경로는 예측 성능에 각각 어떻게 기여하는가?
  • RQ5다중 모달 입력(서열 + 3Di)이 단일 모달 입력보다 얼마나 뛰어나게 성능을 높이는가?

주요 결과

  • MAPred는 New-392 데이터셋에서 F1 점수 0.610을 기록하여 기존 모델들을 능가한다.
  • Price 데이터셋에서는 F1 점수 0.493을 기록하여 도전적이고 다양한 효소 집합에서도 뛰어난 성능을 보여준다.
  • New-815 벤치마크에서는 F1 점수 0.680을 달성하여 기능 예측의 높은 일반화 능력과 정밀도를 보여준다.
  • 제거 실험 결과, 전역 특징 추출 경로를 제거하면 성능 저하가 가장 심각한 것으로 나타났다 (New-392: F1 0.651 → 0.354), 이는 그 중요성을 강조한다.
  • 국소 특징 추출 경로도 상당한 기여를 하지만 전역 경로보다는 덜 중요함을 확인하여 국소 구조 모티프의 중요성을 시사한다.
  • 자동회귀 예측 헤드를 비활성화하면 성능이 떨어지므로, EC 번호의 계층적 구조를 모델링함으로써 정확도 향상이 가능하다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.