Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Interpreting Zoonotic Potential of Betacoronavirus Sequences With Attention

Kahini Wadhawan, Payel Das|arXiv (Cornell University)|2021. 08. 18.
Machine Learning in Bioinformatics참고 문헌 30인용 수 6
한 줄 요약

이 연구는 베타코로나우이루스 RdRp 서열의 원숭이 유래 전파 가능성을 예측하기 위해 주의 메커니즘을 강화한 LSTM 모델을 개발하여 94%의 정확도를 달성했다. 시퀀스 및 3차원 구조 수준에서의 주의 맵을 분석함으로써 바이러스 단백질 상호작용과 관련된 핵심 아미노산 영역을 규명하여 원숭이 유래 전파 메커니즘에 대한 해석 가능한 통찰을 제공한다.

ABSTRACT

Current methods for viral discovery target evolutionarily conserved proteins that accurately identify virus families but remain unable to distinguish the zoonotic potential of newly discovered viruses. Here, we apply an attention-enhanced long-short-term memory (LSTM) deep neural net classifier to a highly conserved viral protein target to predict zoonotic potential across betacoronaviruses. The classifier performs with a 94% accuracy. Analysis and visualization of attention at the sequence and structure-level features indicate possible association between important protein-protein interactions governing viral replication in zoonotic betacoronaviruses and zoonotic transmission.

연구 동기 및 목표

  • 효과적인 바이러스 감시에도 불구하고 새로 발견된 베타코로나우이루스의 원숭이 유래 전파 가능성을 예측하는 데 있어 중요한 격차를 해소하기 위해.
  • 복제에 관여하기는 하지만 숙주 세포 침입과는 관련이 없는, 바이러스 가족을 식별하는 데 쓰이지만 원숭이 유래 전파 위험을 파악하지 못하는 고정된 RdRp 서열의 한계를 극복하기 위해.
  • 설명 가능한 해석을 위해 주의 메커니즘을 활용하는 딥러닝 모델을 개발하여 원숭이 유래 전파 가능성을 해석하기 위해.
  • 모델의 주의 분석을 RdRp의 구조적 및 기능적 특성, 특히 바이러스 전파를 규명하는 단백질-단백질 상호작용 부위와 연결하기 위해.
  • 바이러스 서열 내에서 원숭이 유래 전파 가능성을 결정짓는 분자적 요인을 규명하여 전이 방지에 실질적인 통찰을 제공하기 위해.

제안 방법

  • 베타코로나우이루스의 RdRp 단백질 서열을 기반으로 주의 메커니즘을 강화한 장단기 기억(LSTM) 신경망을 훈련시켰다.
  • 기존 인간 감염 사례(예: SARS-CoV-1, MERS-CoV)를 바탕으로 이진 레이블을 사용하여 원숭이 유래 전파 가능성을 정의하였으며, 실험실에서 전파된 또는 모호한 서열은 제외하였다.
  • 모델 예측의 해석을 위해 시퀀스 내 중요한 아미노산 위치를 강조하는 주의 메커니즘을 적용하였다.
  • 6NUR PDB 구조(SARS-CoV nsp12와 보조 인자 포함)를 사용하여 동일한 서열을 기반으로 동종 모델링을 수행하여 주의 점수를 3차원 단백질 구조에 매핑하였다.
  • 각 아미노산 유형별 평균 주의 점수를 계산하고, 원숭이 유래 전파 가능성이 있는 클래스와 없는 클래스 간 주의 분포를 비교하였다.
  • 유사도가 70% 이상인 대표적인 서열을 대상으로 1차원 시퀀스 및 3차원 구조 수준에서 주의 맵을 시각화하여 功能적 모티프를 규명하였다.

실험 결과

연구 질문

  • RQ1주목적 기반 딥러닝 모델은 베타코로나우이루스 RdRp 서열의 원숭이 유래 전파 가능성을 정확하게 예측할 수 있는가?
  • RQ2RdRp 서열 내에서 원숭이 유래 전파 가능성을 가장 잘 예측하는 아미노산 위치는 어디이며, 이는 알려진 기능적 부위와 어떻게 관련이 있는가?
  • RQ3구조 수준에서 원숭이 유래 전파 가능성이 있는 서열과 없는 서열 간 주의 패턴은 어떻게 다를까?
  • RQ43차원 단백질 구조에 그려진 주의 맵은 바이러스 복제 및 전파에 관여하는 핵심 단백질-단백질 상호작용과 관련이 있는가?
  • RQ5주의 패턴은 숙주 세포 침입 또는 복제 효율성과 같은 알려진 원숭이 유래 전파 메커니즘과 어느 정도 관련이 있는가?

주요 결과

  • 주의 메커니즘을 강화한 LSTM 모델은 베타코로나우이루스 RdRp 서열 전반에서 원숭이 유래 전파 가능성을 94%의 정확도로 예측하였다.
  • 주의 분석을 통해 원숭이 유래 전파 가능성이 있는 서열은 복제 및 숙주 상호작용에 관여하는 알려진 기능 도메인 근처의 특정 단백질 영역을 일관되게 강조하는 것으로 나타났다.
  • 모델는 원숭이 유래 전파 가능성이 있는 클래스와 없는 클래스 간 주의 분포에 유의미한 차이를 보였으며, 특히 RdRp 복합체 내 단백질-단백질 상호작용에 관련된 잔류물에 더 높은 주의를 기울였다.
  • 3차원 구조 수준에서의 주의 맵 시각화 결과, 원숭이 유래 전파 가능성이 있는 서열에서 높은 주의를 기울이는 영역이 nsp7/nsp8 결합 부위와 RdRp의 촉매 부위와 정렬되어 있어 기능적 관련성이 높다고 판단되었다.
  • 짧은 서열(200–300 아미노산)의 경우에도 모델는 높은 신뢰도(>90%)를 유지하며, 긴 서열과 유사한 주의 패턴을 보여, 길이에 관계없이 안정적인 성능을 보였다.
  • 기존 딥러닝 모델에 비해 모델의 주의 패턴은 더 해석 가능하고 생물학적으로 의미 있는 것으로 나타났으며, 바이러스 전파 메커니즘과 직접적인 연결 고리를 제공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.