Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Graph Convolutional Network and LSTM based approach for predicting drug-target binding affinity

Shrimon Mukherjee, Madhusudan Ghosh|arXiv (Cornell University)|2022. 01. 18.
Computational Drug Discovery Methods인용 수 6
한 줄 요약

이 논문은 약물-타겟 결합 친화도를 예측하기 위해 그래프 컬러이션 네트워크(GCN)와 양방향 장기 단기 기억(Bi-LSTM) 네트워크를 조합한 새로운 딥러닝 모델인 DeepGLSTM을 제안한다. 약물에 대해 다중 척도 파wr 그래프 표현을, 단백질 서열에 대해 Bi-LSTM를 활용하여, 다양한 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, SARS-CoV-2 바이러스 단백질과 높은 결합 친화도를 보이는 18종의 FDA 승인 약물도 규명하였다.

ABSTRACT

Development of new drugs is an expensive and time-consuming process. Due to the world-wide SARS-CoV-2 outbreak, it is essential that new drugs for SARS-CoV-2 are developed as soon as possible. Drug repurposing techniques can reduce the time span needed to develop new drugs by probing the list of existing FDA-approved drugs and their properties to reuse them for combating the new disease. We propose a novel architecture DeepGLSTM, which is a Graph Convolutional network and LSTM based method that predicts binding affinity values between the FDA-approved drugs and the viral proteins of SARS-CoV-2. Our proposed model has been trained on Davis, KIBA (Kinase Inhibitor Bioactivity), DTC (Drug Target Commons), Metz, ToxCast and STITCH datasets. We use our novel architecture to predict a Combined Score (calculated using Davis and KIBA score) of 2,304 FDA-approved drugs against 5 viral proteins. On the basis of the Combined Score, we prepare a list of the top-18 drugs with the highest binding affinity for 5 viral proteins present in SARS-CoV-2. Subsequently, this list may be used for the creation of new useful drugs.

연구 동기 및 목표

  • 더 빠른 약물 재편용을 위해 약물-타겟 결합 친화도 예측 성능을 향상시키는 딥러닝 모델을 개발하는 것.
  • 기존 모델이 약물 및 단백질 데이터의 구조적 및 순차적 정보를 포괄하지 못하는 한계를 해결하는 것.
  • SARS-CoV-2 바이러스 단백질과 높은 친화도를 보이는 FDA 승인 약물들을 규명하는 것.
  • Davis, KIBA, DTC, Metz, ToxCast, STITCH 등 여러 벤치마크 데이터셋에서 모델의 성능을 평가하는 것.

제안 방법

  • SMILES 표기법으로부터 약물 분자의 다중 척도 구조적 특징을 캡처하기 위해, 파wr 그래프 표현(A, A², A³)을 사용하는 3단계의 GCN 블록을 활용한다.
  • 단백질 아미노산 서열을 처리하여 서열 데이터의 맥락적 정보 및 장거리 상관관계를 학습하기 위해 양방향 LSTM를 사용한다.
  • 결합 친화도 예측의 일관성을 향상시키기 위해 pKd 점수와 KIBA 점수를 통합한 통합 점수(Cb)를 도입한다.
  • 모델는 Davis, KIBA, DTC, Metz, ToxCast, STITCH 등 6개의 공개 데이터셋에서 엔드 투 엔드로 훈련된다.
  • 각 구성 요소(예: GCN 블록, Bi-LSTM)의 기여도를 평가하기 위해 탈락 분석(Ablation study)을 실시하며, 평가 지표로 MSE를 사용한다.
  • 최종 모델는 2,304종의 FDA 승인 약물과 SARS-CoV-2 바이러스 단백질 간의 결합 친화도를 예측하는 데 적용된다.

실험 결과

연구 질문

  • RQ1하이브리드 GCN-Bi-LSTM 아키텍처가 기존 모델보다 약물-타겟 결합 친화도 예측에서 뛰어난 성능을 보일 수 있는가?
  • RQ2다양한 파워 그래프 표현(A, A², A³)이 약물 분자의 구조적 정보를 어떻게 기여하는가?
  • RQ3GCN 블록과 Bi-LSTM가 각각 약물 및 단백질 특징을 모델링하는 데 기여하는 상대적 기여도는 어떠한가?
  • RQ4제안된 통합 점수(Cb)가 다양한 결합 친화도 지표 간의 일관성 향상에 기여하는가?
  • RQ5SARS-CoV-2 바이러스 단백질과 가장 높은 예측된 결합 친화도를 보이는 FDA 승인 약물은 무엇인가?

주요 결과

  • DeepGLSTM는 Davis, KIBA, DTC, Metz, ToxCast, STITCH 데이터셋에서 기존 모델인 GraphDTA를 초월하여 최신 기술 수준(SOTA) 성능을 달성하였다.
  • 탈락 분석 결과, A³ 입력을 사용하는 세 번째 GCN 블록과 Bi-LSTM가 모델 성능 향상에 가장 크게 기여하는 것으로 나타났다.
  • 다중 척도 파워 그래프 입력(A, A², A³)을 사용할 경우 단일 입력 변형 대비 상당히 낮은 MSE 점수를 기록하였다.
  • 이소프로테레놀, 메드리손, 라인던, 메카밀라민, 옥시벤조엔, 모르핀, 에스트리올, L-멘톨, 에르고칼시페롤, 메토크시페나민은 높은 Cb 점수를 기록한 상위 수용체 결합 약물로 규명되었다.
  • 라크툴로스, 솔비톨, 미갈라스타트, 가이아코올, 사이아니다놀, 만니톨, 아르부틴, 벤조산은 높은 Cb 점수를 기록한 상위 비수용체 결합 약물로 규명되었다.
  • 본 연구는 SARS-CoV-2에 대한 임상 시험 검증을 위한 우선순위가 매겨진 18종의 고친화도 약물 리스트를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.