Skip to main content
QUICK REVIEW

[論文レビュー] One-shot screening of potential peptide ligands on HR1 domain in COVID-19 glycosylated spike (S) protein with deep siamese network

Nicoló Savioli|arXiv (Cornell University)|Apr 5, 2020
SARS-CoV-2 and COVID-19 Research参考文献 37被引用数 7
ひとこと要約

本研究では、従来のドッキング手法を回避して、SARS-CoV-2スパイクたんぱく質の保存領域であるHR1ドメインを標的にするペプチドリガンドを迅速にスクリーニングするためのワンショットシameseニューラルネットワーク(SNN)を導入した。2019-nCoV、HIV-1、エボラウイルスの配列で学習させたモデルは、83.29%の感受性を達成し、ペプチジルプロリルcis-transイソメラーゼ(PPIase)が93%の信頼度で高い親和性を示すリガンドであると同定した。これは、シクロスポリンAのようなPPIase阻害剤の再利用が、潜在的な抗ウイルス薬である可能性を示唆している。

ABSTRACT

The novel coronavirus (2019-nCoV) has been declared to be a new international health emergence and no specific drug has been yet identified. Several methods are currently being evaluated such as protease and glycosylated spike (S) protein inhibitors, that outlines the main fusion site among coronavirus and host cells. Notwithstanding, the Heptad Repeat 1 (HR1) domain on the glycosylated spike (S) protein is the region with less mutability and then the most encouraging target for new inhibitors drugs.The novelty of the proposed approach, compared to others, lies in a precise training of a deep neural network toward the 2019-nCoV virus. Where a Siamese Neural Network (SNN) has been trained to distingue the whole 2019-nCoV protein sequence amongst two different viruses family such as HIV-1 and Ebola. In this way, the present deep learning system has precise knowledge of peptide linkage among 2019-nCoV protein structure and differently, of other works, is not trivially trained on public datasets that have not been provided any ligand-peptide information for 2019-nCoV. Suddenly, the SNN shows a sensitivity of $83\%$ of peptide affinity classification, where $3027$ peptides on SATPdb bank have been tested towards the specific region HR1 of 2019-nCoV exhibiting an affinity of $93\%$ for the peptidyl-prolyl cis-trans isomerase (PPIase) peptide. This affinity between PPIase and HR1 can open new horizons of research since several scientific papers have already shown that CsA immunosuppression drug, a main inhibitor of PPIase, suppress the reproduction of different CoV virus included SARS-CoV and MERS-CoV. Finally, to ensure the scientific reproducibility, code and data have been made public at the following link: https://github.com/bionick87/2019-nCoV

研究の動機と目的

  • 変異の少ないSARS-CoV-2スパイクタンパク質の保存領域であるHR1ドメインを標的にすることで、効果的なSARS-CoV-2治療薬の開発に向けた緊急のニーズに対応する。
  • 2019-nCoV特有のリガンドデータを欠如させた公的データセットに依存する従来のディープラーニング手法の限界を克服する。
  • 大規模なラベル付きトレーニングデータセットを必要としない、高親和性ペプチドリガンドをHR1ドメインに特定するワンショット学習アプローチを開発する。
  • SATPdbデータベースに登録された既存のペプチドを、迅速かつ計算的に効率よくスクリーニングし、抗ウイルス薬としての再利用可能性を評価する。
  • 科学的再現性を確保し、SARS-CoV-2および関連コロナウイルスのHR1標的阻害剤の発見を加速するための再現可能でオープンソースのフレームワークを提供する。

提案手法

  • 2019-nCoV、HIV-1、エボラウイルスのタンパク質配列画像を用いて、2019-nCoVの配列と他のウイルス群を区別するためのシamese畳み込みニューラルネットワーク(SNN)を学習する。
  • SARS-CoV-2スパイクタンパク質のHR1ドメインを、256×256ピクセルの8つの重複する10アミノ酸サブペプチド画像に変換する。
  • SATPdbに登録された3,027種のペプチドすべてを、256×256ピクセルの画像に変換し、SNNへの入力として使用する。
  • SNNを用いて、各SATPdbペプチドと8つのHR1サブペプチド間の類似度スコアをペairワイズに計算し、シグモイド出力を平均化する。
  • 大規模データセットでのエンドツーエンド学習を回避するため、特徴抽出の向上を図るために事前学習済みのAlexNetバックボーンを活用する。
  • ラベル付きリガンドデータが2019-nCoV用に十分に存在しない状況下でも、過学習を低減し一般化性能を向上させるために、ワンショット学習を活用する。

実験結果

リサーチクエスチョン

  • RQ1大規模なラベル付きデータセットに依存せずに、2019-nCoVのHR1ドメインに対して高親和性を示すペプチドリガンドを効果的に同定できるか?
  • RQ2ウイルスタンパク質配列で事前学習したネットワークは、初期化から学習を開始するか、より深いアーキテクチャを用いる場合と比較して感受性と一般化性能が向上するか?
  • RQ3既存のデータベースに登録されたペプチドの中で、HR1ドメインに対して強い予測親和性を示すものがあるか?これは薬剤再利用の可能性を示唆する。
  • RQ4PPIase阻害剤が他のコロナウイルスに対して既知の抗ウイルス効果を示すという生物学的メカニズムと、モデルの予測が整合するか?
  • RQ52019-nCoV用の真のリガンドデータが入手不可である状況下で、SNNアプローチは従来の教師あり手法を上回る性能を示すか?

主な発見

  • 事前学習済みAlexNetをベースとするシameseニューラルネットワークは、2019-nCoVのタンパク質配列をHIV-1やエボラウイルスの配列から識別する際、83.29%の感受性を達成し、非事前学習AlexNetおよびより深いResNeXtモデルを上回った。
  • SATPdbからスクリーニングされた3,027種のペプチドの中で、ペプチジルプロリルcis-transイソメラーゼ(PPIase)ペプチドが、SARS-CoV-2のHR1ドメインに対して予測親和性が最も高かった。信頼度は93%であった。
  • 浅いアーキテクチャで事前学習されたネットワークが優れた性能を示した。これは、限られたトレーニングデータ環境下では、より深いモデルよりも単純なアーキテクチャが好ましいことを示唆している。
  • HR1とPPIase間の高い予測親和性は、既存の生物学的証拠と整合しており、シクロスポリンA(PPIase阻害剤)がSARS-CoVおよびMERS-CoVの細胞培養内での増殖を阻害することが知られている。
  • 本研究では、2019-nCoV用のリガンド結合データが事前に存在しない状況下でも、ウイルスタンパク質配列を用いたワンショット学習が、有望なリガンドを効果的に同定できることを示した。
  • コードとデータの完全なセットは、https://github.com/bionick87/2019-nCoV で公開されており、科学的再現性を確保するとともに、さらなる検証を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。