Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable Structured Learning with Sparse Gated Sequence Encoder for Protein-Protein Interaction Prediction

Kishan KC, Feng Cui|arXiv (Cornell University)|Oct 16, 2020
Machine Learning in Bioinformatics参考文献 26被引用数 4
ひとこと要約

本論文は、アミノ酸配列からの解釈可能なタンパク質-タンパク質相互作用(PPI)予測のためのスパースゲーテッド双方向GRUモデルを提案する。構造的スパarsityとガウス型潜在空間を統合することで、モデルは効率的に配列を符号化し、生物学的に関連するモチーフを明確に特定する。ユリイカおよびヒトのPPIデータセットにおいて、最先端の手法を上回る性能を発揮するとともに、解釈可能性が向上している。

ABSTRACT

Predicting protein-protein interactions (PPIs) by learning informative representations from amino acid sequences is a challenging yet important problem in biology. Although various deep learning models in Siamese architecture have been proposed to model PPIs from sequences, these methods are computationally expensive for a large number of PPIs due to the pairwise encoding process. Furthermore, these methods are difficult to interpret because of non-intuitive mappings from protein sequences to their sequence representation. To address these challenges, we present a novel deep framework to model and predict PPIs from sequence alone. Our model incorporates a bidirectional gated recurrent unit to learn sequence representations by leveraging contextualized and sequential information from sequences. We further employ a sparse regularization to model long-range dependencies between amino acids and to select important amino acids (protein motifs), thus enhancing interpretability. Besides, the novel design of the encoding process makes our model computationally efficient and scalable to an increasing number of interactions. Experimental results on up-to-date interaction datasets demonstrate that our model achieves superior performance compared to other state-of-the-art methods. Literature-based case studies illustrate the ability of our model to provide biological insights to interpret the predictions.

研究の動機と目的

  • ペairワイズ PPI モデリングにおけるシアンセイア・アーキテクチャの計算非効率性を解消すること。
  • PPI に関与する重要なアミノ酸残基を同定することで、モデルの解釈可能性を向上させること。
  • シーケンスのみのデータを用いて大規模 PPI 予測の性能を向上させること。
  • 学習されたアテンションを既知のタンパク質モチーフと一致させることで生物学的知見を提供すること。
  • 重複するペアワイズ符号化を回避するスケーラブルで効率的なフレームワークを構築すること。

提案手法

  • 可変長タンパク質配列からの文脈的・順序的表現を学習するため、双方向ゲーテッド再帰型ユニット(BiGRU)を採用する。
  • 不確実性を捉え、一般化性能を向上させるために、シーケンス表現を潜在ガウス分布としてモデル化する。
  • 重要な残基を強調するため、アミノ酸位置にスパースで学習可能な重みを割り当てる構造的スパースゲーティング機構を導入する。
  • 潜在分布間の統計的距離に基づく対照的損失関数を用い、相互作用するペアと非相互作用ペアを区別する。
  • スパarsityを制御し、生物学的モチーフとより良い一致を達成するために、fusedmax および sparsemax ゲーティング戦略を適用する。
  • 各ユニークなタンパク質をバッチ内ですべて一度だけ符号化することで、シアンセイアモデルにおけるペアワイズ符号化と比較して計算コストを削減する。

実験結果

リサーチクエスチョン

  • RQ1シーケンス符号化モデルは、スケールに応じて計算的にも効率的でありながら、優れたPPI予測性能を達成できるか?
  • RQ2スパースゲーティング機構は、配列から生物学的に関連するタンパク質モチーフを効果的に同定できるか?
  • RQ3モデルのアテンション機構は、Pfamなどのデータベースから得た既知の機能的モチーフと一致するか?
  • RQ4構造的スパarsityを用いることで、パラメータの重複を削減しながらも高い性能を維持できるか?
  • RQ5既存の最先端PPI予測器と比較して、モデルの解釈可能性はどの程度優れているか?

主な発見

  • 本モデルは、BioGRIDデータベースのユリイカおよびヒトPPIデータセットにおいて、最先端の性能を達成した。
  • fusedmax ゲーティングを用いることで、ヒトデータセットでは平均23.33%の選択アミノ酸がPfamモチーフと一致し、強い生物学的関連性を示した。
  • ユリイカデータセットでは、fusedmax ゲート機構によって選択されたアミノ酸の59.05%が既知のモチーフと一致しており、高い解釈可能性を示した。
  • 一回のバッチ内でユニークなタンパク質を一度だけ符号化することで、シアンセイアモデルのペアワイズ符号化と比較して、学習時間とメモリ使用量を削減した。
  • 可視化により、モデルの活性化領域がLSMドメイン(PF01423)やAP4複合体(PF14807)といった既知の機能ドメインに対応していることが確認された。
  • ケーススタディでは、LSM8、SMD2、RPC11などのタンパク質において、既知のモチーフ位置と一致する重要な残基を効果的に同定できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。