[論文レビュー] Prediction of residue-residue contacts from protein families using similarity kernels and least squares regularization
本稿では、複数配列アラインメントからの標本共分散行列を正則化最小二乗法(RLS)を用いて逆行列化することで、タンパク質の残基-残基接触を高速かつ高精度に予測する手法を提案する。固定された正則化パラメータを適用し、部分相関を計算することで、誤った伝達的相関を効果的に除去し、plmDCAなどの最先端手法と同等の性能を達成するとともに、特に長いタンパク質スーパーファミリーにおいて顕著に高速である。
One of the most challenging and long-standing problems in computational biology is the prediction of three-dimensional protein structure from amino acid sequence. A promising approach to infer spatial proximity between residues is the study of evolutionary covariance from multiple sequence alignments, especially in light of recent algorithmic improvements and the fast growing size of sequence databases. In this paper, we present a simple, fast and accurate algorithm for the prediction of residue-residue contacts based on regularized least squares. The basic assumption is that spatially proximal residues in a protein coevolve to maintain the physicochemical complementarity of the amino acids involved in the contact. Our regularized inversion of the sample covariance matrix allows the computation of partial correlations between pairs of residues, thereby removing the effect of spurious transitive correlations. The method also accounts for low number of observations by means of a regularization parameter that depends on the effective number of sequences in the alignment. When tested on a set of protein families from Pfam, we found the RLS algorithm to have performance comparable to state-of-the-art methods for contact prediction, while at the same time being faster and conceptually simpler.
研究の動機と目的
- タンパク質スーパーファミリーからの進化的共分散を用いて、残基-残基接触を高速かつ高精度に予測する手法の開発。
- 正則化行列逆行列を用いた部分相関の計算により、共進化信号における誤った伝達的相関の課題に取り組む。
- 計算複雑性を低減しつつ、特に長いタンパク質配列においても高い精度を維持する。
- 多様なPfamファミリーにおける本手法の性能を評価し、PSICOV や plmDCA などの最先端手法と比較する。
- 信頼できる接触予測には、有効な配列数(M_eff)が1000以上であることが必要であることを示す。
提案手法
- 本手法は、正則化最小二乗法(RLS)を用い、標本共分散行列 S を式 Θ = (S² + ηId)⁻¹S により逆行列化する。ここで η は固定された正則化パラメータである。
- 正則化は、複数配列アラインメントにおける有効な配列数(M_eff)に依存し、サンプル数が少ない場合の影響を緩和する。
- 部分相関を計算することで、残基ペア間の間接的・伝達的相関を除去し、直接の共進化信号を特定する。
- 希少または観測されない残基ペアに対応するため、擬似カウント(λ)と配列重み(w(p))を用いてアミノ酸頻度と補正された共分散行列を計算する。
- 本手法は、擬似カウントと有効な配列数の両方を組み込んだ修正された共分散行列構築法を適用し、推定値の安定化を図る。
- アルゴリズムは計算的に効率的であり、257残基の長大なタンパク質ドメインに対しても、数秒で接触予測が可能である。主なボトル neck は行列逆行列ではなく、配列重み付け処理である。
実験結果
リサーチクエスチョン
- RQ1単純な正則化最小二乗法アプローチが、plmDCA や PSICOV などの最先端手法と同等の接触予測精度を達成できるか。
- RQ2正則化最小二乗法の性能が、複数配列アラインメントにおける有効な配列数(M_eff)にどのように依存するか。
- RQ3特に長いタンパク質ファミリーにおいて、RLS手法が既存手法をどれほど速く上回るか。
- RQ4RLS手法が短距離・中距離・長距離の残基接触をどれほど正確に予測できるか。
- RQ5伝達的相関をフィルタリングすることで、直接の共進化信号を信頼できる形で同定できるか。
主な発見
- 15個のPfamファミリーのセットにおいて、RLSアルゴリズムは、上位 L/5 および L/3 の接触について、PSICOV や plmDCA を上回る陽性予測値を達成した。
- 少なくとも1,000個の固有配列を持つ10個のランダムに選択されたPfamファミリーの独立セットにおいて、RLSはPSICOVを上回り、plmDCA と同等の精度を示した。
- RLS手法は、plmDCA に対して10倍の高速化を達成した。257残基のタンパク質(PF00001)では、RLSは21.9秒、plmDCA は2429.5秒を要した。
- 最適な正則化パラメータ η′ は、15ファミリーのベンチマークセットにおいて約1000であった。これは、パrameterチューニングに対して高いロバストネスを示している。
- 性能は M_eff に強く依存しており、信頼できる予測には少なくとも1,000個の非相同配列が必要である。これは、過去の推定値(約5L)と一致する。
- 配列重み付けを単純化しても本手法は有効であることが示され、アラインメント前処理の小さな変更に対しても、コアとなるRLS逆行列が頑健であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。