[論文レビュー] Comparison of amino acid occurrence and composition for predicting protein folds
本論文は、アミノ酸残基の出現頻度(組成や配列ではなく)を用いた線形判別分析(LDA)に基づく手法を提案する。この手法は、30の主要なフォールドに分類される1,612個のグロビュラーなタンパク質を対象に37%の感受性を達成し、複雑な手法を上回るか同等の性能を示す一方で、計算効率が高く、大規模データセットに対してもスケーラブルである。
Background:Prediction of protein three-dimensional structures from amino acid sequences is a long-standing goal in computational/molecular biology. The successful discrimination of protein folds would help to improve the accuracy of protein 3D structure prediction. Results: In this work, we propose a method based on linear discriminant analysis (LDA) for recognizing proteins belonging to 30 different folds using the occurrence of amino acid residues in a set of 1612 proteins. The present method could discriminate the globular proteins from 30 major folding types with the sensitivity of 37%, which is comparable to or better than other methods in the literature. A web server has been developed for predicting the folding type of the protein from amino acid sequence and it is available at http://granular.com/PROLDA/. Conclusions:Linear discriminant analysis based on amino acid occurrence could successfully recognize protein folds. The present method has several advantages such as, (i) it directly predicts the folding type of a protein without performing pair-wise comparisons, (ii) it can discriminate folds among large number of proteins and (iii) it is very fast to obtain the results. This is a simple method, which can be easily incorporated in any other structure prediction algorithms.
研究の動機と目的
- アミノ酸配列からのフォールド予測のための単純で高速かつスケーラブルな手法を開発すること。
- 多様な構造的クラスにわたる信頼できるフォールド認識に、アミノ酸残基の出現頻度のみが十分な情報を保持しているかどうかを調査すること。
- フォールドのタンパク質数が著しく不均衡な状況において、LDAにおける再重み付けの影響を評価すること。
- タンパク質構造予測における実用的応用を可能とする、無料で利用可能なWebサーバーの構築。
- 神経ネットワークやSVMといったより複雑なモデルと比較して、この単純な手法がフォールド認識タスクでどのように性能を発揮するかを評価すること。
提案手法
- 各タンパク質について20種類のアミノ酸残基の出現回数を計算し、1つのタンパク質あたり20次元のベクトルを形成する。
- 線形判別分析(LDA)をこれらのベクトルに適用し、クラス間散乱(S_B)と全散乱(S_T)の比を最大化する(S_B / S_T)ことで、30の構造的フォールドに分類する。
- LDAの2つの変種を用いる:1つは再重み付け(W_k = 1)を施し、サイズにかかわらず各フォールドが性能に等しく寄与するようにし、もう1つは再重み付けなし(W_k = N_k)で全体の正答率を最適化する。
- LDA変換により、アミノ酸数の線形結合(z_i = a_0 + Σ a_j * n_ij)が得られ、これが判別軸に沿ってフォールドを最良に分離する。
- LDA計算にはRのMASSライブラリを用い、標準的なハードウェアでも数秒で実行可能である。
- ユーザーがタンパク質配列を入力し、LDAモデルを用いて予測されたフォールド分類を即座に得られるWebサーバー(http://granular.com/PROLDA/)を実装した。
実験結果
リサーチクエスチョン
- RQ1アミノ酸残基の出現頻度のみで、配列ベースや構造的特徴を一切用いなくても、高い感受性でタンパク質フォールドを予測できるか?
- RQ2フォールドサイズに顕著な差がある状況において、LDAにおける再重み付けはフォールド認識性能にどのように影響するか?
- RQ3この単純なLDAベースの手法は、ニューラルネットワークやSVMといったより複雑なモデルと比較して、フォールド予測でどの程度の性能を示すか?
- RQ4トレーニングデータが不均衡であっても、この手法が30のフォールドすべてで高い感受性を達成できるか?
- RQ5この手法は、膨大な計算リソースを要せず、大規模なタンパク質フォールド予測に十分にスケーラブルで効率的か?
主な発見
- 本手法は、30の主要フォールドに分類される1,612個のグロビュラーなタンパク質を対象に、感受性37%を達成し、文献に報告された他の手法と同等またはそれ以上の性能を示した。
- LDAにおける再重み付けは、フォールド間の性能バランスを顕著に改善し、フォールド平均感受性と全体感受性の差を約10%からより均等な分布にまで縮小した。
- 本手法は、ヘリカルアップ・アンド・ダウンバンドル(a.24)とEFハンド様フォールド(a.39)の予測において、シャンとチュウ(2007)を上回った。それぞれ39%および44%の正答率を示したのに対し、彼らの報告は30.5%および24%であった。
- 不均衡なデータセットに対しても本手法は頑健であり、フォールドごとの感受性は1フォールドあたりのタンパク質数と相関を示したが、再重み付けにより効果的に是正された。
- 本手法の計算効率のおかげで、ペairワイズ比較を一切行わず、1回の実行でタンパク質を分類可能であり、大規模な構造予測パイプラインへの統合に適している。
- 無料で利用可能なWebサーバー(http://granular.com/PROLDA/)により、アミノ酸配列からのリアルタイムフォールド予測が可能であり、複数の再重み付け戦略をサポートしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。