Skip to main content
QUICK REVIEW

[論文レビュー] Protein Folding Neural Networks Are Not Robust

Sumit Kumar Jha, Arvind Ramanathan|ArXiv.org|Sep 9, 2021
Protein Structure and Dynamics参考文献 16被引用数 11
ひとこと要約

この論文は、RoseTTAFoldが高い精度を示すものの、生物学的に小さな配列摂動に対しては頑健性に欠け、20 BLOSUM62単位の敵対的攻撃によってRMSDが0.119Åから34.162Åに変化することを示している。敵対的攻撃を用いた逆RMSDに基づく頑健性指標を提案し、実際の精度と強い相関(0.917)を示しており、信頼性の低い予測の特定に有効である。

ABSTRACT

Deep neural networks such as AlphaFold and RoseTTAFold predict remarkably accurate structures of proteins compared to other algorithmic approaches. It is known that biologically small perturbations in the protein sequence do not lead to drastic changes in the protein structure. In this paper, we demonstrate that RoseTTAFold does not exhibit such a robustness despite its high accuracy, and biologically small perturbations for some input sequences result in radically different predicted protein structures. This raises the challenge of detecting when these predicted protein structures cannot be trusted. We define the robustness measure for the predicted structure of a protein sequence to be the inverse of the root-mean-square distance (RMSD) in the predicted structure and the structure of its adversarially perturbed sequence. We use adversarial attack methods to create adversarial protein sequences, and show that the RMSD in the predicted protein structure ranges from 0.119Å to 34.162Å when the adversarial perturbations are bounded by 20 units in the BLOSUM62 distance. This demonstrates very high variance in the robustness measure of the predicted structures. We show that the magnitude of the correlation (0.917) between our robustness measure and the RMSD between the predicted structure and the ground truth is high, that is, the predictions with low robustness measure cannot be trusted. This is the first paper demonstrating the susceptibility of RoseTTAFold to adversarial attacks.

研究の動機と目的

  • RoseTTAFoldのような高精度なタンパク質折りたたみニューラルネットワーク(PFNN)が、生物学的に小さな配列摂動に対して頑健であるかどうかを調査すること。
  • わずかな配列変化への感受性により、予測されたタンパク質構造が信頼できない場合を特定すること。
  • 敵対的摂動に対する構造的感受性に基づいて、PFNN予測の信頼性を定量化する頑健性指標を開発すること。
  • 座標幾何学と距離幾何学の表現を比較し、PFNNに対する意味のある敵対的攻撃を生成する際の有効性を評価すること。
  • 計算コストを大幅に削減しながらも高い忠実度を維持する、証明可能な近似線形時間距離幾何学手法を提案すること。

提案手法

  • 敵対的攻撃は、BLOSUM62距離20単位以内で入力タンパク質配列を摂動させ、配列アラインメントスコアを用いて生物学的に妥当な変更を保証する。
  • 新たな頑健性指標は、元の配列と敵対的摂動を加えた対応する予測3次元構造間のRMSDの逆数として定義される。
  • タンパク質構造を距離幾何学で表現し、剛体変換に対して不変であるため、座標表現に起因するアーチファクトを回避する。
  • 計算複雑度をO(n²)からO(n)に削減する近似距離幾何学手法を提案し、正確なRMSDの少なくとも0.69倍を保証するとともに、A100 GPU上で14倍の高速化を達成した。
  • 頑健性指標と予測構造と真値のRMSDとの相関を評価し、信頼性の指標としての有効性を検証する。
  • 定量的評価のため、PyMOLを用いて元の構造と敵対的摂動を加えた構造をアライメントし、RMSD値を計算する。

実験結果

リサーチクエスチョン

  • RQ1生物学的に妥当な小さな配列摂動が、RoseTTAFoldにおける3次元タンパク質構造予測を著しく変化させる可能性があるか?
  • RQ2敵対的攻撃下で、さまざまなタンパク質配列におけるRoseTTAFold予測の頑健性はどのように変動するか?
  • RQ33次元座標ではなく距離幾何学を用いることで、タンパク質折りたたみニューラルネットワークに対する敵対的攻撃の質と信頼性が向上するか?
  • RQ4証明可能な近似距離幾何学手法を用いることで、計算コストを大幅に削減しながらも、敵対的構造生成の忠実度を維持できるか?
  • RQ5提案された頑健性指標は、実際の予測精度(真値とのRMSD)とどの程度相関するか?

主な発見

  • RoseTTAFoldは頑健性に極めて大きなばらつきを示し、20 BLOSUM62単位の敵対的摂動下で予測構造のRMSDが0.119Åから34.162Åまで変動する。
  • 元の予測と摂動後の予測間のRMSDの逆数として定義される頑健性指標は、真値とのRMSDと強い相関(0.917)を示しており、信頼性の指標としての有効性が検証された。
  • 距離幾何学に基づく敵対的攻撃法は、座標幾何学に基づく攻撃と比較して、最大37倍高いRMSDを生成し、感受性の検出能が優れていることが示された。
  • 提案された近似距離幾何学手法は、正確なRMSDの少なくとも69%を達成しながら、80GB A100 GPU上で実行時間を14倍短縮し、効率的かつ正確であった。
  • 一部のタンパク質(例:SFP1インターフェロン刺激因子)では、敵対的摂動によってRMSDが25.641Åにまで上昇し、高精度なモデルでも構造的不安定性が顕在化した。
  • 本研究は、RoseTTAFoldにおける敵対的脆弱性の最初の証拠を提示し、高リスクな生物学的AIアプリケーションにおける頑健性評価の必要性を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。