Skip to main content
QUICK REVIEW

[논문 리뷰] Protein Folding Neural Networks Are Not Robust

Sumit Kumar Jha, Arvind Ramanathan|ArXiv.org|2021. 09. 09.
Protein Structure and Dynamics참고 문헌 16인용 수 11
한 줄 요약

이 논문은 높은 정확도를 보이는 RoseTTAFold가 생물학적으로 작은 서열 변화에 대해 강건성이 떨어지며, 적대적 공격으로 인해 RMSD가 0.119Å에서 34.162Å로 변화함을 입증한다. BLOSUM62 기준 20 단위 이내의 변화에서 발생한다. 원본 및 변형된 예측 간의 역 RMSD를 기반으로 한 강건성 지표를 제안하며, 실제 정확도와 높은 상관관계(0.917)를 보이며 신뢰할 수 없는 예측을 식별하는 데 기여한다.

ABSTRACT

Deep neural networks such as AlphaFold and RoseTTAFold predict remarkably accurate structures of proteins compared to other algorithmic approaches. It is known that biologically small perturbations in the protein sequence do not lead to drastic changes in the protein structure. In this paper, we demonstrate that RoseTTAFold does not exhibit such a robustness despite its high accuracy, and biologically small perturbations for some input sequences result in radically different predicted protein structures. This raises the challenge of detecting when these predicted protein structures cannot be trusted. We define the robustness measure for the predicted structure of a protein sequence to be the inverse of the root-mean-square distance (RMSD) in the predicted structure and the structure of its adversarially perturbed sequence. We use adversarial attack methods to create adversarial protein sequences, and show that the RMSD in the predicted protein structure ranges from 0.119Å to 34.162Å when the adversarial perturbations are bounded by 20 units in the BLOSUM62 distance. This demonstrates very high variance in the robustness measure of the predicted structures. We show that the magnitude of the correlation (0.917) between our robustness measure and the RMSD between the predicted structure and the ground truth is high, that is, the predictions with low robustness measure cannot be trusted. This is the first paper demonstrating the susceptibility of RoseTTAFold to adversarial attacks.

연구 동기 및 목표

  • RoseTTAFold와 같은 고정확도 단백질 접힘 신경망(PFNNs)이 생물학적으로 작은 서열 변화에 대해 강건한지 조사하기.
  • 미세한 서열 변화에 민감하여 예측된 단백질 구조가 신뢰할 수 없게 되는 경우를 특정하기.
  • 적대적 편향에 의한 구조적 민감도를 기반으로 PFNN 예측의 신뢰성을 수량화하는 강건성 지표를 개발하기.
  • 좌표 기하학적 표현 대비 거리 기하학적 표현이 PFNN에 대한 의미 있는 적대적 공격을 생성하는 데 얼마나 효과적인지 비교하기.
  • 정확도가 보장되는 근사 거리 기하학적 방법을 제안하여 적대적 공격의 품질과 효율성을 향상시키기.

제안 방법

  • 생물학적으로 타당한 변화를 보장하기 위해 서열 정렬 점수를 활용해 BLOSUM62 거리 기준 최대 20 단위 이내로 서열을 편집함으로써 적대적 공격을 생성한다.
  • 새로운 강건성 측도는 원본 서열의 예측 3D 구조와 그 적대적 편집된 대응체 간 RMSD의 역수로 정의된다.
  • 거리 기하학적 표현을 사용하여 단백질 구조를 표현하며, 이는 강체 변환에 대해 불변하므로 좌표 기반 표현에서 발생하는 잡음과 예측 오류를 방지한다.
  • 정확한 RMSD의 최소 0.69배를 보장하면서 계산 복잡도를 O(n²)에서 O(n)으로 감소시키는 근사 거리 기하학적 방법을 제안하며, A100 GPU에서 14배의 속도 향상을 달성한다.
  • 강건성 지표가 예측된 구조와 진짜 구조 간 RMSD와 상관관계를 보이며, 신뢰도 지표로서의 신뢰성을 검증한다.
  • PyMOL을 사용하여 원본 및 적대적 편집된 구조 간의 정렬과 RMSD 계산을 수행하여 정량적 평가를 수행한다.

실험 결과

연구 질문

  • RQ1생물학적으로 타당한 작은 서열 변화가 RoseTTAFold의 3D 단백질 구조 예측에 크게 영향을 미칠 수 있는가?
  • RQ2적대적 공격 하에서 다양한 단백질 서열에 대해 RoseTTAFold의 강건성은 어떻게 변화하는가?
  • RQ33D 좌표 대비 거리 기하학적 표현을 사용할 경우 PFNN에 대한 적대적 공격의 품질과 신뢰성은 향상되는가?
  • RQ4정확도를 보장하는 근사 거리 기하학적 방법은 계산 비용을 크게 줄일 수 있는가, 동시에 적대적 구조 생성의 정밀도를 유지하는가?
  • RQ5제안된 강건성 지표는 실제 예측 정확도(즉, 진짜 구조와의 RMSD)와 얼마나 높은 상관관계를 보이는가?

주요 결과

  • RoseTTAFold는 강건성 측면에서 극심한 변동성을 보이며, BLOSUM62 기준 20 단위 이내의 적대적 편집에서 RMSD가 0.119Å에서 34.162Å로 변동한다.
  • 원본 및 편집된 예측 간 RMSD의 역수로 정의된 강건성 지표는 진짜 구조와의 RMSD와 강한 상관관계(0.917)를 보이며, 이는 신뢰도 지표로서의 타당성을 입증한다.
  • 거리 기하학 기반의 적대적 공격 방법은 좌표 기반 공격 대비 최대 37배 높은 RMSD를 생성하여, 민감도 탐지 능력이 뛰어나다는 것을 시사한다.
  • 제안된 근사 거리 기하학적 방법은 정확한 RMSD의 최소 69%를 확보하면서 80GB A100 GPU에서 런타임을 14배 단축시켜 효율성과 정확도를 동시에 확보한다.
  • SFP1 인터페론 유도 단백질과 같은 일부 단백질에서는 적대적 편집으로 인해 RMSD가 25.641Å로 증가하여, 높은 모델 정확성에도 불구하고 구조적 불안정성이 뚜렷하게 드러난다.
  • 본 연구는 RoseTTAFold에 대한 적대적 취약성에 대한 첫 번째 증거를 제시하며, 고위험 생물학적 AI 응용 분야에서 강건성 평가의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.