Skip to main content
QUICK REVIEW

[논문 리뷰] On Design of Optimal Nonlinear Kernel Potential Function for Protein Folding and Protein Design

Changyu Hu, Xiang Li|arXiv (Cornell University)|2003. 01. 31.
Protein Structure and Dynamics참고 문헌 58인용 수 3
한 줄 요약

이 논문은 단백질 접힘과 서열 설계를 향상시키기 위해 가우시안 혼합 모델 기반의 비선형 커널 잠재함수를 제안하며, 기존 선형 접촉 잠재함수를 능가한다. 일반화 오차 경계의 최소화를 위한 2차 프로그래밍을 사용함으로써, 1400만 개의 갭 없는 스레딩 디코이에 대해 440개의 천연 단백질과 서열을 완벽하게 분류하는 데 성공하여 독립 테스트에서 선형 잠재함수에 비해 오분류를 크게 감소시켰다.

ABSTRACT

Potential functions are critical for computational studies of protein structure prediction, folding, and sequence design. A class of widely used potentials for coarse grained models of proteins are contact potentials in the form of weighted linear sum of pairwise contacts. However, these potentials have been shown to be unsuitable choices because they cannot stabilize native proteins against a large number of decoys generated by gapless threading. We develop an alternative framework for designing protein potential. We describe how finding optimal protein potential can be understood from two geometric viewpoints, and we derive nonlinear potentials using mixture of Gaussian kernel functions for folding and design. The optimization criterion for obtaining parameters of the potential is to minimize bounds on the generalization error of discriminating protein structures and decoys not used in training. In our experiment we use a training set of 440 protein structures repre senting a major portion of all known protein structures, and about 14 million structure decoys and sequence decoys obtained by gapless threading. We succeeded in obtaining nonlinear potential with perfect discrimination of the 440 native structures and native sequences. For the more challenging task of sequence design when decoys are obtained by gapless threading, we show that there is no linear potential with perfect discrimination of all 440 native sequences. Results on an independent test set of 194 proteins also showed that nonlinear kernel potential performs well.

연구 동기 및 목표

  • 대규모 디코이 집합에 대해 천연 단백질 구조를 안정화하는 데에 한계가 있는 선형 접촉 잠재함수의 문제점을 해결하기 위해.
  • 단백질 에너지 표면에서 복잡한 비선형 상호작용을 포괄하는 더 정교한 잠재함수 형식을 개발하기 위해.
  • 단백질 접힘(구조 분류)과 단백질 설계(서열 호환성) 작업 모두에서 성능을 향상시키기 위해.
  • 선형 잠재함수가 실패하는 상황, 특히 도전적인 디코이 조건에서 비선형 커널 잠재함수가 완벽한 분류를 달성할 수 있음을 입증하기 위해.
  • 다양한 단백질 표현 및 상호작용에 적용 가능한 일반화 가능한 잠재함수 설계 프레임워크를 제공하기 위해.

제안 방법

  • 잔기-잔기 상호작용의 비선형 모델링을 가능하게 하는 가우시안 커널 함수의 혼합으로 단백질 잠재함수를 수식화한다.
  • 구조 및 서열 분류를 위한 일반화 오차 경계의 이론적 경계를 최소화함으로써 잠재함수 매개변수를 최적화하기 위해 2차 프로그래밍을 사용한다.
  • 학습 및 검증을 위해 1400만 개의 구조 및 서열 디코이를 생성하기 위해 갭 없는 스레딩을 활용한다.
  • 최적화 문제를 기하학적 관점에서 해석하여 에너지 차이의 볼록 Hull 분離와 연결한다.
  • 440개 단백질의 학습 세트와 194개 단백질의 독립 테스트 세트에서 최적의 선형 잠재함수와 비교하여 방법을 검증한다.
  • 에너지 차이 벡터의 볼록 Hull 분석을 통해 완벽한 분류를 위한 이론적 조건을 유도한다.

실험 결과

연구 질문

  • RQ1비선형 커널 잠재함수 형식이 표준 선형 접촉 잠재함수보다 천연 단백질 구조를 디코이로부터 분류하는 데에서 뛰어나게 작용할 수 있는가?
  • RQ2선형 잠재함수가 실패하는 상황에서 비선형 잠재함수를 사용하여 갭 없는 스레딩 디코이에 대해 천연 서열을 완벽하게 분류할 수 있는가?
  • RQ3접힘 및 설계 작업 모두에 대해 독립 테스트 세트에서 비선형 커널 잠재함수의 성능이 선형 잠재함수와 비교해 어떻게 되는가?
  • RQ4천연 구조 수가 300개를 초과할 경우 잠재함수의 기능적 형태가 효과적인 분류를 가능하게 하는 데서 수행하는 역할은 무엇인가?
  • RQ5일반화 오차 경계 기반 최적화 프레임워크가 더 강력하고 일반화 가능한 단백질 잠재함수를 도출하는 데 기여할 수 있는가?

주요 결과

  • 비선형 커널 잠재함수는 1400만 개의 갭 없는 스레딩 디코이에 대해 440개의 천연 단백질 구조와 서열을 완벽하게 분류했으며, 이는 선형 잠재함수가 실패한 작업이었다.
  • 194개 단백질의 독립 테스트 세트에서 비선형 잠재함수의 오분류 수는 3개의 구조와 14개의 서열이었으며, 최적의 선형 잠재함수의 경우 7개의 구조와 37개의 서열이 오분류되었다.
  • 서열 설계에서의 오분류를 최적의 선형 잠재함수의 40%로 감소시켜 도전적인 상황에서도 뚜렷한 향상을 보였다.
  • 이론적 분석 결과, 완벽한 분류가 가능하려면 에너지 차이 벡터의 볼록 Hull에 원점이 포함되지 않아야 하며, 이 조건은 비선형 커널 형식에 의해 충족됨을 확인했다.
  • 접힘 및 설계 작업 모두에서 비선형 잠재함수가 선형 잠재함수 및 통계적 잠재함수를 능가했으며, 특히 갭 없는 스레딩을 통해 생성된 디코이에서 두드러진 성능 향상을 보였다.
  • 결과적으로 선형 접촉의 가중 합을 초월하는 더 복잡한 기능적 형태가 효과적인 단백질 에너지 함수 설계에 필수적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.