Skip to main content
QUICK REVIEW

[논문 리뷰] What is a meaningful representation of protein sequences?

Nicki Skafte Detlefsen, Søren Hauberg|arXiv (Cornell University)|2020. 11. 28.
RNA and protein synthesis mechanisms참고 문헌 6인용 수 4
한 줄 요약

이 논문은 단백질 서열의 의미 있는 표현 방식이 무엇인지 탐구하며, 표현의 기하학적 구조가 이해 가능성과 생물학적 통찰에 결정적인 영향을 미친다고 제안한다. 잠재 공간 기하학을 모델링함으로써(특히 엔트로피 인식 기하 거리 기반으로), 전이 학습 성능을 햖고, 기존 표준 방법으로는 드러나지 않는 생물학적으로 의미 있는 패턴을 드러내며, 기하학적 인식이 단백질 서열 분석에서 모델의 유용성과 과학적 이해 가능성 모두를 향상시킨다는 것을 입증한다.

ABSTRACT

How we choose to represent our data has a fundamental impact on our ability to subsequently extract information from them. Machine learning promises to automatically determine efficient representations from large unstructured datasets, such as those arising in biology. However, empirical evidence suggests that seemingly minor changes to these machine learning models yield drastically different data representations that result in different biological interpretations of data. This begs the question of what even constitutes the most meaningful representation. Here, we approach this question for representations of protein sequences, which have received considerable attention in the recent literature. We explore two key contexts in which representations naturally arise: transfer learning and interpretable learning. In the first context, we demonstrate that several contemporary practices yield suboptimal performance, and in the latter we demonstrate that taking representation geometry into account significantly improves interpretability and lets the models reveal biological information that is otherwise obscured.

연구 동기 및 목표

  • 단백질 서열 표현이 생물학적 맥락에서 '의미 있는' 것으로 간주되는 이유에 대한 근본적인 질문을 다루기 위해.
  • 단백질 표현을 위한 현재의 전이 학습 관행을 평가하고, 비최적의 설계 선택 사항을 규명하기 위해.
  • 잠재 공간의 기하학을 명시적으로 모델링하여 학습된 표현의 이해 가능성을 향상시키기 위해.
  • 엔트로피 인식 잠재 다양체를 사용하여 단백질 서열 표현 공간에서 강력한 기하 거리 계산 방법을 개발하기 위해.
  • 기하학적으로 인식된 표현이 표준 방법보다 더 신뢰성 있게 계통발생 관계나 기능 모티프와 같은 생물학적으로 의미 있는 구조를 드러내는가를 입증하기 위해.

제안 방법

  • 저자는 변동형 오토인코더(VAE) 프레임워크를 사용하여 단백질 서열 표현을 학습하고, 잠재 공간의 불확실성과 기하학을 모델링하기 위해 새로운 엔트로피 네트워크를 도입한다.
  • 일반화된 서열 간 기하 거리의 기대 제곱 거리를 기반으로 한 기하 에너지 기능을 정의하며, 공식 $ \mathbb{E}[\Delta^2] = 2\left(1 - \sum_{d=1}^{C} a_d b_d\right) $ 를 사용하여 서열 공간 내 기대 거리를 계산한다.
  • 기하선을 계산하기 위해, 잠재 공간을 2차원 격자로离산화하고 엔트로피 가중치가 부여된 간선을 갖는 그래프를 구축한 후, 안정적인 초기화를 위해 다이크스트라 알고리즘을 적용한다.
  • 기하선을 개선하기 위해 세제곱 스퍼링 피팅과 10단계의 기울기 최적화를 사용하여 에너지 기능(식 4)을 최소화한다.
  • 계통발생 분석을 위해, 군집 중심에 가장 가까운 잠재 표현을 선별하고, FastTree2와 codeml를 사용하여 계통수 추론 및 조상 서열 복원을 수행한다.
  • Pfam과 TAPe(TAPE) 레포지터리에서 공개된 데이터셋을 사용하여 결과를 검증하였으며, 코드와 사전 처리된 데이터를 공개적으로 제공한다.

실험 결과

연구 질문

  • RQ1단백질 서열에 대한 전이 학습에서 일반적인 설계 선택 사항이 표현의 품질과 생물학적 이해 가능성에 어떤 영향을 미치는가?
  • RQ2잠재 공간의 기하학을 모델링할 경우, 단백질 서열 임베딩의 이해 가능성은 어느 정도 향상되는가?
  • RQ3잠재 공간에서 엔트로피 인식 기하 거리가 계통발생적 구조나 기능 유사성과 같은 생물학적으로 의미 있는 관계를 드러내는가?
  • RQ4표준 표현 학습 방법은 어떻게 생물학적으로 의미 있는 패턴을 은폐하는가? 이러한 문제는 어떻게 수정할 수 있는가?
  • RQ5대체로 표현 기하학은 조상 서열과 기능 모티프의 강력한 추론을 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • 단백질 서열에 대한 전이 학습에서 일반적으로 사용되는 관행들—예를 들어 표준 VAE 학습과 표현 평균화—는 성능이 열악하고 생물학적 패턴을 은폐한다.
  • 제안된 엔트로피 네트워크는 잠재 공간 내 기하선의 품질을 크게 향상시켜 단백질 서열 간의 더 정확하고 생물학적으로 의미 있는 거리 추정이 가능하게 한다.
  • 표현 기하학을 모델링함으로써, 본 방법은 계통발생 관계와 조상 서열을 성공적으로 복원하며, 표준 기준보다 더 강력하고 이해 가능한 성능을 보인다.
  • 엔트로피 인식 방법을 사용해 계산된 기하선은 표준 표현에서는 보이지 않는 베타-락탐라제 가족 내 명확한 진화적 추세와 기능 군집을 드러낸다.
  • 이 연구는 표현 기하학이 부차적인 문제일 뿐 아니라, 학습된 표현이 과학적으로 활용 가능한 통찰을 제공할 수 있는지 여부를 결정하는 핵심 요소임을 입증한다.
  • 저자는 모델 아키텍처나 학습 프로토콜의 미세한 변화가 생물학적 해석을 근본적으로 변화시킬 수 있음을 보여주며, 표현 학습에서 기하학적 인식의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.