Skip to main content
QUICK REVIEW

[논문 리뷰] Random Embeddings and Linear Regression can Predict Protein Function

Tianyu Lu, Alex X. Lu|arXiv (Cornell University)|2021. 04. 25.
Microplastics and Plastic Pollution참고 문헌 16인용 수 4
한 줄 요약

이 논문은 사전 훈련되지 않은 채로 학습된 랜덤 임베딩이 14개의 다양한 단백질 기능 예측 과제에서 최신의 사전 훈련된 단백질 언어 모델과 비교할 만한 성능을 달성함을 보여준다. 일련의 온화한 회귀 모델을 사용하여, 한 개의 원-핫 인코딩 또는 무작위로 초기화된 임베딩을 사용할 때, 이 간단한 베이스라인 모델들이 사전 훈련된 모델들을 능가하거나 동등하게 성능을 내며, 특히 예측 불가능한 돌연변이나 일반화된 새로운 돌연변이에 대해 더 뛰어난 성능을 보여, 고비용의 사전 훈련이 반드시 필요하다는 가정에 도전한다.

ABSTRACT

Large self-supervised models pretrained on millions of protein sequences have recently gained popularity in generating embeddings of protein sequences for protein function prediction. However, the absence of random baselines makes it difficult to conclude whether pretraining has learned useful information for protein function prediction. Here we show that one-hot encoding and random embeddings, both of which do not require any pretraining, are strong baselines for protein function prediction across 14 diverse sequence-to-function tasks.

연구 동기 및 목표

  • 사전 훈련이 없는 랜덤 임베딩이 단백질 기능 예측의 강력한 베이스라인으로 기능할 수 있는지 평가하기.
  • 대규모 사전 훈련으로 인한 성능 향상이 실제로 학습된 생물물리학적 표현에 기인하는지, 아니면 높은 차원의 무작위 투영에 기인하는지 평가하기.
  • 사전 훈련이 없음에도 불구하고 일부 랜덤 임베딩 아키텍처가 다른 것들보다 더 우수한 성능을 보이는지 조사하기.
  • 다양한 회귀 과제에서 원-핫 인코딩과 랜덤 임베딩의 성능을 사전 훈련된 모델들과 비교하기.
  • 사전 훈련이 효과적인 단백질 표현 학습을 위해 필수적이라는 가정을 도전하기 위해, 훈련되지 않은 모델이 강력한 성능을 보임을 보여주기.

제안 방법

  • 연구는 사전 훈련된 단백질 언어 모델(ProtBert, CPCProt, Bepler)과 그들의 무작위로 초기화된 복제본을 임베딩 함수로 사용한다.
  • 각 모델에 대해 임베딩 레이어는 랜덤 가중치로 초기화되며, 미세조정되지 않으며, 유일하게 훈련되는 것은 최상위의 선형 회귀 헤드이다.
  • 원-핫 인코딩은 전체 시퀀스 길이 × 21 차원을 유지함으로써 전체 위치 정보를 보존하는 기준으로 사용된다.
  • 최상위 모델은 고정된 차원의 임베딩에 기반한 선형 회귀 분류기를 사용하여 연속적인 단백질 기능 값(예: 발광성, 촉매 활성, 융해 온도 등)을 예측한다.
  • 이 방법은 14개의 다양한 데이터셋에서 평가되며, 예측 불가능한 아미노산 변형 및 상호작용 돌연변이로의 외삽도 포함된다.
  • 모델 성능은 표준 회귀 평가 지표를 사용하여 평가되며, 결과는 세 번의 랜덤 복제 평균으로 산출된다.

실험 결과

연구 질문

  • RQ1사전 훈련 없이도 랜덤 임베딩이 최신의 사전 훈련된 모델들과 비교해 경쟁 가능한 성능을 내는가?
  • RQ2일부 랜덤 임베딩 아키텍처가 다른 것들보다 더 우수한 성능을 보이는가? 만약 그렇다면 그 이유는 무엇인가?
  • RQ3사전 훈련된 모델의 성능은 학습된 생물물리학적 표현에 기인하는가, 아니면 높은 차원의 무작위 투영에 기인하는가?
  • RQ4예측 불가능한 아미노산 변형이나 상호작용 돌연변이를 가진 시퀀스에 대해 원-핫 인코딩과 랜덤 임베딩은 어떻게 일반화되는가?
  • RQ5사전 훈련과 무관하게, 임베딩 차원의 수가 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 랜덤 임베딩은 예측 불가능한 아미노산 변형과 상호작용 돌연변이로의 외삽을 포함한 14개의 다양한 단백질 기능 예측 과제에서 사전 훈련된 모델과 비교해 유사하거나 더 뛰어난 성능을 보였다.
  • 전체 위치 정보를 유지하는 원-핫 인코딩이 뛰어난 성능을 보였으며, 이는 국소적 시퀀스 패tern이 기능 예측에 매우 중요하며, 임베딩을 평균화하는 것이 중요한 정보를 손상시킬 수 있음을 시사한다.
  • 랜덤 임베딩의 일관된 성공은 커버의 정리(Cover’s Theorem)를 지지하며, 학습 없이도 고차원의 무작위 투영이 선형으로 분리 가능하고, 따라서 예측 가능할 수 있음을 나타낸다.
  • 일부 랜덤 임베딩 아키텍처가 다른 것들보다 더 뛰어난 성능을 보였으며, 이는 아키텍처 설계가 사전 훈련과 무관하게 성능에 영향을 미칠 수 있음을 시사한다.
  • 결과는 사전 훈련이 효과적인 단백질 표현 학습을 위해 필수적이라는 가정을 도전하며, 훈련되지 않은 모델이 사전 훈련된 기준선을 따라하거나 능가할 수 있음을 보여준다.
  • 이 연구는 표현 학습에서 랜덤 베이스라인의 중요성을 부각하며, 성능 향상의 원인이 생물학적으로 의미 있는 표현이 아닌, 유일하게 차원 수에 기인할 수 있음을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.