Skip to main content
QUICK REVIEW

[논문 리뷰] ReLSO: A Transformer-based Model for Latent Space Optimization and Generation of Proteins

Egbert Castro, Abhinav Godavarthi|arXiv (Cornell University)|2022. 01. 24.
vaccines and immunoinformatics approaches인용 수 6
한 줄 요약

ReLSO는 단일 단백질 서열 생성 및 기능 예측을 위한 구조적이고 정규화된 잠재공간을 학습하는 트랜스포머 기반 오토인코더이다. 잠재공간 내에서 기울기 기반 최적화를 가능하게 함으로써 ReLSO는 anti-ranibizumab 및 GFP 데이터셋에서 기존 방법들보다 더 높은 기능 예측 최적화 효율성과 더 강건한 고기능 서열을 생성한다.

ABSTRACT

The development of powerful natural language models have increased the ability to learn meaningful representations of protein sequences. In addition, advances in high-throughput mutagenesis, directed evolution, and next-generation sequencing have allowed for the accumulation of large amounts of labeled fitness data. Leveraging these two trends, we introduce Regularized Latent Space Optimization (ReLSO), a deep transformer-based autoencoder which features a highly structured latent space that is trained to jointly generate sequences as well as predict fitness. Through regularized prediction heads, ReLSO introduces a powerful protein sequence encoder and novel approach for efficient fitness landscape traversal. Using ReLSO, we explicitly model the sequence-function landscape of large labeled datasets and generate new molecules by optimizing within the latent space using gradient-based methods. We evaluate this approach on several publicly-available protein datasets, including variant sets of anti-ranibizumab and GFP. We observe a greater sequence optimization efficiency (increase in fitness per optimization step) by ReLSO compared to other approaches, where ReLSO more robustly generates high-fitness sequences. Furthermore, the attention-based relationships learned by the jointly-trained ReLSO models provides a potential avenue towards sequence-level fitness attribution information.

연구 동기 및 목표

  • 기능적 단백질의 효율적 설계를 위해 광범위하고 상호의존적인 단백질 서열 공간을 효과적으로 탐색하는 도전 과제를 해결한다.
  • 고 throughput 스크리닝을 통해 확보한 대규모 라벨링된 기능 데이터를 활용하여 단일 서열 및 기능 모델링을 수행하는 딥 생성 모델을 훈련시킨다.
  • 기울기 기반 최적화가 가능한 고도로 구조화되고 부드럽고 의사볼록한 잠재공간을 개발한다.
  • 공동 훈련된 기능 예측 헤드를 이용한 기울기 상승을 통한 잠재공간 내 직접 최적화를 가능하게 하여 블랙박스 또는 순차적 방법 대비 검색 효율성을 향상시킨다.

제안 방법

  • 단백질 서열을 저차원이고 정보가 풍부한 잠재공간으로 인코딩하기 위해 트랜스포머 기반 오토인코더 아키텍처를 사용한다.
  • 정규화된 기능 예측 헤드와 함께 공동 잠재 표현을 훈련시어 잠재 코드에서 직접 기능적 특성을 예측한다.
  • 세 가지 핵심 정규화를 적용한다: (1) 기능 예측 손실을 통한 부드러움, (2) 잠재공간 정규화를 통한 연속성 및 보간 가능성, (3) 훈련 데이터 외부의 음성 샘플링을 통한 의사볼록성.
  • 기능 예측 헤드의 기울기 정보를 활용하여 잠재공간 내에서 기울기 기반 최적화를 수행함으로써 고기능 영역으로의 효율적 탐색을 가능하게 한다.
  • ReLSO의 성능을 다양한 기준선과 비교한다. 이는 시뮬레이션 기반 방향성 진화, MCMC, 하이드 클라이밍, 적응형 샘플링(DbAS, CbAS)을 포함하며, 서열 공간과 잠재공간 양쪽에서 비교한다.
  • 공개된 DbAS 및 CbAS 구현체를 사용하고, 하이퍼파rameter 조정(q ∈ [0.5, 0.8], epochs ∈ [1, 15])을 통해 공정한 비교를 수행한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 오토인코더에서 공동 훈련된 정규화된 잠재공간이 기존의 블랙박스 또는 순차적 방법보다 더 효율적인 단백질 서열 최적화를 가능하게 하는가?
  • RQ2ReLSO의 정규화된 잠재공간은 기능 지도 탐색과 고기능 서열 수렴에 얼마나 기여하는가?
  • RQ3기울기 기반 최적화가 MCMC, 하이드 클라이밍, 적응형 샘플링과 같은 기울기 없는 방법에 비해 단위 최적화 단계당 기능 향상도에서 어떻게 성능을 냅니다?
  • RQ4ReLSO의 어텐션 메커니즘이 학습된 어텐션 패턴을 통해 해석 가능한 서열 수준의 기능 기여도 정보를 제공하는가?
  • RQ5ReLSO는 anti-ranibizumab 및 GFP와 같은 다양한 단백질 가족 간에 일반화되어, 최소한의 시뮬레이션 스크리닝으로 고기능 변종을 생성할 수 있는가?

주요 결과

  • ReLSO는 anti-ranibizumab 및 GFP 데이터셋 양쪽에서 다른 방법들에 비해 유의미하게 높은 기능 최적화 효율성(최적화 단계당 기능 향상도)을 달성한다.
  • ReLSO 모델은 고기능 서열을 강건하게 생성하며, 기울기 기반 잠재공간 최적화(ReLSO-GA)가 기울기 없는 방법과 블랙박스 적응형 샘플링 접근법을 모두 능가한다.
  • 공동 훈련 과정에서 학습된 어텐션 기반 관계는 서열 수준의 기능 기여도를 해석 가능한 방식으로 제공할 잠재적 길을 열어주며, 단순 예측을 넘어서 해석 가능성까지 제공한다.
  • 정규화된 잠재공간은 부드럽고 연속적이며 보간 가능한 표현을 가능하게 하여 안정적이고 효과적인 기울기 상승을 지원함으로써 局부 최적해의 위험을 줄인다.
  • 잠재공간 내에서 구조적 및 기능적 인덕티브 바이어스를 통합함으로써 ReLSO는 DbAS 및 CbAS와 같은 최신 기술보다 뛰어난 성능을 보이며, 특히 초기 최적화 단계에서 두각을 나타낸다.
  • 음성 샘플링과 보간 정규화의 사용은 잠재공간의 의사볼록성을 향상시켜 최적화 안정성과 수렴성을 개선한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.