Skip to main content
QUICK REVIEW

[논문 리뷰] ODBO: Bayesian Optimization with Search Space Prescreening for Directed Protein Evolution

Lixue Cheng, Ziyi Yang|arXiv (Cornell University)|2022. 05. 19.
vaccines and immunoinformatics approaches인용 수 8
한 줄 요약

ODBO는 검색 공간 사전 스크리닝과 저차원 기능 값 기반 단백질 인코딩을 갖춘 베이지안 최적화 프레임워크로, 실험 비용을 최소화하여 유도적 단백질 진화를 가속화한다. 이 프레임워크는 GB1 (4), GB1 (55), Ube4b, avGFP 네 가지 단백질 데이터셋에서 뛰어난 성능을 발휘하여, 기준 방법 대비 더 적은 기능 평가 횟수와 더 높은 적합도 점수를 기록한다. 특히 초기 샘플 수가 제한적이고 고차원적 검색 공간에서 뛰어난 성능을 보인다.

ABSTRACT

Directed evolution is a versatile technique in protein engineering that mimics the process of natural selection by iteratively alternating between mutagenesis and screening in order to search for sequences that optimize a given property of interest, such as catalytic activity and binding affinity to a specified target. However, the space of possible proteins is too large to search exhaustively in the laboratory, and functional proteins are scarce in the vast sequence space. Machine learning (ML) approaches can accelerate directed evolution by learning to map protein sequences to functions without building a detailed model of the underlying physics, chemistry and biological pathways. Despite the great potentials held by these ML methods, they encounter severe challenges in identifying the most suitable sequences for a targeted function. These failures can be attributed to the common practice of adopting a high-dimensional feature representation for protein sequences and inefficient search methods. To address these issues, we propose an efficient, experimental design-oriented closed-loop optimization framework for protein directed evolution, termed ODBO, which employs a combination of novel low-dimensional protein encoding strategy and Bayesian optimization enhanced with search space prescreening via outlier detection. We further design an initial sample selection strategy to minimize the number of experimental samples for training ML models. We conduct and report four protein directed evolution experiments that substantiate the capability of the proposed framework for finding of the variants with properties of interest. We expect the ODBO framework to greatly reduce the experimental cost and time cost of directed evolution, and can be further generalized as a powerful tool for adaptive experimental design in a broader context.

연구 동기 및 목표

  • 유도적 진화에서 희소하고 고차원적인 단백질 서열 공간의 과제를 해결한다. 기능적 변종은 드물고 실험적 걸러내기는 비용이 크다.
  • 기존 기계학습 방법의 단백질 공학 적용에서의 한계를 극복한다. 예를 들어 고차원적 특성 표현과 낮은 데이터 환경에서의 비효율적 탐색이다.
  • 실험 측정이 필요한 수를 최소화하면서도 높은 적합도를 가진 단백질 변종을 최대한 발견할 수 있도록 적응형 실험 설계 프레임워크를 개발한다.
  • 포화 돌연변이와 비포화 돌연변이 모두에 걸쳐 효율적인 최적화를 가능하게 하며, 복잡하고 고차원적인 단백질 데이터셋을 포함한다.
  • 강력한 대체 모델링과 이질치 탐지 기능을 통합하여 검색 공간을 사전 스크리닝하고, 베이지안 최적화가 높은 잠재력을 가진 영역으로 유도한다.

제안 방법

  • 고차원 서열 임bedding 대신 단백질 서열을 기능적 출력(예: 적합도, 밝기)으로 매핑하는 저차원 기능 값 기반 단백질 인코딩 전략을 제안한다.
  • 이상치 탐지 기반 검색 공간 사전 스크리닝을 구현하여, 베이지안 최적화 시작 이전에 유망하지 않은 서열 공간 영역을 걸러낸다.
  • 탐색과 이용의 균형을 이루기 위해, 획득 함수(예: 기대 개선도)와 강력한 가우시안 프로세스(로버스트GP) 대체 모델을 베이지안 최적화(BO)와 통합한다.
  • 후보 공간에서 가장 정보가 풍부한 변종을 반복적으로 선택하는 초기 샘플 선택 전략을 설계하여 실험 측정이 필요한 수를 최소화한다.
  • ODBO 프레임워크를 고차원 설정에서 최적화 효율성을 향상시키기 위해 TuRBO와 같은 고급 BO 변종과 통합한다.
  • 다양한 배치 크기를 갖는 배치 베이지안 최적화를 사용하여 실용적인 실험 워크플로우와 다양한 단백질 데이터셋에 대한 확장성을 지원한다.

실험 결과

연구 질문

  • RQ1기존의 고차원 서열 표현 방식에 비해, 저차원 기능 값 기반 인코딩 전략이 단백질 유도적 진화에서 베이지안 최적화의 효율성을 향상시키는가?
  • RQ2이상치 탐지 기반 검색 공간 사전 스크리닝이 고적합도 단백질 변종을 식별하기 위해 필요한 실험 평가 횟수를 얼마나 줄이는가?
  • RQ3제안된 ODBO 프레임워크는 포화 및 비포화 돌연변이 시나리오를 포함한 다양한 단백질 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ4제안된 초기 샘플 선택 전략이 최적화 성능을 유지하거나 향상시키면서도 필요한 실험 샘플 수를 상당히 줄일 수 있는가?
  • RQ5강력한 대체 모델(RobustGP)과 고급 BO 알고리즘(TuRBO 등)의 통합이 고차원적이고 희소한 단백질 서열 공간에서의 전역 최적화를 어떻게 향상시키는가?

주요 결과

  • ODBO는 GB1 (4) 데이터셋에서 평균 최대 적합도 8.76 ± 0.00을 기록하여, 오직 40개의 초기 샘플만으로도 모든 기준 방법을 능가했다.
  • 도전적인 GB1 (55) 데이터셋에서 ODBO는 TuRBO + RobustGP를 사용해 평균 최대 적합도 2.25 ± 0.25를 달성하여 고차원 비포화 돌연변이 환경에서도 뛰어난 강건성을 보였다.
  • Ube4b 데이터셋에서 ODBO의 모든 변종은 10회 이터레이션 내에 평균 최대 적합도 8.75 ± 0.00을 달성했으며, 진정한 최대값 9.00에 매우 가까웠다.
  • avGFP 데이터셋에서 ODBO는 TuRBO + GP를 사용해 평균 최대 밝기 4.11 ± 0.00을 기록했으며, 진정한 최대값 4.12에 가까워졌다.
  • ODBO는 네 가지 데이터셋 전반에서 랜덤 서치 및 표준 BO 기준 방법보다 일관되게 뛰어난 성능을 보였으며, 수렴 속도가 빠르고 최적화 결과의 분산이 낮았다.
  • 검색 공간 사전 스크리닝과 로버스트GP의 통합은 샘플 효율성을 크게 향상시켜, 최소한의 실험 비용으로도 높은 적합도의 변종을 발견할 수 있게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.