[論文レビュー] ODBO: Bayesian Optimization with Search Space Prescreening for Directed Protein Evolution
ODBO は、探索空間の事前スクリーニングおよび低次元関数値ベースのタンパク質符号化を備えたベイズ最適化フレームワークであり、実験的コストを最小限に抑えることで指向的タンパク質進化を加速する。4つのタンパク質データセット(GB1 (4)、GB1 (55)、Ube4b、avGFP)において、ベースライン手法よりも少ない関数評価回数で最適なバリアントを特定し、より高いフィットネススコアを達成する優れた性能を発揮する。特に初期サンプリングが限られている状況や高次元探索空間において顕著である。
Directed evolution is a versatile technique in protein engineering that mimics the process of natural selection by iteratively alternating between mutagenesis and screening in order to search for sequences that optimize a given property of interest, such as catalytic activity and binding affinity to a specified target. However, the space of possible proteins is too large to search exhaustively in the laboratory, and functional proteins are scarce in the vast sequence space. Machine learning (ML) approaches can accelerate directed evolution by learning to map protein sequences to functions without building a detailed model of the underlying physics, chemistry and biological pathways. Despite the great potentials held by these ML methods, they encounter severe challenges in identifying the most suitable sequences for a targeted function. These failures can be attributed to the common practice of adopting a high-dimensional feature representation for protein sequences and inefficient search methods. To address these issues, we propose an efficient, experimental design-oriented closed-loop optimization framework for protein directed evolution, termed ODBO, which employs a combination of novel low-dimensional protein encoding strategy and Bayesian optimization enhanced with search space prescreening via outlier detection. We further design an initial sample selection strategy to minimize the number of experimental samples for training ML models. We conduct and report four protein directed evolution experiments that substantiate the capability of the proposed framework for finding of the variants with properties of interest. We expect the ODBO framework to greatly reduce the experimental cost and time cost of directed evolution, and can be further generalized as a powerful tool for adaptive experimental design in a broader context.
研究の動機と目的
- 指向的進化における高次元的かつ疎なタンパク質配列空間の課題に対処すること。機能的バリアントはまれであり、実験的スクリーニングは高コストである。
- 従来の機械学習手法がタンパク質工学において抱える制限、例えば高次元の特徴表現や低データ環境下での非効率な探索を克服すること。
- 必要な実験的測定回数を最小限に抑えつつ、高フィットネスのタンパク質バリアントの発見を最大化する、適応的な実験的設計フレームワークを開発すること。
- 飽和および非飽和突然変異の両状況においても効率的な最適化を可能とし、複雑で高次元のタンパク質データセットを含む。
- 強力なサーモンモデルと外れ値検出を統合し、探索空間を事前にスクリーニングし、ベイズ最適化を高い可能性を持つ領域へ誘導すること。
提案手法
- タンパク質配列をその機能的出力(例:フィットネス、発光性)にマップする低次元の関数値ベースのタンパク質符号化戦略を提案。高次元の配列埋め込みの代わりに使用する。
- 外れ値検出を用いた探索空間の事前スクリーニングを実装し、ベイズ最適化を開始する前に有望でない領域をフィルタリングする。
- 探索と活用のバランスを取るために、獲得関数(例:期待改善)と強力なガウス過程(RobustGP)サーモンモデルを統合したベイズ最適化(BO)を実装する。
- 候補空間から最も情報の多いバリアントを段階的に選択する初期サンプル選択戦略を設計し、必要な実験的測定回数を最小限に抑える。
- ODBOフレームワークを、高次元設定での最適化効率を向上させるために、TuRBO などの高度なBOバージョンと統合する。
- さまざまなバッチサイズを用いたバッチベイズ最適化を実装し、実用的な実験ワークフローと異なるタンパク質データセットにおけるスケーラビリティをサポートする。
実験結果
リサーチクエスチョン
- RQ1低次元の関数値ベースの符号化戦略は、従来の高次元の配列表現と比較して、タンパク質指向的進化におけるベイズ最適化の効率を向上させるか?
- RQ2外れ値検出による探索空間の事前スクリーニングは、高フィットネスのタンパク質バリアントを特定するために必要な実験的評価回数をどの程度削減するか?
- RQ3ODBOフレームワークは、飽和および非飽和突然変異の両状況を含む多様なタンパク質データセットにおいて、どの程度の性能を発揮するか?
- RQ4提案された初期サンプル選択戦略は、最適化性能を維持または向上させつつ、必要な実験的サンプル数を顕著に削減できるか?
- RQ5強力なサーモンモデル(RobustGP)と高度なBOアルゴリズム(例:TuRBO)の統合は、高次元的かつ疎なタンパク質配列空間におけるグローバル最適化をどの程度向上させるか?
主な発見
- GB1 (4) データセットでは、ODBOがたった40個の初期サンプルで平均最大フィットネス8.76 ± 0.00を達成し、すべてのベースライン手法を上回った。
- 挑戦的なGB1 (55) データセットでは、ODBOがTuRBO + RobustGPを用いて平均最大フィットネス2.25 ± 0.25を達成し、高次元的かつ非飽和突然変異においても高いロバストネスを示した。
- Ube4b データセットでは、ODBOのすべてのバージョンが10イテレーション以内に平均最大フィットネス8.75 ± 0.00に達し、真の最大値9.00に非常に近づいた。
- avGFP データセットでは、ODBOがTuRBO + GPを用いて平均最大発光性4.11 ± 0.00を達成し、真の最大値4.12に近づいた。
- ODBOフレームワークは、4つのすべてのデータセットにおいてランダムサーチおよび標準BOベースラインを一貫して上回り、収束が早く、最適化結果の分散が小さかった。
- 探索空間の事前スクリーニングとRobustGPの統合により、サンプル効率が顕著に向上し、最小限の実験的コストで高フィットネスバリアントの発見が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。