[論文レビュー] PropertyDAG: Multi-objective Bayesian optimization of partially ordered, mixed-variable properties for biological sequence design
PropertyDAGは、抗体設計における発現が親和性の前に来るなど、混合変数を持つ生物学的配列特性の間の部分順序を強制するベイズ最適化フレームワークを導入する。これは、ゼロインflatedの目的関数をモデル化し、親特性の妥当性に条件づけて最適化を行うことで、サーヴェイの事後分布推論を変更することで実現される。これは、ペニシリン、おもちゃ、実世界の抗体タスクにおけるシミュレーテッドアクティブラーニングにおいて、標準的な多目的BOに比べて顕著に優れており、連合陽性(例:発現し、強力な抗体)の識別において、より高い連合陽性数とより正確な事後信念を達成している。
Bayesian optimization offers a sample-efficient framework for navigating the exploration-exploitation trade-off in the vast design space of biological sequences. Whereas it is possible to optimize the various properties of interest jointly using a multi-objective acquisition function, such as the expected hypervolume improvement (EHVI), this approach does not account for objectives with a hierarchical dependency structure. We consider a common use case where some regions of the Pareto frontier are prioritized over others according to a specified $ extit{partial ordering}$ in the objectives. For instance, when designing antibodies, we would like to maximize the binding affinity to a target antigen only if it can be expressed in live cell culture -- modeling the experimental dependency in which affinity can only be measured for antibodies that can be expressed and thus produced in viable quantities. In general, we may want to confer a partial ordering to the properties such that each property is optimized conditioned on its parent properties satisfying some feasibility condition. To this end, we present PropertyDAG, a framework that operates on top of the traditional multi-objective BO to impose this desired ordering on the objectives, e.g. expression $ ightarrow$ affinity. We demonstrate its performance over multiple simulated active learning iterations on a penicillin production task, toy numerical problem, and a real-world antibody design task.
研究の動機と目的
- 標準的な多目的ベイズ最適化が、生物学的配列特性の間の階層的依存関係(例:抗体設計における発現が親和性の前に来る)を処理できないという制限に対処すること。
- 生物学的設計に一般的な混合変数の目的関数をモデル化すること。ここでは、一部の特性が過剰なゼロ値(例:非発現抗体)を示し、肥大な非ゼロ分布を持つ。
- 親特性の閾値を満たす設計を優先することで、アクティブラーニングにおけるサンプル効率を向上させること。
- 実験的および生物学的事前知識(例:親和性は発現タンパク質に対してのみ測定可能)を最適化フレームワークに組み込むことで、計算的ドラッグディスcoveryの加速を図ること。
提案手法
- 各目的関数を、ゼロ値と非ゼロ値の結果を分類するバイナリ分類器と、非ゼロ値を回帰する連続回帰器の混合としてモデル化することで、生物学的特性のゼロインフレートモデル化を可能にする。
- 子目的関数が親目的関数の妥当性閾値を満たす設計に対してのみ最適化されるように、有向無閉路グラフ(DAG)を介して目的関数に部分順序を強制する。
- サーヴェイモデルからの事後サンプルを、DAG構造を尊重するように変換することで、親特性に条件づけられた妥当な設計のみが子目的関数の最適化に考慮されるように保証する。
- 取得関数は、DAG構造を反映した事後分布に適応した期待ハイパーボリューム改善(EHVI)を用い、階層的制約下での連合最適化を可能にする。
- この手法は、標準的な多目的BOループ内で動作し、取得関数評価の前処理として、DAGに適応した事後分布変換を統合する。
実験結果
リサーチクエスチョン
- RQ1発現が親和性の前に来るなど、既知の部分順序を持つ目的関数を効果的に優先できるベイズ最適化フレームワークは、連合陽性の識別を向上させることができるか?
- RQ2バイナリ発現と実数値親和性という混合変数の目的関数を、ゼロインフレート分布でモデル化することで、生物学的配列設計における最適化性能にどのような影響を与えるか?
- RQ3目的関数間に階層的依存関係を強制することで、非妥当または無駄なラボ評価の回数はどの程度削減されるか?
- RQ4DAG構造を有する事後分布変換は、標準的な多目的BOと比較して、連合陽性に関する事後信念をより正確に形成するか?
主な発見
- ペニシリン生産タスクでは、シミュレーテッドアクティブラーニングの反復において、qNEHVIとRandomベースラインに比べてPropertyDAG-BOが顕著に多くの連合陽性を同定し、分散が低く、一貫した改善を示した。
- Branin-Currinおもちゃ問題では、qNEHVI-DAGは目的関数1(親和性)の閾値を超える候補をより多く選択し、qNEHVIとRandomに比べてより高い連合陽性数を達成しており、特に後期の反復で顕著であった。
- 実世界の抗体設計タスクでは、qNEHVI-DAGがqNEHVIとRandomよりも多くの連合陽性(発現する結合タンパク質)を同定した。誤差帯は、5つのデータ分割と繰り返し試行において一貫した優位性を示した。
- テストセットの親和性測定値における対数事後密度は、qNEHVI-DAGで最も高かった。これは、最終反復後にそのサーヴェイモデルが連合陽性に関するより正確な信念を形成していたことを示している。
- このフレームワークは、合成的から実生物学的問題まで多様なタスクにおいて強固なパフォーマンスを示し、ドラッグデザインにおける混合変数で部分的に順序付けられた目的関数への一般化可能性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。