[논문 리뷰] PropertyDAG: Multi-objective Bayesian optimization of partially ordered, mixed-variable properties for biological sequence design
PropertyDAG는 항체 설계에서 표현이 친화성 이전에 이루어져야 하는 것과 같이 혼합 변수 생물학적 시퀀스 특성 간의 부분 순서를 강제하는 베이지안 최적화 프레임워크를 도입한다. 이를 위해 후행 추정에 대한 변형을 통해 영점이 희박한 목표를 모델링하고 부모 특성의 타당성에 조건화된 최적화를 수행한다. 이는 표준 다목적 BO에 비해 상호 양성(예: 발현되고 강력한 항체)을 더 잘 식별하여, 펜리실린, 토이, 실제 항체 작업에서 시뮬레이션된 활성 학습에서 더 높은 상호 양성 수와 더 정확한 후행 신뢰도를 달성한다.
Bayesian optimization offers a sample-efficient framework for navigating the exploration-exploitation trade-off in the vast design space of biological sequences. Whereas it is possible to optimize the various properties of interest jointly using a multi-objective acquisition function, such as the expected hypervolume improvement (EHVI), this approach does not account for objectives with a hierarchical dependency structure. We consider a common use case where some regions of the Pareto frontier are prioritized over others according to a specified $ extit{partial ordering}$ in the objectives. For instance, when designing antibodies, we would like to maximize the binding affinity to a target antigen only if it can be expressed in live cell culture -- modeling the experimental dependency in which affinity can only be measured for antibodies that can be expressed and thus produced in viable quantities. In general, we may want to confer a partial ordering to the properties such that each property is optimized conditioned on its parent properties satisfying some feasibility condition. To this end, we present PropertyDAG, a framework that operates on top of the traditional multi-objective BO to impose this desired ordering on the objectives, e.g. expression $ ightarrow$ affinity. We demonstrate its performance over multiple simulated active learning iterations on a penicillin production task, toy numerical problem, and a real-world antibody design task.
연구 동기 및 목표
- 표준 다목적 베이지안 최적화가 항체 설계와 같이 표현이 친화성 이전이어야 하는 생물학적 시퀀스 특성 간의 계층적 의존성을 다루는 데에 한계가 있다는 문제를 해결하기 위해.
- 일부 특성이 초과 영점(예: 발현되지 않은 항체)을 보이고 비제로 값에 대해 두꺼운 尾 꼬리 분포를 보이는 경우가 많은 생물학적 설계에서 흔한 혼합 변수 목표를 모델링하기 위해.
- 부모 특성 임계값을 충족하는 설계부터 하류 목표를 최적화함으로써 샘플 효율성을 높여 활성 학습에서 우선순위를 정하기 위해.
- 실험적 및 생물학적 사전 지식(예: 친화성은 발현된 단백질에서만 측정 가능함)을 최적화 프레임워크에 통합하여 계산 기반 약물 발견을 가속화하기 위해.
제안 방법
- 모든 목표를 영점 대비 비영점 결과를 위한 이진 분류기와 비영점 값에 대한 연속 회귀기의 혼합으로 모델링하여 생물학적 특성의 영점 희박성 모델링을 가능하게 한다.
- 방향성 비순환 그래프(DAG)를 통해 목표 간 부분 순서를 강제하며, 자식 목표는 부모 목표의 타당성 임계값을 충족하는 설계에서만 최적화된다.
- 서면 모델의 후행 표본은 DAG 구조를 존중하도록 변환되어, 자식 목표 최적화를 위한 타당한 부모 조건을 충족하는 설계만 고려된다.
- 획득 함수는 DAG로 구조화된 후행에 적응된 기대 히퍼볼륨 개선(EHVI)을 사용하여 계층적 제약 조건 하에서 공동 최적화를 가능하게 한다.
- 이 방법은 표준 다목적 BO 루프 내에서 작동하며, 획득 함수 평가 이전에 DAG 인식 후행 변환을 사전 처리 단계로 통합한다.
실험 결과
연구 질문
- RQ1표현이 친화성 이전이어야 하는 것과 같이 알려진 부분 순서를 가진 목표를 효과적으로 우선순위화할 수 있는가? 이는 공동 양성 식별을 향상시키는가?
- RQ2영점이 희박한 분포로 모델링된 혼합 변수 목표(이진 표현, 실수값 친화성)는 생물학적 시퀀스 설계에서 최적화 성능에 어떤 영향을 미치는가?
- RQ3목표 간 계층적 의존성을 강제할 경우, 비타당하거나 낭비된 실험 평가 수가 얼마나 감소하는가?
- RQ4DAG로 구조화된 후행 변환은 표준 다목적 BO에 비해 공동 양성에 대한 후행 신뢰도를 더 정확하게 제공하는가?
주요 결과
- 펜리실린 생산 작업에서, PropertyDAG-BO는 qNEHVI와 Random 기준선에 비해 시뮬레이션된 활성 학습 반복 과정에서 유의미하게 더 많은 공동 양성을 식별했으며, 분산은 낮고 일관된 향상이 있었다.
- Branin-Currin 토이 문제에서, qNEHVI-DAG는 목표 1(친화성) 기준치를 초과하는 후보를 더 많이 선택했고, qNEHVI와 Random에 비해 더 높은 공동 양성 수를 달성했으며, 특히 후반 반복에서 두드러졌다.
- 실제 항체 설계 작업에서, qNEHVI-DAG는 qNEHVI와 Random보다 더 많은 공동 양성(발현되는 결합체)을 식별했으며, 오차 밴드는 다섯 개의 데이터 분할과 반복 시험 전반에서 일관된 우월성을 보였다.
- 테스트 세트 친화성 측정치에서 평가된 로그 후행 밀도는 qNEHVI-DAG에서 가장 높았으며, 이는 최종 반복 후 그 후행 모델이 공동 양성에 대해 더 정확한 신뢰도를 형성했음을 시사한다.
- 이 프레임워크는 합성 문제에서부터 실제 생물학적 문제까지 다양한 작업에서 뛰어난 성능을 보였으며, 이는 약물 설계에서 혼합 변수 및 부분적으로 순서가 지정된 목표에 대한 일반화 가능성의 확인을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.