[논문 리뷰] Biological Sequence Design with GFlowNets
이 논문은 GFlowNet 기반 활성 학습(GFlowNet-AL)을 통해 GFlowNet 생성기와 불확실성 인식 프록시 및 오프라인 데이터 증강을 연결하여 다양하고 높은 점수를 가진 생물학적 서열을 생성하는 것을 제안한다.
Design of de novo biological sequences with desired properties, like protein and DNA sequences, often involves an active loop with several rounds of molecule ideation and expensive wet-lab evaluations. These experiments can consist of multiple stages, with increasing levels of precision and cost of evaluation, where candidates are filtered. This makes the diversity of proposed candidates a key consideration in the ideation phase. In this work, we propose an active learning algorithm leveraging epistemic uncertainty estimation and the recently proposed GFlowNets as a generator of diverse candidate solutions, with the objective to obtain a diverse batch of useful (as defined by some utility function, for example, the predicted anti-microbial activity of a peptide) and informative candidates after each round. We also propose a scheme to incorporate existing labeled datasets of candidates, in addition to a reward function, to speed up learning in GFlowNets. We present empirical results on several biological sequence design tasks, and we find that our method generates more diverse and novel batches with high scoring candidates compared to existing approaches.
연구 동기 및 목표
- 다단계이면서 비용이 큰 생물학적 서열의 실험 파이프라인에서 다양한 후보 설계의 필요성을 촉진한다.
- GFlowNet을 이용해 다양한 후보 서열을 생성하는 활성 학습 프레임워크(GFlowNet-AL)을 도입한다.
- 학습 속도를 높이고 탐색을 개선하기 위해 인식적 불확실성과 오프라인 데이터를 활용한다.
- 다양한 단백질 및 DNA 설계 과제에 대해 접근법을 평가하고 벤치마크와 비교한다.
제안 방법
- 보상 R(x)에 비례하는 확률로 후보를 샘플링하기 위해 GFlowNet 생성기를 사용한다.
- R(x)를 프록시 모델의 평균 μ(x)와 인식 불확실성 σ(x)의 함수로 정의하고 획득 함수 F(μ,σ)를 통해 정의한다.
- 시퀀스 x에 대해 μ와 σ를 출력하도록 프록시 모델 M을 학습시키고, 현재 데이터셋 D_i로 M을 업데이트한다.
- 선택적으로 데이터세트의 오프라인 궤적을 GFlowNet 학습에 보강하여 학습 속도를 높이고 알려진 예시 주변의 탐색을 개선한다.
- MC 드롭아웃이나 앙상블을 이용한 인식적 불확실성과 획득 함수(상한 신뢰구간 또는 기대 개선)를 결합한다.
- 흘름 매칭(flow-matching) 또는 궤적 균형(trajectory balance) 목표를 사용해 GFlowNet을 학습시켜 최종 흐름과 보상을 정렬한다.
실험 결과
연구 질문
- RQ1GFlowNet 기반 생성기가 다양성과 참신성을 유지하면서도 높은 점수를 가진 생물학적 서열을 생성할 수 있는가?
- RQ2오프라인 데이터와 인식적 불확실성을 도입하면 시퀀스 설계를 위한 활성 학습에서 학습 속도, 탐색, 생성 배치의 품질이 향상되는가?
- RQ3다양한 시퀀스 설계 과제(단백질 및 DNA)에서 GFlowNet-AL의 성능은 기존 벤치마크와 어떻게 비교되는가?
- RQ4오프라인 궤적과 불확실성 인식 보상이 TopK 선택의 다양성, 참신성, 성능에 미치는 영향은?
주요 결과
- GFlowNet-AL은 AMP 설계에서 벤치마크보다 더 높은 다양성과 참신성을 달성하고 강한 TopK 성능을 보인다.
- TF-Bind-8에서 GFlowNet-AL이 최상의 TopK와 참신성을 제공하지만 MINs가 더 높은 다양성을 보이며(전반적인 평가에서 모든 지표를 고려할 때 GFlowNet-AL이 우세)
- GFP 과제에서 GFlowNet-AL은 성능 측면에서 일부 벤치마크에 비해 떨어지나 다양성과 참신성은 경쟁력이 있으며 프록시 편향 및 평가와 관련된 주의점이 있다.
- 전 과제에서 GFlowNet-AL은 일반적으로 다양성과 참신성 지표에서 벤치마크 대비 개선을 제공하였으며 여러 과제에서 경쟁력 있거나 우수한 성능을 보였다.
- 오프라인 데이터와 불확실성 인식 보상을 결합하는 것이 학습을 가속하고 알려진 예시 주변의 탐색을 개선할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.