Skip to main content
QUICK REVIEW

[논문 리뷰] Autofocused oracles for model-based design

Clara Fannjiang, Jennifer Listgarten|arXiv (Cornell University)|2020. 06. 14.
Image Processing Techniques and Applications참고 문헌 51인용 수 17
한 줄 요약

이 논문은 모델 기반 설계 중에 설계 공간의 분포 외부 영역에서 성능을 향상시키기 위해 동적으로 회귀 오라클을 업데이트하는 자동 초점 조절(autofocusing) 방법을 소개한다. 설계를 비영제로 게임으로 공식화하고 높은 신뢰도 예측을 기반으로 반복적으로 오라클을 재학습시킴으로써, 초전도체 물질 및 단백질 설계 벤치마크에서 예측 정확도를 크게 향상시키고 높은 성능을 보이는 후보를 발견한다. 이는 임계 온도 예측의 중앙값에서 최대 50% 향상되고, 훈련 데이터 최대치를 초월할 확률이 5.3% 증가하는 데 기여한다.

ABSTRACT

Data-driven design is making headway into a number of application areas, including protein, small-molecule, and materials engineering. The design goal is to construct an object with desired properties, such as a protein that binds to a therapeutic target, or a superconducting material with a higher critical temperature than previously observed. To that end, costly experimental measurements are being replaced with calls to high-capacity regression models trained on labeled data, which can be leveraged in an in silico search for design candidates. However, the design goal necessitates moving into regions of the design space beyond where such models were trained. Therefore, one can ask: should the regression model be altered as the design algorithm explores the design space, in the absence of new data? Herein, we answer this question in the affirmative. In particular, we (i) formalize the data-driven design problem as a non-zero-sum game, (ii) develop a principled strategy for retraining the regression model as the design algorithm proceeds---what we refer to as autofocusing, and (iii) demonstrate the promise of autofocusing empirically.

연구 동기 및 목표

  • 훈련 데이터에서 멀리 떨어진 영역에서 오라클 예측의 신뢰성이 떨어지는 문제를 해결하기 위해.
  • 설계 과정이 새로운 영역을 탐색함에 따라 새로운 레이블 데이터가 필요 없이 오라클 모델을 원칙적으로 업데이트할 수 있는 전략을 개발하기 위해.
  • 설계 알고리즘과 오라클 간의 비영제로 게임으로 설계 과정을 공식화하여 공동 최적화를 가능하게 하기 위해.
  • 반복적인 오라클 재학습(자기 초점 조절)이 발견된 설계의 품질을 향상시킨다는 것을 경험적으로 검증하기 위해.
  • 자기 초점 조절이 실제 설계 과제에서 예측 정확도 향상과 높은 성능을 보이는 후보의 발견을 향상시킨다는 것을 보여주기 위해.

제안 방법

  • 설계 알고리즘(검색 모델)과 오라클(회귀 모델) 간의 비영제로 게임으로 모델 기반 설계를 공식화하며, 양측 모두가 각자의 목표를 최적화하기 위해 노력한다.
  • 게임의 나시 균형(Nash equilibrium)을 찾는 데 기반한 오라클 업데이트 전략을 유도하며, 검색 모델이 생성한 높은 신뢰도 예측을 바탕으로 가중 최대우도 추정을 사용해 오라클을 재학습시킨다.
  • 현재 검색 분포에서 예측된 성능 값이 높은 샘플을 주기적으로 사용해 오라클을 재학습함으로써 자기 초점 조절을 구현한다. 이는 관심 영역을 우선순위로 삼는다.
  • 다양한 후보 설계를 생성하고 오라클 업데이트 과정을 안내하기 위해 검색 모델(예: Potts 모델 또는 변분 오토에인코더)을 사용한다.
  • 다양한 최적화 알고리즘(RWR, CMA-ES, CEM-PI 등)을 적용하고 단백질 및 초전도체 물질 설계 과제에서 성능을 평가한다.
  • 중앙값 및 최대 예측 성능 값, 개선 가능성 백분율(PCI), 스피어만 상관계수, 진짜 측정치와의 RMSE 등 다양한 지표를 사용해 결과를 평가한다.

실험 결과

연구 질문

  • RQ1오라클 모델을 반복적으로 재학습함으로써 훈련 데이터에서 멀리 떨어진 설계 공간 영역에서의 설계 성능을 향상시킬 수 있는가?
  • RQ2설계를 비영제로 게임으로 공식화함으로써 오라클 업데이트에 대한 원칙적인 전략을 어떻게 도출할 수 있는가?
  • RQ3고정된 오라클보다 자기 초점 조절이 높은 성능을 보이는 설계의 발견을 더 잘 향상시키는가?
  • RQ4자기 초점 조절은 분포 외부 영역에서 예측 정확도와 신뢰성 향상에 어느 정도 기여하는가?
  • RQ5다양한 모델 기반 최적화 알고리즘과 설계 과제에서 자기 초점 조절의 성능는 어떻게 변화하는가?

주요 결과

  • 자기 초점 조절은 비자기 초점 조절 기준선 대비 초전도체 물질의 중앙값 예측 임계 온도를 30.7 K 향상시켰다(p < 0.01).
  • 동일한 과제에서 최대 예측 임계 온도는 18.6 K 향상되었고, 훈련 데이터 최대치를 초월할 확률이 4.3% 증가했다.
  • 단백질 설계 과제에서 자기 초점 조절 오라클은 진짜 값과 0.55의 스피어만 상관계수를 기록했으며, 기준선 대비 0.52 향상되었다(p < 0.01).
  • 초전도체 물질 과제에서 자기 초점 조절은 오라클과 진짜 예측 간의 루트 평균 제곱 오차(RMSE)를 6.1 K 감소시켰다(p < 0.01).
  • CMA-ES 최적화 방법에서 자기 초점 조절은 중앙값 예측 성능 값을 14.1 K 향상시켰고, 최대값은 15.9 K 향상되었다(p < 0.05).
  • 시험한 6종의 MBO 방법 전반에서 비자기 초점 조절 기준선을 일관되게 능가했으며, 18개 성능 지표 중 15개에서 통계적으로 유의미한 향상이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.