Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Molecular Design by Stochastic Iterative Target Augmentation

Kevin Yang, Wengong Jin|arXiv (Cornell University)|2020. 02. 11.
Machine Learning in Materials Science참고 문헌 48인용 수 4
한 줄 요약

이 논문은 사전 훈련된 성능 예측기로 고품질 생성 분자를 걸러내고 반복적으로 훈련 데이터를 보강함으로써 분자 생성을 향상시키는 확률적 반복 대상 보강 방법을 제안한다. 이 방법은 아키텍처 변경 없이 자기 훈련을 통해 조건부 분자 설계에서 이전 최고 성능 모델을 크게 능가하며, 성능 향상이 10퍼센트 이상 발생한다.

ABSTRACT

Generative models in molecular design tend to be richly parameterized, data-hungry neural models, as they must create complex structured objects as outputs. Estimating such models from data may be challenging due to the lack of sufficient training data. In this paper, we propose a surprisingly effective self-training approach for iteratively creating additional molecular targets. We first pre-train the generative model together with a simple property predictor. The property predictor is then used as a likelihood model for filtering candidate structures from the generative model. Additional targets are iteratively produced and used in the course of stochastic EM iterations to maximize the log-likelihood that the candidate structures are accepted. A simple rejection (re-weighting) sampler suffices to draw posterior samples since the generative model is already reasonable after pre-training. We demonstrate significant gains over strong baselines for both unconditional and conditional molecular design. In particular, our approach outperforms the previous state-of-the-art in conditional molecular design by over 10% in absolute gain. Finally, we show that our approach is useful in other domains as well, such as program synthesis.

연구 동기 및 목표

  • 추가적인 고품질 훈련 타겟을 생성함으로써 분자 생성에서의 데이터 부족 문제를 해결한다.
  • 저자료 환경에서 데이터 집약적인 생성 모델의 성능을 향상시킨다.
  • 무조건적 및 조건부 분자 설계 모두에 효과적인 방법을 개발한다.
  • 화학을 초월한 일반화 능력을 입증한다. 프로그램 합성과 같은 분야에서도 적용 가능하다.
  • 확률적 기반 최적화 프레임워크에 이르게 하는 이론적으로 탄탄한 반복 자기 훈련 프레임워크를 제공한다.

제안 방법

  • 소규모 레이블이 부여된 데이터셋에서 생성 모델과 성능 예측기를 사전 훈련한다.
  • 훈련된 성능 예측기를 확률 밀도 필터로 사용하여 생성 모델에서 고점수를 받은 후보 분자를 선별한다.
  • 선별된 후보들에 대해 반복적으로 생성 모델을 재훈련하며, 이를 새로운 훈련 타겟으로 간주한다.
  • 이 과정을 확률적 기대최대화(EM)로 간주하여 수락된 후보들의 로그우도를 최대화한다.
  • 모델의 초기 품질을 활용하여 단순한 기각(재가중) 샘플러를 적용하여 사후 분포 샘플을 추출한다.
  • 추론 시 적용 가능한 전이 적응을 위해 추론 중에 필터를 적용함으로써 방법을 확장한다.

실험 결과

연구 질문

  • RQ1성능 예측기를 사용한 반복 자기 훈련이 데이터가 부족한 환경에서 분자 생성 성능을 크게 향상시킬 수 있는가?
  • RQ2무조건적 및 조건부 분자 설계 과제에서 제안된 방법이 강력한 기준 모델과 비교해 어떻게 성능을 내는가?
  • RQ3외부 성능 예측기의 품질에 대해 이 방법이 얼마나 강인한가?
  • RQ4이 방법은 분자 설계를 초월하여 작업별 제약 조건이 있는 다른 생성 과제로 일반화될 수 있는가?
  • RQ5이 방법은 원칙적인 최적화 프레임워크에 이론적으로 기반되어 있는가?

주요 결과

  • 이 방법은 조건부 분자 설계에서 이전 최고 성능 모델 대비 10퍼센트 이상의 절대적인 성능 향상을 달성한다.
  • 이 방법은 무조건적 및 조건부 분자 생성 과제 양쪽 모두에서 성능 향상을 크게 개선한다.
  • 이 방법은 외부 성능 예측기의 품질에 대해 강인하며, 불완전한 필터를 사용할 경우에도 일관된 성능 향상을 보인다.
  • 이 방법은 프로그램 합성 과제로도 효과적으로 일반화되어 강력한 강화학습 기반 기준 모델을 능가한다.
  • 이 방법은 아키텍처 개선과 상호보완적이며, 모델 수정 없이 성능 향상을 이룬다.
  • 반복적 타겟 보강 과정은 수용된 후보들의 우도를 최대화하는 방식으로 확률적 기대최대화(EM)의 한 형태로 이론적으로 정당화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.