Skip to main content
QUICK REVIEW

[논문 리뷰] Constant Size Molecular Descriptors For Use With Machine Learning

Christopher R. Collins, Geoffrey J. Gordon|arXiv (Cornell University)|2017. 01. 23.
Computational Drug Discovery Methods참고 문헌 2인용 수 7
한 줄 요약

이 논문은 분자의 크기와 관계없이 일정한 크기의 분자 기술자를 소개하며, 국소 원자 환경과 원자 간 거리를 포괄한다. 연결성 수와 인코딩된 거리 특징을 조합함으로써, 열역학적 및 전자적 성질을 포함한 분자 성질 예측에서 최신 기술 수준의 성능을 달성한다. 이는 작은 분자로 훈련된 모델이 더 큰 분자로 효과적으로 일반화될 수 있도록 한다.

ABSTRACT

A set of molecular descriptors whose length is independent of molecular size is developed for machine learning models that target thermodynamic and electronic properties of molecules. These features are evaluated by monitoring performance of kernel ridge regression models on well-studied data sets of small organic molecules. The features include connectivity counts, which require only the bonding pattern of the molecule, and encoded distances, which summarize distances between both bonded and non-bonded atoms and so require the full molecular geometry. In addition to having constant size, these features summarize information regarding the local environment of atoms and bonds, such that models can take advantage of similarities resulting from the presence of similar chemical fragments across molecules. Combining these two types of features leads to models whose performance is comparable to or better than the current state of the art. The features introduced here have the advantage of leading to models that may be trained on smaller molecules and then used successfully on larger molecules.

연구 동기 및 목표

  • 분자의 크기에 따라 변하지 않는 크기의 분자 기술자를 개발하여 효율적이고 일반화 가능한 기계학습 모델을 가능하게 한다.
  • 기존 방법인 쿨롱 행렬과 Bag of Bonds (BoB)와 같이 분자의 크기에 따라 제곱적으로 증가하는 한계를 해결한다.
  • 국소 화학적 환경과 원자 간 거리를 인코딩하여 작은 분자에서 큰 분자로의 모델 일반화를 향상시킨다.
  • SMILES 또는 2차원 연결성에서 유도된 특징을 사용하면서도 3차원 기하학적 정보를 통합하여 예측 성능을 향상시킨다.
  • 기본 데이터셋인 QM9에서 일정한 크기의 특징이 최신 기술 수준의 방법과 비교해도 성능이 유사하거나 뛰어나다는 것을 입증한다.

제안 방법

  • 원자 및 결합 유형을 요약하기 위해 랭크-1 및 랭크-2 연결성 수를 사용하여 국소 화학 조각을 포착한다.
  • 모든 원자 간의 쌍방향 거리에 대한 스무딩 히스토그램을 표현하는 고정 크기의 벡터로 인코딩된 거리 특징을 도입한다. 이는 비결합 원자 쌍까지 포함한다.
  • 연결성 수와 인코딩된 거리 특징을 하나의 고정 크기의 특징 벡터로 조합하여 분자의 크기에 영향을 받지 않는다.
  • 표준 커널을 사용하여 이러한 특징과 함께 커널 리지 회귀(KRR)를 적용하여 분자 성질을 예측한다.
  • 거리 인코딩에 고정된 박스 수를 사용하여 특징 벡터 길이가 분자의 크기와는 무관하게 원소 및 결합 유형의 다양성에만 의존하도록 보장한다.
  • 작은 분자 서브셋으로 모델을 훈련하고 더 큰 분자에서의 성능을 평가하여 일반화 능력을 시험한다.

실험 결과

연구 질문

  • RQ1다양한 크기의 분자에서 예측 성능를 유지할 수 있는 일정한 크기의 분자 기술자를 설계할 수 있는가?
  • RQ2연결성 수와 인코딩된 거리 특징이 결합될 경우, 작은 분자에서 큰 분자로의 모델 일반화가 어느 정도 향상되는가?
  • RQ3인코딩된 거리 특징을 통한 3차원 기하학적 정보의 통합은 2차원 연결성만을 사용하는 특징보다 모델 성능을 얼마나 향상시키는가?
  • RQ4작은 분자로 훈련된 모델이 일정한 크기의 기술자를 사용할 경우 더 큰 분자의 성질을 성공적으로 예측할 수 있는가?
  • RQ5표준 데이터셋에서 최신 기술 수준의 방법인 쿨롱 행렬 또는 BoB 특징과 비교해 이 기술자들은 성능에서 어떻게 다른가?

주요 결과

  • 제안된 특징 벡터 $\bm{12^{NP}3^{B}4^{B}}$ 는 기수 에너지 예측에서 평균 절대 오차(MAE)가 1.6 kcal/mol로 최신 기술 수준의 모델과 유사하거나 뛰어나다.
  • 열역학적 성질인 $U_0$, $U$, $H$, $G$ 에 대해서는 MAE가 2.1 kcal/mol 이하로 나타나 강력한 예측 성능를 보인다.
  • 열용량은 MAE가 0.10 cal/(mol K)로, null 모델 오차의 2%에 불과하여 매우 높은 정확도를 보인다.
  • HOMO 및 LUMO 에너지와 HOMO-LUMO 갭은 MAE가 0.2 eV 이하로 전자적 성질 예측에 있어 양호한 성능를 나타낸다.
  • 분자 조각의 덧셈 성질을 가지는 분극화율($\alpha$)은 null 모델 오차의 6.5% 수준의 MAE를 기록하여 뛰어난 성능를 반영한다.
  • 다이폴 모멘트($\mu$)는 상대적으로 낮은 성능를 보이며, null 모델 대비 MAE 감소율이 50%에 그쳐, 강한 전역 분자 기하학적 의존성으로 인해 이는 기대되는 바이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.