Skip to main content
QUICK REVIEW

[논문 리뷰] QMugs: Quantum Mechanical Properties of Drug-like Molecules

Clemens Isert, Kenneth Atz|arXiv (Cornell University)|2021. 01. 01.
Computational Drug Discovery Methods참고 문헌 15인용 수 7
한 줄 요약

QMugs는 665,000개가 넘는 약물 유사 분자를 대상으로 한 개방형 데이터셋으로, 최적화된 기하학적 구조, 열역학적 데이터, 그리고 GFN2-xTB 및 ωB97X-D/def2-SVP 수준의 이론에서 계산된 전자적 성질을 포함한다. 이 데이터셋은 7테라바이트가 넘는 파동함수, DFT 밀도, 궤도 행렬을 제공하여 기계학습 모델이 다중 수준의 양자화학적 데이터로부터 학습하고 분자의 구조와 생물학적 활성 간의 관계를 연결할 수 있도록 한다.

ABSTRACT

Machine learning approaches in drug discovery, as well as in other areas of the chemical sciences, benefit from curated datasets of physical molecular properties. However, there is a lack of sufficiently large data collections that include first-principle quantum chemical information on bioactive molecules, such as single-point electronic properties, quantum mechanical wave functions and density-functional theory (DFT) matrices. The open-access QMugs (Quantum-Mechanical Properties of Drug-like Molecules) dataset fills this void. The QMugs collection comprises quantum mechanical properties of more than 665k biologically and pharmacologically relevant molecules extracted from the ChEMBL database, totaling $\sim$2M conformers. QMugs contains optimized molecular geometries and thermodynamic data obtained via the semi-empirical method GFN2-xTB. Atomic and molecular properties (e.g., partial charges, energies, and rotational constants) are provided on both the GFN2-xTB and on the DFT ($\omega$B97X-D/def2-SVP) levels of theory. QMugs also comprises the respective quantum mechanical wave functions, including DFT density and orbital matrices, totaling over 7 terabytes of uncompressed data. This dataset is intended to facilitate the development of models that learn from molecular data on different levels of theory while also providing insight into the corresponding relationships between molecular structure and biological activity.

연구 동기 및 목표

  • 생물활성 분자의 첫 원리 양자화학적 데이터를 포함하는 대규모로 정제된 데이터셋의 부족을 보완하기 위해.
  • 다양한 수준의 이론에서 파생된 파동함수, 부분 전하, 에너지 등을 포함한 종합적인 양자역학적 성질을 약물 유사 분자에 대해 제공하기 위해.
  • 다중 수준의 양자 데이터로부터 학습하는 기계학습 모델을 통해 구조-활성 관계 예측 성능을 향상시키기 위해.
  • 양자역학적 성질과 생물학적 활성, 분자 안정성 간의 관계를 연결하는 모델 개발을 촉진하기 위해.
  • 연구의 가속화를 위해 공개적이고 재현 가능한 자원을 제공하여 계산 화학 및 약물 발견 분야의 연구를 지원하기 위해.

제안 방법

  • ChEMBL 데이터베이스에서 생물학적으로 관련성이 있는 665,000개의 분자를 약물 유사 화합물의 원천으로 추출하였다.
  • 반경험적 GFN2-xTB 방법을 사용하여 기하학적 최적화 및 열역학적 성질 계산을 수행하였다.
  • 부분 전하, 궤도 에너지, 회전 상수 등의 전자적 성질을 GFN2-xTB 및 ωB97X-D/def2-SVP DFT 수준에서 계산하였다.
  • 모든 구형체에 대해 양자역학적 파동함수, 전자 밀도, 궤도 행렬을 생성하고 저장하였다.
  • 확장 가능한 개방형 형식으로 데이터를 정리하고 재현성 및 모델 훈련을 위한 메타데이터를 포함하였다.
  • 모든 분자에서 일관된 양자화학적 처리를 보장하기 위해 데이터 완전성을 확보하였으며, 200만 개 이상의 구형체를 포함하였다.

실험 결과

연구 질문

  • RQ1약물 유사 분자에 대한 대규모 양자역학적 데이터는 어떻게 체계적으로 생성하고 정제하여 기계학습 응용에 활용할 수 있는가?
  • RQ2다양한 수준의 이론에서 분자의 구조와 부분 전하, 궤도 에너지 등의 양자역학적 성질 간의 관계는 어떠한가?
  • RQ3반경험적(GFN2-xTB) 및 DFT(ωB97X-D/def2-SVP) 방법이 생물활성 분자에 대해 일관된 전자적 및 열역학적 성질을 얼마나 잘 산출하는가?
  • RQ4완전한 파동함수 및 궤도 행렬의 포함이 기계학습 모델의 분자 성질 예측 성능 향상에 기여하는가?
  • RQ5다중 수준의 양자 데이터 가용성이 약물 발견에서 모델의 해석 가능성과 이식 가능성 향상에 어떻게 기여하는가?

주요 결과

  • QMugs는 약 665,000개의 약물 유사 분자를 포함하며, 약 200만 개의 구형체를 포함하고 있으며, 다양한 수준의 이론에서 일관된 양자역학적 데이터를 제공한다.
  • GFN2-xTB 방법을 통해 최적화된 기하학적 구조와 열역학적 성질을 계산하여 대규모 걸러내기에서 계산 효율성과 정확성을 확보하였다.
  • 부분 전하, 에너지, 회전 상수 등의 원자 및 분자 성질을 GFN2-xTB 및 ωB97X-D/def2-SVP DFT 수준에서 계산하여 수준 간 비교를 가능하게 하였다.
  • 파동함수, 전자 밀도, 궤도 행렬을 포함한 압축 해제된 7테라바이트가 넘는 양자역학적 데이터를 생성하고 공개하였다.
  • 반경험적 및 DFT 방법 간 일관성 있는 데이터 제공을 통해 다중 척도 모델링을 지원하여 모델의 일반화 및 전이 학습 능력을 향상시켰다.
  • QMugs는 다양한 수준의 이론에서 양자역학적 데이터를 기반으로 학습하는 기계학습 모델을 가능하게 하여, 구조-활성 관계 예측 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.