[논문 리뷰] SPICE, A Dataset of Drug-like Molecules and Peptides for Training Machine Learning Potentials
SPICE는 약물 유사 분자, 다펩티드 및 용매화된 아미노산의 110만 개 이상의 구조적 형태를 포함하는 대규모 양자화학 데이터셋이며, ωB97M-D3(BJ)/def2-TZVPPD 수준의 이론에서 계산되었다. 이 데이터셋은 다양한 화학적 공간, 공유 결합 및 비공유 결합 상호작용을 포함하여 화학적 정확도를 달성하는 기계학습 잠재에너지함수의 학습을 가능하게 하며, 이에 힘입어 힘, 에너지, 다중극 모멘트 및 결합 순서가 제공되어 이식 가능하고 고정밀도의 시뮬레이션을 가능하게 한다.
Machine learning potentials are an important tool for molecular simulation, but their development is held back by a shortage of high quality datasets to train them on. We describe the SPICE dataset, a new quantum chemistry dataset for training potentials relevant to simulating drug-like small molecules interacting with proteins. It contains over 1.1 million conformations for a diverse set of small molecules, dimers, dipeptides, and solvated amino acids. It includes 15 elements, charged and uncharged molecules, and a wide range of covalent and non-covalent interactions. It provides both forces and energies calculated at the ωB97M-D3(BJ)/def2-TZVPPD level of theory, along with other useful quantities such as multipole moments and bond orders. We train a set of machine learning potentials on it and demonstrate that they can achieve chemical accuracy across a broad region of chemical space. It can serve as a valuable resource for the creation of transferable, ready to use potential functions for use in molecular simulations.
연구 동기 및 목표
- 생물분자 시뮬레이션에서 기계학습 잠재에너지함수를 학습하기 위한 고품질이고 다양한 데이터셋의 부족 문제를 해결한다.
- 약물 유사 저분자, 이량체, 다펩티드 및 용매화된 아미노산을 포함하는 종합적인 데이터셋을 제공하여 다양한 전자적 및 공간적 환경을 커버한다.
- 단백질-리간드 상호작용에 적용 가능한 이식 가능한 기계학습 잠재에너지함수의 학습을 지원한다.
- 정확도가 높은 양자화학적 데이터, 즉 힘, 에너지, 다중극 모멘트 및 결합 순서를 포함하여 모델 학습의 강건성을 확보한다.
- 넓은 영역의 화학적 공간에서 화학적 정확도를 달성하는 기계학습 잠재에너지함수의 개발을 가능하게 한다.
제안 방법
- 다양한 저분자, 다펩티드 및 용매화된 아미노산에서 체계적이고 무작위 샘플링을 통해 110만 개 이상의 구조적 형태를 생성한다.
- 전자 구조 성질을 ωB97M-D3(BJ)/def2-TZVPPD 수준의 이론에서 계산하며, 총 에너지 및 해석적 힘을 포함한다.
- 전자기적 및 결합 특성 학습을 향상시키기 위해 다중극 모멘트 및 결합 순서와 같은 추가 성질을 포함한다.
- 15개의 다양한 원소(이온화 및 비이온화 종 포함)를 사용하여 광범위한 화학적 커버리지 확보.
- 표준 아키텍처를 사용하여 데이터셋 기반으로 다수의 기계학습 잠재에너지함수를 학습하고 이식 가능성과 정확도를 평가한다.
- 공유 결합 및 비공유 결합 상호작용을 포함한 다양한 화학적 환경에서 성능을 검증한다.
실험 결과
연구 질문
- RQ1약물 유사 분자와 펩티드로 구성된 대규모이고 다양한 데이터셋은 화학적 정확도를 달성하는 기계학습 잠재에너지함수의 학습을 가능하게 할 수 있는가?
- RQ2SPICE에서 학습된 기계학습 잠재에너지함수는 비공유 결합 및 이온화 종을 포함한 다양한 종류의 분자 상호작용으로 일반화되는 정도는 어느 정도인가?
- RQ3다중극 모멘트 및 결합 순서와 같은 보조 성질의 포함이 모델의 이식 가능성과 정확도 향상에 어떤 영향을 미치는가?
- RQ4SPICE 데이터셋은 생물분자 시뮬레이션을 위한 즉시 사용 가능한 이식 가능한 기계학습 잠재에너지함수의 개발을 지원할 수 있는가?
- RQ5SPICE에서 학습된 모델은 다양한 화학적 환경에서 공유 결합 및 비공유 결합 상호작용을 얼마나 잘 포괄하는가?
주요 결과
- SPICE 데이터셋은 약물 유사 분자, 이량체, 다펩티드 및 용매화된 아미노산의 110만 개 이상의 구조적 형태를 포함하며, 광범위한 화학적 공간을 커버한다.
- 양자화학적 계산은 ωB97M-D3(BJ)/def2-TZVPPD 수준에서 수행되어 고정밀도 에너지 및 해석적 힘을 제공한다.
- 데이터셋은 15개의 원소, 이온화 및 비이온화 종, 다양한 공유 및 비공유 결합 상호작용을 포함한다.
- 전자 구조 학습을 향상시키기 위해 다중극 모멘트 및 결합 순서와 같은 보조 성질이 제공된다.
- SPICE에서 학습된 기계학습 잠재에너지함수는 다양한 분자 구조 및 상호작용 유형에서 화학적 정확도를 달성한다.
- 이 데이터셋은 단백질과 리간드를 포함한 분자 시뮬레이션에 적합한 이식 가능하고 즉시 사용 가능한 기계학습 잠재에너지함수의 개발을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.