Skip to main content
QUICK REVIEW

[논문 리뷰] Transition1x -- a Dataset for Building Generalizable Reactive Machine Learning Potentials

Mathias Schreiner, Arghya Bhowmik|arXiv (Cornell University)|2022. 07. 25.
Machine Learning in Materials Science인용 수 8
한 줄 요약

Transition1x는 반응 경로를 포함하는 수백만 개의 분자 구성을 포함한 대규모 DFT 생성 데이터셋으로, Nudged Elastic Band(NEB) 및 CINEB 방법을 사용하여 전이 상태와 퍼텐셜 에너리 표면의 고에너지 영역을 체계적으로 샘플링한다. 이 데이터셋은 ANI1x 및 QM9x보다 전이 상태 예측 정확도가 뛰어나며, 반응 장벽과 동역학 모델링에 특히 유리하다.

ABSTRACT

Machine Learning (ML) models have, in contrast to their usefulness in molecular dynamics studies, had limited success as surrogate potentials for reaction barrier search. It is due to the scarcity of training data in relevant transition state regions of chemical space. Currently, available datasets for training ML models on small molecular systems almost exclusively contain configurations at or near equilibrium. In this work, we present the dataset Transition1x containing 9.6 million Density Functional Theory (DFT) calculations of forces and energies of molecular configurations on and around reaction pathways at the wB97x/6-31G(d) level of theory. The data was generated by running Nudged Elastic Band (NEB) calculations with DFT on 10k reactions while saving intermediate calculations. We train state-of-the-art equivariant graph message-passing neural network models on Transition1x and cross-validate on the popular ANI1x and QM9 datasets. We show that ML models cannot learn features in transition-state regions solely by training on hitherto popular benchmark datasets. Transition1x is a new challenging benchmark that will provide an important step towards developing next-generation ML force fields that also work far away from equilibrium configurations and reactive systems.

연구 동기 및 목표

  • 다양한 화학 반응에 일반화 가능한 반응성 기계학습 잠재력 학습을 위한 종합적이고 고품질의 훈련 데이터 부족 문제를 해결하기 위해.
  • ANI1x 및 QM9x와 같은 기존 데이터셋이 전이 상태 및 비평형 구성과 같은 반응 메커니즘 모델링에 핵심적인 구성 요소를 충분히 샘플링하지 못하는 한계를 극복하기 위해.
  • NEB 및 CINEB를 사용하여 복잡한 퍼텐셜 에너리 표면을 고정밀도로 탐색할 수 있는 확장 가능한 체계적 데이터 생성 파이프라인을 개발하기 위해.
  • ANI1x 및 QM9x와의 호환성을 확보하여 하이브리드 훈련이 가능하게 하여 반응 동역학 시뮬레이션에서 모델의 일반화 능력과 성능을 향상시키기 위해.

제안 방법

  • Grambow 등 (2020)의 GDB7 기반 데이터셋에서 유도된 11,961개의 유기 반응에서 유래한 데이터로, H, C, N, O 원자의 모든 조합을 포함한다.
  • 반응물 및 생성물의 기하학적 구조는 먼저 힘 임계값 0.01 eV/Å를 사용한 BFGS 최적화기를 통해 최적화한 후, 물리적으로 타당한 반응 경로를 생성하기 위해 IDPP를 사용한다.
  • 최소 에너지 경로(MEP)를 최적화하기 위해 Nudged Elastic Band(NEB) 방법을 적용하며, 500회 반복 동안 수렴 여부를 점검하고 수렴하지 못한 경로는 기각한다.
  • NEB 이후 CINEB를 적용하여 경로를 추가로 정밀 조정함으로써 진정한 MEP로의 수렴과 복잡한 반응 좌표 특징의 포착을 보장한다.
  • 수렴한 경로에서 유도된 모든 중간 구성은 이전에 저장된 구성과 충분히 다를 경우에만 저장되어 퍼텐셜 에너리 표면의 다양하고 중복되지 않는 샘플링을 보장한다.
  • 모든 전자 구조 계산은 ORCA 5.0.2를 사용하여 ωB97X-D3/6-31G(d) 수준의 이론에서 수행되어 고정밀도와 ANI1x와의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1MD 기반 또는 무작위 샘플링 방법에 비해 NEB 기반 데이터 생성이 반응성 기계학습 잠재력 훈련을 위한 전이 상태 및 고에너지 구성의 더 대표성 있고 다양한 샘플링을 가능하게 하는가?
  • RQ2Transition1x에서 훈련된 기계학습 모델의 성능은 ANI1x 또는 QM9x에서 훈련된 모델과 비교해 전이 상태 및 반응 장벽 예측에서 어떻게 다를까?
  • RQ3NEB로 생성된 구성의 포함이 다양한 반응 유형과 에너지 영역에서 기계학습 잠재력의 일반화 능력을 어느 정도 향상시키는가?
  • RQ4Transition1x는 ANI1x와 효과적으로 하이브리드 훈련에 활용될 수 있는가? 이를 통해 반응성 동역학 시뮬레이션에서 모델의 표현력과 정확도가 향상되는가?

주요 결과

  • Transition1x에서 훈련된 모델은 테스트 데이터에서 ANI1x 및 QM9x에서 훈련된 모델보다 전이 상태 예측에서 뚜렷이 뛰어나며, 동일한 데이터셋의 테스트 데이터에서 평균 절대 오차가 현저히 낮다.
  • NEB 기반 데이터 생성 방법은 ANI1x에서 사용된 무작위 변형 방법보다 더 현실적인 원자 간 거리를 가지는 구성 생성에 유리하다. 특히 극한의 고에너지 영역에서 두드러진다.
  • Transition1x는 전이 상태 영역에서 결합 파손 및 형성과 관련된 주요 영역에서 ANI1x보다 더 넓은 원자 간 거리 분포를 포착한다.
  • ANI1x는 전이 상태 영역을 충분히 샘플링하지 못해 일반화 능력이 떨어지며, ANI1x에서 훈련된 모델은 Transition1x 테스트 데이터에서 높은 오차를 보이며 반응성 구성 요소의 충분한 커버리지가 부족함을 시사한다.
  • QM9x에서 훈련된 모델은 ANI1x 및 Transition1x 양쪽에서 모두 성능이 열악하며, 평형 기하학적 구조에만 집중함으로써 비평형 데이터의 필요성을 드러낸다.
  • Transition1x와 ANI1x 간의 호환성 덕분에 하이브리드 훈련이 가능해졌으며, 두 데이터셋에서 동시에 훈련된 모델은 성능 향상을 보여, 다양한 데이터 소스를 융합함으로써 상호 보완적 이점을 얻을 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.