[논문 리뷰] Robust Training of Machine Learning Interatomic Potentials with Dimensionality Reduction and Stratified Sampling
이 논문은 차원 축소와 계층적 표본 추출을 조합한 DIRECT 표본 추출 방법을 소개한다. 이 방법은 기계학습 원자간 퍼텐셜(MLIPs)의 훈련 세트를 강건하고 다양한 것으로 선택하기 위해 개발되었다. Materials Project의 100만 개가 넘는 구조체에 DIRECT를 적용함으로써, 저비용 DFT 계산을 최소화하면서도 새로운 구성 요소나 복잡한 시스템(예: 티타늄 수소화물)에 대해 반복적 보정 없이도 효율적이고 고속으로 훈련 가능한 보편적 M3GNet 퍼텐셜을 개발하였다.
Machine learning interatomic potentials (MLIPs) enable the accurate simulation of materials at larger sizes and time scales, and play increasingly important roles in the computational understanding and design of materials. However, MLIPs are only as accurate and robust as the data they are trained on. In this work, we present DImensionality-Reduced Encoded Clusters with sTratified (DIRECT) sampling as an approach to select a robust training set of structures from a large and complex configuration space. By applying DIRECT sampling on the Materials Project relaxation trajectories dataset with over one million structures and 89 elements, we develop an improved materials 3-body graph network (M3GNet) universal potential that extrapolate more reliably to unseen structures. We further show that molecular dynamics (MD) simulations with universal potentials such as M3GNet can be used in place of expensive extit{ab initio} MD to rapidly create a large configuration space for target materials systems. Combined with DIRECT sampling, we develop a highly reliable moment tensor potential for Ti-H system without the need for iterative optimization. This work paves the way towards robust high throughput development of MLIPs across any compositional complexity.
연구 동기 및 목표
- 미래에 나타날 수 있는 재료의 구성 구조에 대해 잘 작동하는 강건하고 일반화 가능한 기계학습 원자간 퍼텐셜(MLIPs)을 개발하는 데 도전한다.
- 고비용의 반복적 활성 학습에 의존하는 것을 줄이기 위해, DFT 계산 이전에 다양하고 정보가 풍부한 훈련 데이터를 사전에 선별한다.
- 다양한 조성 공간, 특히 다핵심 원소 및 수소화물 시스템을 포함한 복잡한 체계에서 보편적 MLIPs의 고속 개발을 가능하게 한다.
- 체계적인 표본 추출을 통해 구성 공간을 포괄적으로 커버함으로써 MLIP의 외삽 성능을 향상시킨다.
- MD 시뮬레이션을 통해 보편적 퍼텐셜을 사용해 대규모이고 다양한 훈련 세트를 생성할 수 있으며, 이는 새로운 재료에 대한 아비지노우 데이터 수집의 필요성을 줄인다.
제안 방법
- 원자 구조 표현을 저차원 잠재 공간으로 압축하기 위해 차원 축소(오토에인코더)를 적용하여 군집화를 효율적으로 수행한다.
- 잠재 공간에서 k-means 군집화를 수행하여 구성 공간 전반에 걸쳐 대표적인 구조 군집을 식별한다.
- 계층적 표본 추출을 구현하여 최종 훈련 세트에 군집이 비례하게 표현되도록 하여 다양성과 커버리지의 최대화를 이룬다.
- DIRECT 표본 추출을 분자 동역학 시뮬레이션과 조합하여, 사전에 훈련된 M3GNet 보편적 퍼텐셜을 사용해 추가적인 다양한 구성 구조를 생성한다.
- DIRECT 표본 추출된 데이터셋을 기반으로 M3GNet 및 모멘트 텐서 퍼텐셜(MTP) 모델을 훈련하고, 미리 보지 않은 구조에 대한 일반화 성능을 평가한다.
- 시험 세트(가능성 있는 화합물 및 Ti-H 체계 포함)에서 DFT로 계산된 에너지와 힘을 사용하여 성능을 검증한다.

실험 결과
연구 질문
- RQ1차원 축소와 계층적 표본 추출이 거대한 구성 공간에서 다양하고 대표적인 구조 서브셋을 효과적으로 식별할 수 있는가?
- RQ2전통적 또는 활성 학습 기반 표본 추출 대비 DIRECT 표본 추출이 MLIP의 일반화 성능과 강건성 향상에 기여하는가?
- RQ3보편적 퍼텐셜(M3GNet)을 기반으로 한 MD 시뮬레이션은 사전 DFT 데이터 없이도 새로운 재료 체계에 대한 고품질 훈련 데이터를 생성할 수 있는가?
- RQ4얼마나 많은 양의 반복적 활성 학습을 줄일 수 있는가? 이는 DIRECT 표본 추출된 훈련 세트가 MTP 훈련에 미치는 영향을 기준으로 한다.
- RQ5DIRECT 표본 추출을 통해 훈련된 MLIP는 다핵심 수소화물과 같은 가상의 복잡한 재료에 대해 얼마나 잘 외삽하는가?
주요 결과
- DIRECT 표본 추출은 Materials Project 데이터셋의 130만 개 이상의 구조체에서부터 매우 다양하고 대표적인 훈련 세트를 선별함으로써, 필요한 DFT 계산 횟수를 크게 감소시켰다.
- 표준 또는 활성 학습 표본 추출 방식으로 훈련된 모델 대비 DIRECT 표본 추출을 사용한 M3GNet 보편적 퍼텐셜은 훨씬 뛰어난 외삽 성능을 보였다.
- M3GNet 보편적 퍼텐셜을 기반으로 한 분자 동역학 시뮬레이션은 27만 4천 개의 Ti-H 구성 구조를 포함한 대규모이고 다양한 데이터셋을 성공적으로 생성하였으며, 이는 반복 최적화 없이도 강건한 모멘트 텐서 퍼텐셜을 훈련하는 데 사용되었다.
- M3GNet-DIRECT 퍼텐셜은 가상의 산소 및 황 함유 화합물의 시험 세트에서 평균 절대 오차 12.8 meV/atom, 최대 오차 124.3 meV/atom를 기록하여 강력한 일반화 능력을 입증하였다.
- Ti-H 체계의 MTP는 DIRECT 표본 추출된 데이터셋을 기반으로 훈련되었으며, 500개 이상의 시험 구조에서 평균 절대 오차 14.5 meV/atom를 기록했고, 활성 학습 반복 과정이 전혀 필요로 하지 않았다.
- DIRECT 표본 추출 파이프라인은 maml 파이썬 라이브러리에 오픈소스화되어 재현성과 재료 과학 연구 분야에서의 활용 가능성을 보장하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.