[논문 리뷰] A critical examination of robustness and generalizability of machine learning prediction of materials properties
이 논문은 Materials Project 2018(MP18) 데이터셋으로 사전 훈련된 기계학습 모델이 MP21 데이터셋의 새로운 재료의 형성 에너지를 예측할 때 분포 이탈으로 인해 심각한 성능 저하를 겪는다는 것을 보여준다. UMAP 시각화와 질의 기반 위원회(active learning)를 활용해 저자들은 분포 외 샘플을 특정하고, 단지 테스트 데이터의 1%만 추가함으로써 예측 정확도를 향상시켰으며, 재료 기계학습에서 강건성과 일반화 능력을 향상시키기 위한 실용적인 프레임워크를 제안한다.
Recent advances in machine learning (ML) methods have led to substantial improvement in materials property prediction against community benchmarks, but an excellent benchmark score may not imply good generalization of performance. Here we show that ML models trained on the Materials Project 2018 (MP18) dataset can have severely degraded prediction performance on new compounds in the Materials Project 2021 (MP21) dataset. We document performance degradation in graph neural networks and traditional descriptor-based ML models for both quantitative and qualitative predictions. We find the source of the predictive degradation is due to the distribution shift between the MP18 and MP21 versions. This is revealed by the uniform manifold approximation and projection (UMAP) of the feature space. We then show that the performance degradation issue can be foreseen using a few simple tools. Firstly, the UMAP can be used to investigate the connectivity and relative proximity of the training and test data within feature space. Secondly, the disagreement between multiple ML models on the test data can illuminate out-of-distribution samples. We demonstrate that the simple yet efficient UMAP-guided and query-by-committee acquisition strategies can greatly improve prediction accuracy through adding only 1~\% of the test data. We believe this work provides valuable insights for building materials databases and ML models that enable better prediction robustness and generalizability.
연구 동기 및 목표
- 역사적 재료 데이터베이스에서 훈련된 기계학습 모델이 더 새로운, 확장된 데이터셋에 적용되었을 때의 일반화 성능을 조사하는 것.
- 진화하는 재료 데이터베이스의 맥락에서 새로운 재료에 대한 예측 성능 저하의 근본 원인을 규명하는 것.
- 재료 과학 기계학습에서 분포 외 예측 실패를 진단하고 완화하기 위한 실용적이고 데이터 효율적인 전략을 개발하는 것.
- 특성 공간 분석과 앙상블 불일치를 활용해 재료 성질 예측을 위한 기계학습 모델의 강건성과 신뢰성을 향상시키는 것.
제안 방법
- MP18과 MP21 간의 데이터 분포 이탈을 시각화하기 위해, 상관관계 필터링 이후 90개로 줄어든 Matminer에서 추출한 고차원 특징을 UMAP(균일 다양체 근사 및 투영)를 사용해 저차원 공간으로 압축하였다.
- 형성 에너지 예측을 위해 MP18 데이터에서 최신 기술 기반 그래프 신경망(ALIGNN)과 세 가지 전통적 기계학습 모델(XGBoost, 랜덤 포레스트, 선형 포레스트)을 훈련시켰다.
- 여러 모델 간의 불일치(질의 기반 위원회)를 활용해 예측 불확실성이 높은 분포 외 테스트 샘플을 탐지하였다.
- UMAP 클러스터링 기반으로 가장 외곽에 있는 샘플을 선별해 재훈련하는 UMAP 유도 활성 학습을 적용하여, 최소한의 추가 데이터로 예측 정확도를 향상시켰다.
- MP21 테스트 세트에서 표준 회귀 평가 지표(R², MAE 등)를 사용해 모델 성능을 평가하였으며, 전체 MP18 데이터로 훈련한 모델과 선택된 새로운 데이터로 훈련한 모델를 비교하였다.
- 데이터 부족이나 분포 이탈 상황에서 외삽 예측의 강건성을 향상시키기 위해 선형 모델을 통합한 하이브리드 예측 전략을 제안하였다.
실험 결과
연구 질문
- RQ1MP18에서 훈련된 기계학습 모델이 MP21 데이터셋의 새로운 재료의 형성 에너지를 예측할 때 얼마나 심각한 성능 저하를 보이는가?
- RQ2진화하는 데이터베이스에서 새로운 재료로 일반화할 때 기계학습 모델의 성능 저하의 근본 원인은 무엇인가?
- RQ3특성 공간의 UMAP 기반 시각화가 예측 실패와 관련된 분포 이탈을 드러낼 수 있는가?
- RQ4여러 기계학습 모델 간의 불일치가 배포 이탈 샘플을 사전에 식별하는 데 효과적인가?
- RQ5UMAP와 모델 불일치를 기반으로 한 활성 학습이 최소한의 추가 데이터로 예측 정확도를 크게 향상시킬 수 있는가?
주요 결과
- MP18에서 사전 훈련된 ALIGNN 모델은 MP21의 일부 새로운 재료에 대해 형성 에너지를 심각하게 과소평가했으며, MP18 테스트 세트 대비 MAE에서 50% 이상 성능 저하를 보였다.
- XGBoost와 선형 포레스트와 같은 전통적 모델은 최신 기술 기반의 ALIGNN 모델보다 MP21 데이터에서 더 강건한 상용성 안정성 추정을 보였다.
- UMAP 시각화 결과, 잘못 예측된 MP21 재료들은 특성 공간에서 MP18 훈련 데이터 분포에서 멀리 떨어져 있음을 확인했으며, 이는 분포 이탈을 시사한다.
- 모델 간 불일치(질의 기반 위원회)는 분포 외 샘플을 효과적으로 강조했으며, 높은 불일치는 높은 예측 오차와 강하게 상관관계가 있었다.
- UMAP 클러스터링과 모델 불일치를 기반으로 선별한 MP21 테스트 데이터의 단지 1%만 추가로 훈련에 사용함으로써, 예측 정확도가 크게 향상되었으며, 가장 성능이 열악했던 하위집합의 MAE가 최대 30% 감소하였다.
- 본 연구는 UMAP 유도 활성 학습이 최소한의 데이터 확보 비용으로 모델의 일반화 능력을 향상시키는 매우 효율적인 전략임을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.