Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Performance Prediction of Electrolyte Formulations with Transformer-based Molecular Representation Model

Indra Priyadarsini, Vidushi Sharma|arXiv (Cornell University)|2024. 06. 28.
Machine Learning in Materials ScienceMaterials Science인용 수 3
한 줄 요약

이 논문은 SELFIES-인코딩을 통해 강력한 분자 임베딩을 학습하고 농도로 스케일링한 후 통합 특징 벡터로 합치는 방식으로 전기화학적 전해질 조성 성능 예측 성능을 향상시키는 트랜스포머 기반 분자 표현 모델인 BART-SA를 제안한다. 이 방법은 두 가지 배터리 성능 예측 과제에서 최신 기술 수준의 성능을 달성하였으며, 쿨롱 효율성 예측의 경우 RMSE가 0.148이고, 특이 용량 예측의 경우 20.001 mAh/g이다.

ABSTRACT

Development of efficient and high-performing electrolytes is crucial for advancing energy storage technologies, particularly in batteries. Predicting the performance of battery electrolytes rely on complex interactions between the individual constituents. Consequently, a strategy that adeptly captures these relationships and forms a robust representation of the formulation is essential for integrating with machine learning models to predict properties accurately. In this paper, we introduce a novel approach leveraging a transformer-based molecular representation model to effectively and efficiently capture the representation of electrolyte formulations. The performance of the proposed approach is evaluated on two battery property prediction tasks and the results show superior performance compared to the state-of-the-art methods.

연구 동기 및 목표

  • 복잡한 다성분 상호작용과 변동성이 큰 조성 구성으로 인해 정확한 배터리 전해질 성능 예측이 어려운 문제를 해결하기 위해.
  • 분자 정체성과 상대 농도를 모두 포착하는 다성분 전해질 조성에 대해 확장 가능하고 일반화 가능한 표현 방법을 개발하기 위해.
  • 이전 모델들이 더미 특징화에 의존하거나 농도 의존적 영향을 효과적으로 모델링하지 못하는 한계를 극복하기 위해.
  • 향상된 표현 정밀도를 갖춘 분자 시퀀스에서의 자기지도 학습 미세조정을 활용하여 일반화 능력과 예측 정확도를 향상시키기 위해.

제안 방법

  • ZINC과 PubChem의 500M 및 118M 개의 분자를 SELFIES 표현을 사용하여 신택스 및 의미적 타당성을 보장하면서 이중 자동회귀 트랜스포터(BART)를 사전학습한다.
  • SELFIES로 인코딩된 분자를 대상으로 3160어휘량의 단어 수준 토크나이제이션을 적용하여 안정적인 시퀀스 모델링을 가능하게 한다.
  • 사전학습 중 15%의 토큰을 무작위로 마스킹하고 재구성함으로써 문맥 기반 분자 표현을 학습한다.
  • 각 전해질 조성에 대해, 사전학습된 BART에서 유도된 개별 분자 표현을 그들의 몰 농도로 스케일링하고 합산하여 통합 특징 벡터를 구성한다.
  • 최종로 생성된 특징 벡터를 쿨롱 효율성 및 특이 용량 예측과 같은 후행 배터리 성능 예측 과제에서 미세조정한다.
  • 다양한 성분 수를 가진 조성에 유연하게 대응하기 위해 더미 패딩을 피하고 농도 가중 벡터 합산 전략을 사용한다.
Figure 1: Pre-training model architecture
Figure 1: Pre-training model architecture

실험 결과

연구 질문

  • RQ1SELFIES로 인코딩된 분자 시퀀스에서 사전학습된 자기지도 학습 트랜스포터 모델이 복잡한 전해질 조성의 분자 표현 학습을 향상시킬 수 있는가?
  • RQ2분자 임베딩에 농도 인식 스케일링을 적용하면 기계학습 모델의 전해질 성능 예측 성능이 향상되는가?
  • RQ3F-GCN, MolFormer, MM-MolFormer와 같은 최신 기술 수준의 모델들과 비교했을 때 제안된 방법은 전해질 성능 예측에서 어떤 성능을 보이는가?
  • RQ4SMILES 대비 SELFIES를 사용할 경우 모델의 일반화 능력 향상과 유효하지 않은 분자 표현 학습 위험 감소에 어느 정도 기여하는가?
  • RQ5고정된 크기의 특징 공학 없이도 다양한 성분 수를 가진 전해질 조성에 대해 일반화 가능한 성능을 발휘할 수 있는가?

주요 결과

  • 제안된 BART-SA 모델은 쿨롱 효율성(LCE) 예측 과제에서 RMSE 0.148을 기록하여 F-GCN TL, MolFormer, MM-MolFormer를 포함한 모든 이전 방법들을 능가했다.
  • 특이 용량 예측 과제에서 BART-SA는 RMSE 20.001 mAh/g을 달성하여 F-GCN TL(20.495 mAh/g)과 F-GCN no-TL(39.823 mAh/g)을 모두 능가했다.
  • 고성능 전해질에 대해 모델은 뛰어난 성능을 보였으며, 두 과제 모두의 평형도에서 예측값과 실제값이 매우 잘 일치했다.
  • 특히 고성능 전해질 예측에서 뛰어난 성능을 보였으며, 저용량 세포의 경우 실험적 노이즈와 불안정성으로 인해 오차가 더 크게 관찰되었다.
  • 사전학습 단계에서 SELFIES를 사용함으로써 분자 표현의 품질이 크게 향상되어, 유효하지 않거나 화학적으로 타당하지 않은 구조를 학습할 위험을 줄였다.
  • 농도 가중 벡터 합산 전략은 더미 패딩 없이도 일관되고 확장 가능하며 일반화 가능한 특징 표현을 가능하게 하여 다양한 성분 수를 가진 조성에 적합했다.
Figure 2: Illustration of the general schematic of the proposed method. (a) shows the general format of the electrolyte formulation dataset. (b) describes the procedure to construct the feature vector for an electrolyte formulation. (c) shows the fine-tuning model trained using the feature vector fo
Figure 2: Illustration of the general schematic of the proposed method. (a) shows the general format of the electrolyte formulation dataset. (b) describes the procedure to construct the feature vector for an electrolyte formulation. (c) shows the fine-tuning model trained using the feature vector fo

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.