[논문 리뷰] Infusing Linguistic Knowledge of SMILES into Chemical Language Models
이 논문은 서브스트럭처와 그 문법적 관계를 분석함으로써 SMILES로부터 언어학적 지식을 통합하는 트랜스포머 기반 화학 언어 모델을 제안한다. 서브스트럭처 토큰으로 사전학습하고 지식 어댑터를 통해 연결성/유형 지식을 주입함으로써, 분자의 성질 예측에서 최신 기술 수준의 성능을 달성하였으며, 주의 메커니즘의 해석 가능성과 문법 이해도 향상되었다.
The simplified molecular-input line-entry system (SMILES) is the most popular representation of chemical compounds. Therefore, many SMILES-based molecular property prediction models have been developed. In particular, transformer-based models show promising performance because the model utilizes a massive chemical dataset for self-supervised learning. However, there is no transformer-based model to overcome the inherent limitations of SMILES, which result from the generation process of SMILES. In this study, we grammatically parsed SMILES to obtain connectivity between substructures and their type, which is called the grammatical knowledge of SMILES. First, we pretrained the transformers with substructural tokens, which were parsed from SMILES. Then, we used the training strategy 'same compound model' to better understand SMILES grammar. In addition, we injected knowledge of connectivity and type into the transformer with knowledge adapters. As a result, our representation model outperformed previous compound representations for the prediction of molecular properties. Finally, we analyzed the attention of the transformer model and adapters, demonstrating that the proposed model understands the grammar of SMILES.
연구 동기 및 목표
- SMILES의 생성 과정으로 인해 발생하는 분자의 구조 표현에 내재된 한계를 해결하기 위해.
- SMILES로부터의 문법적 구조와 서브스트럭처 연결성 지식을 통합하여 분자의 표현 학습을 향상시키기 위해.
- 서브스트럭처 수준의 사전학습과 지식 주입을 통해 SMILES 문법을 이해하는 트랜스포머 기반 모델을 개발하기 위해.
- 주입된 언어학적 지식가 성능 및 해석 가능성 향상에 기여하는지 분자 성질 예측 작업에서 평가하기 위해.
제안 방법
- 문법적으로 분석된 SMILES를 통해 서브스트럭처와 그 연결성 유형을 추출하여 구조화된 서브스트럭처 토큰을 생성하였다.
- 대규모 화학 데이터로부터 분자의 문법을 학습하기 위해 이러한 서브스트럭처 토큰으로 트랜스포머 모델을 사전학습시켰다.
- 동일한 분자의 여러 SMILES 표현을 활용하여 표현 학습을 향상시키기 위해 '동일 화합물 모델' 학습 전략을 적용하였다.
- 지식 어댑터를 통해 연결성 및 서브스트럭처 유형 정보를 트랜스포머에 통합하여 언어학적 지식의 타겟팅 주입을 가능하게 하였다.
- 표준 전이 학습 프rotocol를 사용하여 분자 성질 예측 벤치마크에서 모델을 미세조정하였다.
- 주의 메커니즘을 분석하여 모델이 문법적으로 의미 있는 서브스트럭처에 주의를 기울이는지 확인하였다.
실험 결과
연구 질문
- RQ1SMILES의 문법적 분석이 트랜스포머 기반 모델에서 분자의 표현 학습을 향상시키는가?
- RQ2지식 어댑터를 통해 서브스트럭처의 연결성 및 유형 정보를 주입함으로써 분자 성질 예측 작업에서 성능이 향상되는가?
- RQ3주의 패턴을 통해 모델이 얼마나 구조적으로 의미 있는 서브스트럭처에 주의를 기울이는가?
- RQ4예측 정확도와 일반화 능력 측면에서 기존의 SMILES 기반 모델과 비교해 볼 때 본 방법은 어떠한가?
주요 결과
- 제안된 모델은 분자 성질 예측 벤치마크에서 이전의 화합물 표현 방법을 능가하여 최신 기술 수준의 성능을 보였다.
- 주의 시각화 결과 모델이 문법적으로 관련 있는 서브스트럭처에 주의를 기울이는 것을 확인하여 구조적 이해도 향상됨을 시사하였다.
- 지식 어댑터의 사용은 트랜스포머에 언어학적 지식을 효과적으로 주입하여 더 해석 가능하고 정확한 표현을 가능하게 하였다.
- '동일 화합물 모델' 학습 전략은 동일한 분자의 다양한 SMILES 형태를 노출시킴으로써 표현 품질 향상에 기여하였다.
- 서브스트럭처 수준의 사전학습은 표준 SMILES 토크나이제이션에 비해 더 나은 일반화 및 강건성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.