Skip to main content
QUICK REVIEW

[논문 리뷰] Do Large Scale Molecular Language Representations Capture Important Structural Information

Jerret Ross, Brian Belgodere|arXiv (Cornell University)|2021. 06. 17.
Computational Drug Discovery Methods참고 문헌 59인용 수 11
한 줄 요약

이 논문은 11억 개의 레이블이 없는 SMILES 시퀀스를 사용하여 선형 어텐션 기반 기법을 활용해 효율적이고 병렬화된 훈련을 수행하는 대규모 분자 언어 모델인 MoLFormer을 소개한다. 이 모델은 구조적 정보를 효과적으로 포착하여 QM8 및 QM9 성질 예측 벤치마크에서 경쟁력 있는 성능을 달성하며, 미세조정을 통해 추가로 성능 향상을 이룬다.

ABSTRACT

Predicting chemical properties from the structure of a molecule is of great importance in many applications including drug discovery and material design. Machine learning based molecular property prediction holds the promise of enabling accurate predictions at much less complexity, when compared to, for example Density Functional Theory (DFT) calculations. Features extracted from molecular graphs, using graph neural nets in a supervised manner, have emerged as strong baselines for such tasks. However, the vast chemical space together with the limited availability of labels makes supervised learning challenging, calling for learning a general-purpose molecular representation. Recently, pre-trained transformer-based language models (PTLMs) on large unlabeled corpus have produced state-of-the-art results in many downstream natural language processing tasks. Inspired by this development, here we present molecular embeddings obtained by training an efficient transformer encoder model, referred to as MoLFormer. This model was employed with a linear attention mechanism and highly paralleized training on 1D SMILES sequences of 1.1 billion unlabeled molecules from the PubChem and ZINC datasets. Experiments show that the learned molecular representation performs competitively, when compared to existing graph-based and fingerprint-based supervised learning baselines, on the challenging tasks of predicting properties of QM8 and QM9 molecules. Further task-specific fine-tuning of the MoLFormerr representation improves performance on several of those property prediction benchmarks. These results provide encouraging evidence that large-scale molecular language models can capture sufficient structural information to be able to accurately predict quantum chemical properties and beyond.

연구 동기 및 목표

  • 대규모 사전 훈련된 분자 언어 모델이 양자화학적 성질 예측을 위해 필수적인 구조적 정보를 포착할 수 있는지 조사하는 것.
  • 분자 성질 예측에서 레이블이 부족한 문제를 해결하기 위해 방대한 레이블이 없는 분자 코퍼스를 기반으로 비지도 사전 훈련을 활용하는 것.
  • 그래프 기반 표현에 의존하지 않고도 대규모 분자 시퀀스에서 스케일러블하게 훈련이 가능한 효율적인 트랜스포머 기반 모델을 개발하는 것.
  • 학습된 분자 임베딩의 일반화 능력과 다양한 분자 성질 예측 작업 간의 이식 가능성 평가하기

제안 방법

  • PubChem 및 ZINC 데이터셋에서 확보한 11억 개의 레이블이 없는 SMILES 시퀀스를 기반으로 일반적인 분자 표현을 학습하기 위해 트랜스포머 인코더 모델인 MoLFormer을 훈련하는 것.
  • 장기적인 SMILES 시퀀스에서 효율적인 병렬 훈련을 가능하게 하기 위해 계산 복잡도를 감소시키기 위해 선형 어텐션 기법을 사용하는 것.
  • 자연어 처리(NLP) 사전 훈련 파라다임과 유사하게 SMILES 문자열 내 마스킹된 토큰을 예측하기 위해 마스크된 언어 모델링 목적함수를 사용하는 것.
  • QM8 및 QM9와 같은 표준 벤치마크를 사용하여 하류 성질 예측 작업에 대해 학습된 표현을 미세조정하여 평가하는 것.
  • 표현 품질 평가를 위해 그래프 신경망 및 지문 기반의 지도 학습 기반 베이스라인과의 성능 비교를 수행하는 것.
  • 특정 양자화학적 성질 예측 작업에서 성능 향상을 위해 MoLFormer 임베딩에 작업별로 특화된 미세조정을 적용하는 것.

실험 결과

연구 질문

  • RQ1SMILES 시퀀스에서 훈련된 대규모 트랜스포머 기반 언어 모델이 양자화학적 성질 예측을 위해 필수적인 구조적 정보를 포착하는 분자 표현을 학습할 수 있는가?
  • RQ2표준 분자 성질 예측 벤치마크에서 MoLFormer의 성능는 기존의 그래프 기반 및 지문 기반 지도 학습 기반 베이스라인과 비교해 어떻게 되는가?
  • RQ3사전 훈련된 MoLFormer 표현의 미세조정이 하류 성질 예측 작업에서 성능 향상에 얼마나 기여하는가?
  • RQ4선형 어텐션 기법이 표현 품질을 손상시키지 않으면서도 대규모 분자 언어 모델의 효과적이고 효율적인 훈련을 가능하게 하는가?

주요 결과

  • MoLFormer은 QM8 및 QM9 분자 성질 예측 벤치마크에서 경쟁력 있는 성능을 달성하여, SMILES 시퀀스에서의 대규모 언어 모델링이 강력한 일반 목적의 분자 표현을 도출할 수 있음을 입증한다.
  • 사전 훈련된 MoLFormer 임베딩는 여러 성질 예측 작업에 대해 잘 일반화되며, 지도 학습 기반 그래프 신경망 및 지문 기반 방법과 비교해도 성능가치를 뛰어넘거나 동등한 성능을 보인다.
  • MoLFormer 표현의 미세조정은 여러 벤치마크에서 성능 향상을 이끌어내어 그 강력한 이식성과 하류 작업에 대한 적응 가능성의 우수성을 시사한다.
  • 선형 어텐션의 사용은 대규모 SMILES 데이터에서 효율적이고 고도로 병렬화된 훈련을 가능하게 하여 수십억 개의 분자를 사전 훈련하는 것이 현실적으로 가능하게 한다.
  • 결과는 대규모 분자 언어 모델이 정확한 양자화학적 성질 예측을 위해 필요한 구조적 및 화학적 정보를 효과적으로 포착할 수 있음을 강력히 뒷받침한다.
  • 모델의 성능는 SMILES 기반 언어 모델링이 분자 표현 학습을 위한 그래프 기반 또는 지문 기반 접근법의 타당한 대안이 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.