Skip to main content
QUICK REVIEW

[논문 리뷰] MolXPT: Wrapping Molecules with Text for Generative Pre-training

Zequn Liu, Wei Zhang|arXiv (Cornell University)|2023. 05. 18.
Computational Drug Discovery Methods인용 수 7
한 줄 요약

MolXPT는 과학적 텍스트, SMILES 서열, 그리고 분자의 이름과 그에 해당하는 SMILES를 번갈아 가며 배치한 '랩핑된' 서열을 기반으로 사전 훈련된 350M 파라미터의 생성형 언어 모델이다. 이 랩핑 기법을 통해 텍스트와 분자 구조를 동시에 모델링함으로써, MolXPT는 분자 성질 예측(MoleculeNet)에서 최신 기준 성능을 달성하였고, 더 큰 모델과 비교해도 44% 적은 파라미터로도 유사한 성능을 내며 텍스트-분자 번역을 수행하였으며, 미세조정 없이도 강력한 제로샷 분자 생성 성능을 보였다.

ABSTRACT

Generative pre-trained Transformer (GPT) has demonstrates its great success in natural language processing and related techniques have been adapted into molecular modeling. Considering that text is the most important record for scientific discovery, in this paper, we propose MolXPT, a unified language model of text and molecules pre-trained on SMILES (a sequence representation of molecules) wrapped by text. Briefly, we detect the molecule names in each sequence and replace them to the corresponding SMILES. In this way, the SMILES could leverage the information from surrounding text, and vice versa. The above wrapped sequences, text sequences from PubMed and SMILES sequences from PubChem are all fed into a language model for pre-training. Experimental results demonstrate that MolXPT outperforms strong baselines of molecular property prediction on MoleculeNet, performs comparably to the best model in text-molecule translation while using less than half of its parameters, and enables zero-shot molecular generation without finetuning.

연구 동기 및 목표

  • 과학적 텍스트와 SMILES 서열을 함께 사전 훈련하여 분자 표현 학습을 향상시키기 위해.
  • 기존 모델들이 분자 이름과 그 구조적 표현 간의 의미적 관계를 명시적으로 활용하지 못하는 한계를 해결하기 위해.
  • 미세조정 없이도 제로샷 분자 생성 및 다양한 분자 및 텍스트 기반 작업 간 소수의 예제를 통한 전이 학습을 가능하게 하기 위해.
  • 더 큰 최신 기술 모델들에 비해 성능을 유지하거나 향상시키면서도 모델 크기를 줄이기 위해.

제안 방법

  • MolXPT는 PubMed 제목 및 초록, PubChem SMILES, 그리고 800만 개의 '랩핑된' 서열을 기반으로 사전 훈련된다. 여기서 분자 이름은 해당하는 SMILES로 대체된다.
  • BERN2를 사용한 명명된 실체 인식(NER)을 통해 텍스트 내 분자 언급을 식별하고, ChEBI와 같은 지식 기반에서 엔티티를 연결하여 SMILES를 검색한다.
  • 감지된 분자 이름을 SMILES로 대체함으로써, 맥락적 정보와 구조적 정보를 모두 유지하는 하이브리드 텍스트-SMILES 서열인 '랩핑된' 서열을 구성한다.
  • 토크나이제이션은 별도로 적용된다: 텍스트는 BPE(40,000개의 병합)를, SMILES는 정규식 기반 토크나이제이션을 사용하며, 분자의 시작과 끝을 위한 특수 토큰이 포함된다.
  • 모델은 24층의 Transformer 아키텍처를 사용하며, 총 350M 파라미터를 가진다. 모든 세 가지 데이터 유형에서 마스크된 언어 모델링을 통해 훈련된다.
  • 다음 작업에 대한 미세조정은 분자 성질 예측 및 텍스트-분자 생성과 같은 다운스트림 작업에서 프롬프트 기반 훈련을 통해 수행된다.

실험 결과

연구 질문

  • RQ1텍스트와 SMILES 서열을 함께 사전 훈련하고, 랩핑된 서열을 통해 명시적인 정렬을 구현함으로써 분자 표현 학습이 향상될 수 있는가?
  • RQ2MolXPT는 MoleculeNet과 같은 분자 성질 예측 벤치마크에서 기존의 GNN 기반 및 다중모달 모델을 초월하는가?
  • RQ3MolXPT는 최신 기술 모델들보다 훨씬 적은 파라미터로도 텍스트-분자 번역에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ4MolXPT는 미세조정 없이도 얼마나 높은 수준의 제로샷 텍스트-분자 생성 능력을 보여주는가?
  • RQ5랩핑된 서열 사용 방식이 원시 텍스트와 SMILES를 직접 엔드 투 엔드로 사전 훈련하는 것과 비교해, 모델 정렬 및 다운스트림 성능 측면에서 어떻게 다른가?

주요 결과

  • MolXPT는 MoleculeNet 벤치마크에서 강력한 GNN 기반 베이스라인을 능가하며, 평균 RMSE 0.859를 기록하여 GEM과 같은 이전 방법들보다 우수한 성능을 보였다.
  • CheBI-20 텍스트-분자 번역 데이터셋에서, MolXPT는 800M 파라미터를 가진 MolT5-large와 유사한 성능을 내었으며, 파라미터 수는 44%에 불과했다. BLEU 점수는 0.859, Text2Mol 점수는 0.983였다.
  • 제로샷 텍스트-분자 생성에서, MolXPT는 매크스 지문 기반으로 Tanimoto 유사도 0.540, RDK 지문 기반으로 0.383, Morgan 지문 기반으로 0.228를 기록하여, 미세조정 없이도 의미 있는 생성을 수행함을 입증하였다.
  • 제로샷 환경에서 MolXPT는 텍스트 기반 설명으로부터 33개의 분자를 성공적으로 복원하였으며, 이는 새로운 생성 작업에 대한 일반화 능력을 확인하는 데 기여한다.
  • 랩핑된 서열 사용은 Galactica와 같이 원시 텍스트와 SMILES를 별도로 사전 훈련하는 모델보다 성능 향상에 크게 기여하며, 이는 구조화된 다중모달 감독의 가치를 입증한다.
  • MolXPT는 METEOR 점수 0.757, Text2Mol 점수 0.983을 기록하여 분자-텍스트 생성에서 최신 기술 성능을 달성하였으며, MolT5-small 및 MolT5-base를 모두 능가하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.