Skip to main content
QUICK REVIEW

[논문 리뷰] SMILES Transformer: Pre-trained Molecular Fingerprint for Low Data Drug Discovery

Shion Honda, Shoi Shi|arXiv (Cornell University)|2019. 11. 12.
Computational Drug Discovery Methods참고 문헌 32인용 수 163
한 줄 요약

SMILES Transformer를 도입한 분자용 사전 학습 Transformer 기반 지문으로, 작은 데이터셋에서 데이터 효율적인 예측을 제공하고 MoleculeNet 벤치마크에서 경쟁력 있는 결과를 보입니다.

ABSTRACT

In drug-discovery-related tasks such as virtual screening, machine learning is emerging as a promising way to predict molecular properties. Conventionally, molecular fingerprints (numerical representations of molecules) are calculated through rule-based algorithms that map molecules to a sparse discrete space. However, these algorithms perform poorly for shallow prediction models or small datasets. To address this issue, we present SMILES Transformer. Inspired by Transformer and pre-trained language models from natural language processing, SMILES Transformer learns molecular fingerprints through unsupervised pre-training of the sequence-to-sequence language model using a huge corpus of SMILES, a text representation system for molecules. We performed benchmarks on 10 datasets against existing fingerprints and graph-based methods and demonstrated the superiority of the proposed algorithms in small-data settings where pre-training facilitated good generalization. Moreover, we define a novel metric to concurrently measure model accuracy and data efficiency.

연구 동기 및 목표

  • 표적 데이터가 제한된 상황에서 의약발견에서 데이터 효율적인 분자 표현의 필요성을 제시합니다.
  • 대형 비레이블 SMILES 코퍼스에서 학습된 Transformer 기반의 텍스트 유래 지문을 제안합니다.
  • ST 지문이 간단한 예측기와 함께 작동하며 MoleculeNet 작업에서 강한 데이터 효율을 보임을 입증합니다.
  • 다양한 학습 데이터 크기에 따른 성능 평가를 위한 데이터 효율성 지표(DEM)를 소개합니다.

제안 방법

  • SMILES로부터 연속적인 분자 지문을 생성하기 위해 네 개 블록과 네 헤드 어텐션을 갖춘 인코더-디코더 Transformer를 구축합니다.
  • ChEMBL24의 861,000개의 비레이블 SMILES에 대해 SMILES 열거 전략과 교차 엔트로피 목표를 사용하여 사전 학습합니다.
  • 심볼 수준 출력을 풀링하여(평균, 최대, 초-최종 층) 분자 수준 지문을 추출하고 1024차원 벡터를 얻습니다.
  • MLP 스타일 예측기를 사용하여 10개의 MoleculeNet 데이터셋에서 ST 지문을 ECFP4, RNNS2S, GraphConv과 비교합니다.
  • 지수적으로 증가하는 학습 세트 크기에 걸친 성능 평균을 통해 데이터 효율성 지표(DEM)를 정의하고 계산합니다.
  • 일부 데이터셋에서 ST 지문이 뛰어난 이유를 탐색하기 위해 t-SNE로 잠재 공간을 시각화합니다.

실험 결과

연구 질문

  • RQ1작은 데이터 구간에서 ST 지문이 전통적인 지문이나 그래프 기반 방법보다 우수한가요?
  • RQ2학습 데이터가 부족할 때 ST의 데이터 효율성은 기준선과 비교하여 어떤가요?
  • RQ3데이터 세트 전반에서 예측 성능과 상관관계가 있는 ST 잠재 공간의 속성은 무엇인가요?

주요 결과

  • ST는 MoleculeNet 데이터셋 10개 중 5개에서 DEM 성능이 최고를 기록했고, 특히 소규모 데이터 구간(ESOL, FreeSolv, BBBP, ClinTox)에서 두드러집니다.
  • 간단한 예측기(MLP, ridge/logistic 회귀)와 결합된 ST 지문은 여러 작업에서 기준선과 대등하거나 우수한 성과를 냅니다.
  • ST는 전반적으로 GraphConv 및 ECFP4와 경쟁력이 있으며, 데이터가 제한된 환경에서 기준선을 상회하거나 대등할 수 있습니다.
  • 더 긴 SMILES가 ST 성능을 향상시키는 경향이 있어, 더 긴 시퀀스에서 정보 내용이 풍부함을 시사합니다.
  • 새로운 데이터 효율성 지표(DEM)가 학습 데이터 크기가 달라짐에 따라 성능을 효과적으로 포착합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.