[논문 리뷰] SMILES Transformer: Pre-trained Molecular Fingerprint for Low Data Drug Discovery
SMILES Transformer를 도입한 분자용 사전 학습 Transformer 기반 지문으로, 작은 데이터셋에서 데이터 효율적인 예측을 제공하고 MoleculeNet 벤치마크에서 경쟁력 있는 결과를 보입니다.
In drug-discovery-related tasks such as virtual screening, machine learning is emerging as a promising way to predict molecular properties. Conventionally, molecular fingerprints (numerical representations of molecules) are calculated through rule-based algorithms that map molecules to a sparse discrete space. However, these algorithms perform poorly for shallow prediction models or small datasets. To address this issue, we present SMILES Transformer. Inspired by Transformer and pre-trained language models from natural language processing, SMILES Transformer learns molecular fingerprints through unsupervised pre-training of the sequence-to-sequence language model using a huge corpus of SMILES, a text representation system for molecules. We performed benchmarks on 10 datasets against existing fingerprints and graph-based methods and demonstrated the superiority of the proposed algorithms in small-data settings where pre-training facilitated good generalization. Moreover, we define a novel metric to concurrently measure model accuracy and data efficiency.
연구 동기 및 목표
- 표적 데이터가 제한된 상황에서 의약발견에서 데이터 효율적인 분자 표현의 필요성을 제시합니다.
- 대형 비레이블 SMILES 코퍼스에서 학습된 Transformer 기반의 텍스트 유래 지문을 제안합니다.
- ST 지문이 간단한 예측기와 함께 작동하며 MoleculeNet 작업에서 강한 데이터 효율을 보임을 입증합니다.
- 다양한 학습 데이터 크기에 따른 성능 평가를 위한 데이터 효율성 지표(DEM)를 소개합니다.
제안 방법
- SMILES로부터 연속적인 분자 지문을 생성하기 위해 네 개 블록과 네 헤드 어텐션을 갖춘 인코더-디코더 Transformer를 구축합니다.
- ChEMBL24의 861,000개의 비레이블 SMILES에 대해 SMILES 열거 전략과 교차 엔트로피 목표를 사용하여 사전 학습합니다.
- 심볼 수준 출력을 풀링하여(평균, 최대, 초-최종 층) 분자 수준 지문을 추출하고 1024차원 벡터를 얻습니다.
- MLP 스타일 예측기를 사용하여 10개의 MoleculeNet 데이터셋에서 ST 지문을 ECFP4, RNNS2S, GraphConv과 비교합니다.
- 지수적으로 증가하는 학습 세트 크기에 걸친 성능 평균을 통해 데이터 효율성 지표(DEM)를 정의하고 계산합니다.
- 일부 데이터셋에서 ST 지문이 뛰어난 이유를 탐색하기 위해 t-SNE로 잠재 공간을 시각화합니다.
실험 결과
연구 질문
- RQ1작은 데이터 구간에서 ST 지문이 전통적인 지문이나 그래프 기반 방법보다 우수한가요?
- RQ2학습 데이터가 부족할 때 ST의 데이터 효율성은 기준선과 비교하여 어떤가요?
- RQ3데이터 세트 전반에서 예측 성능과 상관관계가 있는 ST 잠재 공간의 속성은 무엇인가요?
주요 결과
- ST는 MoleculeNet 데이터셋 10개 중 5개에서 DEM 성능이 최고를 기록했고, 특히 소규모 데이터 구간(ESOL, FreeSolv, BBBP, ClinTox)에서 두드러집니다.
- 간단한 예측기(MLP, ridge/logistic 회귀)와 결합된 ST 지문은 여러 작업에서 기준선과 대등하거나 우수한 성과를 냅니다.
- ST는 전반적으로 GraphConv 및 ECFP4와 경쟁력이 있으며, 데이터가 제한된 환경에서 기준선을 상회하거나 대등할 수 있습니다.
- 더 긴 SMILES가 ST 성능을 향상시키는 경향이 있어, 더 긴 시퀀스에서 정보 내용이 풍부함을 시사합니다.
- 새로운 데이터 효율성 지표(DEM)가 학습 데이터 크기가 달라짐에 따라 성능을 효과적으로 포착합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.