Skip to main content
QUICK REVIEW

[논문 리뷰] SMILES-Mamba: Chemical Mamba Foundation Models for Drug ADMET Prediction

Bohao Xu, Yingzhou Lu|arXiv (Cornell University)|2024. 08. 11.
Computational Drug Discovery Methods인용 수 4
한 줄 요약

SMILES-Mamba는 레이블이 없는 SMILES 문자열에서의 자기지도 사전학습과 레이블이 있는 ADMET 데이터셋에서의 미세조정을 거치는 이단계적 분자 기초 모델로, 22개의 ADMET 예측 과제에서 최신 기술 수준을 달성하며, 14개 과제에서 1위, 17개 과제에서 상위 2위를 기록하여 자기지도 학습이 약한 레이블이 있는 데이터셋에 의존도를 줄이는 데서의 잠재력을 입증한다.

ABSTRACT

In drug discovery, predicting the absorption, distribution, metabolism, excretion, and toxicity (ADMET) properties of small-molecule drugs is critical for ensuring safety and efficacy. However, the process of accurately predicting these properties is often resource-intensive and requires extensive experimental data. To address this challenge, we propose SMILES-Mamba, a two-stage model that leverages both unlabeled and labeled data through a combination of self-supervised pretraining and fine-tuning strategies. The model first pre-trains on a large corpus of unlabeled SMILES strings to capture the underlying chemical structure and relationships, before being fine-tuned on smaller, labeled datasets specific to ADMET tasks. Our results demonstrate that SMILES-Mamba exhibits competitive performance across 22 ADMET datasets, achieving the highest score in 14 tasks, highlighting the potential of self-supervised learning in improving molecular property prediction. This approach not only enhances prediction accuracy but also reduces the dependence on large, labeled datasets, offering a promising direction for future research in drug discovery.

연구 동기 및 목표

  • 레이블이 없는 분자 데이터와 레이블이 있는 분자 데이터를 모두 활용하여 ADMET 성질 예측의 높은 비용과 데이터 부족 문제를 해결하고자 한다.
  • 자기지도 표현 학습을 통해 약물 흡수, 분포, 대사, 배설 및 독성 예측 정확도를 향상시키고자 한다.
  • 광범위한 레이블이 없는 SMILES 문자열 코퍼스에서 사전학습을 통해 대규모 비용이 드는 레이블이 있는 데이터셋에 대한 의존도를 줄이고자 한다.
  • 다양한 ADMET 과제에 걸쳐 보다 우수한 일반화 능력을 갖춘 복잡한 화학 구조 관계를 포착하는 기초 모델 아키텍처를 개발하고자 한다.

제안 방법

  • 대규모 레이블이 없는 SMILES 문자열 코퍼스에서의 자기지도 사전학습과 레이블이 있는 ADMET 데이터셋에서의 작업별 미세조정을 거치는 이단계 학습 파라다임을 적용한다.
  • 장거리 시퀀스 모델링에 최적화된 상태공간 모델(SM)의 변종인 Mamba 아키텍처를 사용하여 SMILES 시퀀스 내 장거리 의존성을 포착한다.
  • 사전학습 단계에서 마스크된 언어 모델링(MLM) 목적함수를 적용하여 SMILES 문자열의 마스크된 토큰을 예측함으로써 화학 문법과 구조적 패턴을 학습한다.
  • 회귀(예: LD50) 및 분류(예: hERG, AMES) 작업을 위한 표준 기계학습 헤드를 사용하여 22개의 다양한 ADMET 데이터셋에서 사전학습된 Mamba 인코더를 미세조정한다.
  • SMILES를 입력 표현으로 활용하여 화학적 의미를 유지하면서도 분자 시퀀스를 효율적으로 처리할 수 있도록 한다.
  • 잔차 연결과 레이어 정규화를 통합하여 다양한 ADMET 예측 과제에서 학습 안정성과 수렴 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1Mamba 아키텍처 기반 기초 모델이 레이블이 없는 SMILES 입력만을 사용하여 다양한 ADMET 성질을 예측하는 데 기존 최신 기술 수준의 모델을 능가할 수 있는가?
  • RQ2대규모 레이블이 없는 SMILES 데이터에서의 자기지도 사전학습이 최종 ADMET 예측 성능 향상에 어느 정도 기여하는가?
  • RQ3기존 모델들인 GCN, CNN, MLP와 비교해 Mamba 기반 아키텍처가 SMILES 시퀀스 내 장거리 화학적 의존성을 얼마나 잘 포착하는가?
  • RQ4제안된 이단계 학습 전략(사전학습 + 미세조정)이 다양한 데이터 분포를 가진 여러 ADMET 과제에서 일관된 성능 향상을 이끌어내는가?
  • RQ5각기 다른 화학적 및 생물학적 기반을 지닌 다양한 ADMET 엔드포인트 간에도 모델이 효과적으로 일반화될 수 있는가?

주요 결과

  • SMILES-Mamba는 22개의 ADMET 예측 과제 중 14개에서 최고 성능을 기록하여 다양한 약물 성질 엔드포인트에 걸쳐 강력한 일반화 능력을 입증했다.
  • hERG 데이터셋에서 SMILES-Mamba는 ROC-AUC 0.708 ± 0.045를 기록하여 모든 방법 중 2위를 차지했으며, 기준 모델 대비 안정성 향상이 두드러졌다.
  • DILI 데이터셋에서 SMILES-Mamba는 ROC-AUC 0.928 ± 0.022를 기록하여 두 번째로 우수한 성능을 보인 NeuralFP(0.851 ± 0.026)를 크게 앞서며 뚜렷한 성능 우위를 보였다.
  • 22개 과제 중 17개에서 상위 2위 성능을 기록하여 다양한 ADMET 예측 과제에 걸쳐 일관되고 견고한 성능을 보였다.
  • 자기지도 사전학습이 매우 효과적임을 입증하였으며, SMILES-Mamba와 NeuralFP와 같은 모델은 사전학습 없이 학습된 전통적 모델보다 뚜렷한 성능 향상을 보였다.
  • 모델이 모든 과제를 압도하지는 않았으며, 이는 과제별 화학적 특징을 포착하기 위해 아키텍처 설계와 표현 학습의 중요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.