[논문 리뷰] BARTSmiles: Generative Masked Language Models for Molecular Representations
BARTSmiles는 ZINC20 데이터셋에서 17억 개의 분자를 사용해 계산 자원을 이전 방법보다 10배 더 많이 사용하여 1.7B 개의 분자를 기반으로 한 대규모 자기지도 학습 생성 마스크 언어 모델을 개발한다. 이 모델은 11개의 분류, 회귀 및 생성 작업에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 해석 가능성 분석 결과 통합 기울기(IG)가 알려진 독성 구조를 강조하고, 핵심 뉴런들이 최종 작업과 강하게 상관됨을 보여주었다.
We discover a robust self-supervised strategy tailored towards molecular representations for generative masked language models through a series of tailored, in-depth ablations. Using this pre-training strategy, we train BARTSmiles, a BART-like model with an order of magnitude more compute than previous self-supervised molecular representations. In-depth evaluations show that BARTSmiles consistently outperforms other self-supervised representations across classification, regression, and generation tasks setting a new state-of-the-art on 11 tasks. We then quantitatively show that when applied to the molecular domain, the BART objective learns representations that implicitly encode our downstream tasks of interest. For example, by selecting seven neurons from a frozen BARTSmiles, we can obtain a model having performance within two percentage points of the full fine-tuned model on task Clintox. Lastly, we show that standard attribution interpretability methods, when applied to BARTSmiles, highlight certain substructures that chemists use to explain specific properties of molecules. The code and the pretrained model are publicly available.
연구 동기 및 목표
- 마스크 언어 모델링을 활용해 분자 표현에 특화된 강력하고 확장 가능한 자기지도 사전 훈련 전략을 개발한다.
- 이전 모델보다 훨씬 많은 계산 자원을 사용하여 분자용 대규모 생성 언어 모델—BARTSmiles—를 훈련한다.
- 분류, 회귀 및 생성을 포함한 다양한 최종 작업에서 BARTSmiles의 성능을 평가하여 최신 기술 수준의 성능을 확립한다.
- 사전 훈련된 표현이 뉴런 수준 분석과 해석 가능성 방법을 통해 임의의 작업과 관련된 정보를 암묵적으로 포함하고 있는지 조사한다.
- 특정 구조적 경고(예: 구조적 경고)와 관련된 특성 부여 지도(예: 통합 기울기)를 비교하여 모델의 해석 가능성성을 검증한다.
제안 방법
- 전체 ZINC20 데이터셋(17억 개 분자)을 사용해 SMILES 문자열에서 BART 유사 트랜스포머 모델을 마스크 언어 모델링 목적에 따라 사전 훈련한다.
- 분자 표현 학습을 위한 하이퍼파ram터 및 아키텍처 선택 최적화를 위해 강력하고 아블레이션 기반의 사전 훈련 전략을 적용한다.
- BARTSmiles 모델을 고정한 상태에서 11개의 다양한 최종 작업(예: 독성 예측(ClinTox), 용해도(ESOL), 반응 예측 등)에 대해 미세 조정한다.
- 특성 부여를 위해 통합 기울기(IG)를 적용하여 모델 예측에 기여하는 원자/구조를 식별한다.
- 뉴런 수준 분석을 통해 최종 작업 성능과 높은 상관관계를 보이는 개별 뉴런을 식별한다.
- 고정된 뉴런(7~15개 뉴런)의 선형 프로브를 사용해 ClinTox 작업에서 전체 미세 조정 모델 성능의 90% 이상을 달성함으로써, 작업에 특화된 표현 학습이 효과적으로 이루어졌음을 보여준다.
실험 결과
연구 질문
- RQ1SMILES 문자열에서 대규모 자기지도 마스크 언어 모델을 훈련시켜 다양한 작업에서 이전 방법보다 뛰어난 일반화 가능한 분자 표현을 학습시킬 수 있는가?
- RQ2BARTSmiles의 사전 훈련된 표현이 독성 또는 용해도와 같은 최종 작업과 관련된 정보를 어느 정도 암묵적으로 포함하고 있는가?
- RQ3통합 기울기와 같은 해석 가능성 방법이 독성과 관련된 알려진 화학적 의미 있는 구조(예: 구조적 경고)를 강조하는가?
- RQ4BARTSmiles의 일부 고정된 뉴런으로 구성된 소규모 집합이 최종 작업에서 최신 기술 수준에 근접한 성능을 달성할 수 있는가? 이는 효율적인 표현 학습을 시사한다.
- RQ5모델의 주의 메커니즘과 특성 부여 행동이 약물 화학 전문 지식(예: 돌연변이 유발성의 구조적 경고)과 얼마나 일치하는가?
주요 결과
- BARTSmiles는 평가된 11개의 분자 성질 예측, 생성 및 회귀 작업 전부에서 최신 기술 수준(SOTA) 성능을 달성하였다.
- 모델은 스케일과 강력한 사전 훈련 전략 덕분에 이전 자기지도 분자 표현보다 뚜렷한 성능 향상을 보였으며, 특히 데이터가 적은 환경에서 두각을 나타냈다.
- 통합 기울기 특성 부여 지도는 돌연변이 유발성과 관련된 알려진 구조적 경고(예: 질산기, 에폭시기)를 일관되게 강조하여 전문 지식과의 일치를 확인하였다.
- ClinTox 작업에서 고정된 뉴런 7~15개의 선형 조합이 전체 미세 조정 모델 성능의 90% 이상을 달성하였으며, 이는 강력한 작업 특화 표현 학습을 시사한다.
- ESOL 회귀 작업에서 모델은 극성 기능군(예: -OH, C=O)을 용해도에 기여하는 주요 요소로 식별하였고, 탄화수소 사슬에는 부정적 기여도를 부여함으로써 화학적 직관과 일치하였다.
- 통합 기울기 점수에 체계적인 편향이 관찰되었는데, 첫 번째 토큰이 일관되게 더 높은 기여도를 가짐을 확인하였으며, 평균 제거를 통해 이 문제를 해결함으로써 해석 가능성 정밀도가 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.