[논문 리뷰] DrugLLM: Open Large Language Model for Few-shot Molecule Generation
DrugLLM는 기능 그룹과 위치를 구조화된 시퀀스로 표현하는 그룹 기반 분자 표현(GMR)을 사용하여 소수의 수정 예시만으로도 새로운 분자를 생성하도록 피지테이닝된 70억 파라미터의 대규모 언어 모델이다. 이는 기존의 딥 러닝 및 LLM 기반 모델보다 소수의 예시 설정과 제로샷 설정 모두에서 최신 기술 수준의 성능을 달성한다.
Large Language Models (LLMs) have made great strides in areas such as language processing and computer vision. Despite the emergence of diverse techniques to improve few-shot learning capacity, current LLMs fall short in handling the languages in biology and chemistry. For example, they are struggling to capture the relationship between molecule structure and pharmacochemical properties. Consequently, the few-shot learning capacity of small-molecule drug modification remains impeded. In this work, we introduced DrugLLM, a LLM tailored for drug design. During the training process, we employed Group-based Molecular Representation (GMR) to represent molecules, arranging them in sequences that reflect modifications aimed at enhancing specific molecular properties. DrugLLM learns how to modify molecules in drug discovery by predicting the next molecule based on past modifications. Extensive computational experiments demonstrate that DrugLLM can generate new molecules with expected properties based on limited examples, presenting a powerful few-shot molecule generation capacity.
연구 동기 및 목표
- 자신의 데이터 부족으로 인해 전통적인 딥 러닝 모델이 제한을 받는 약물 발굴 분야에서 소수의 예시만으로 분자 생성을 해결하기 위해.
- 대규모 언어 모델이 특정 약리학적 성질을 가진 분자를 이해하고 생성하는 능력을 향상시키기 위해.
- 새로운 분자 표현 방식(GMR)을 사용하여 분자의 구조-성질 관계를 포착하는 방법을 개발하기 위해.
- 제한된 수정 예시로부터 학습하여 소수의 예시 및 제로샷 최적화를 효과적으로 수행할 수 있도록 하기 위해.
- 자연어 모델링과 화학어를 연결하기 위해 LLM을 분자 생성 작업에 적응시키기 위해.
제안 방법
- DrugLLM는 32개의 레이어, 32개의 어텐션 헤드, 4096개의 히든 차원을 가진 수정된 LLaMA 아키텍처를 사용하며, 분자 수정 시퀀스의 정제된 데이터셋으로 피지테이닝된다.
- 분자는 그룹 기반 분자 표현(GMR)을 통해 표현되며, 이는 SMILES 문자열을 구조적 조각과 그 위치 인덱스로 분해하여 이해 가능성을 높이고 토큰의 모호성을 줄인다.
- 학습 목표는 최적화 설명 및 분자 수정 시퀀스의 자동 회귀적 다음 토큰 예측으로, 이는 변환 패턴을 학습할 수 있도록 한다.
- 모델는 각 입력 시퀀스에 목표 성질 변화 기술과 몇 가지 예시 수정 사례가 포함된 분자 수정 사례 데이터셋으로 피지테이닝된다.
- 추론 과정에서 DrugLLM는 소수의 예시 수정 사례(소수의 예시) 또는 작업 기술(제로샷)을 기반으로 다음 분자를 예측함으로써 새로운 분자를 생성한다.
- 디코딩 과정은 연결성과 위치 정보를 사용하여 GMR로 인코딩된 조각들로부터 분자를 재구성하여 구조적 정확성과 가역성을 보장한다.
실험 결과
연구 질문
- RQ1대규모 언어 모델이 높은 정확도와 화학적 타당성을 확보하면서도 소수의 예시만으로도 효과적으로 소수의 분자 생성을 수행하도록 피지테이닝할 수 있는가?
- RQ2그룹 기반 분자 표현(GMR)이 표준 SMILES에 비해 분자의 구조와 수정 패턴을 어떻게 더 잘 모델링하는가?
- RQ3DrugLLM가 소수의 예시만으로도 새로운 분자 최적화 작업에 얼마나 잘 일반화되는가?
- RQ4DrugLLM가 기존의 딥 제너레이티브 모델(JTVAE, VJTNN, MoLeR)과 일반 목적의 LLM(GPT-4, ChatGLM)에 비해 소수의 예시 분자 생성에서 어떻게 성능을 냈는가?
- RQ5DrugLLM는 피지테이닝된 예시 없이도 작업 기술만으로 제로샷 분자 최적화를 수행할 수 있는가?
주요 결과
- DrugLLM는 소수의 예시 분자 생성에서 최신 기술 수준의 성능을 달성하였으며, JTVAE, VJTNN, MoLeR 등의 베이스라인 모델보다 목표 성질을 가진 분자를 더 잘 생성한다.
- 모델는 제로샷 설정에서도 강력한 일반화 능력을 보이며, 단지 작업 기술과 쿼리 분자만으로도 화학적으로 타당하고 성질이 최적화된 분자를 생성한다.
- GMR 기반 표현은 더 정확하고 해석 가능한 분자 인코딩을 가능하게 하여 생성 과정에서의 토큰 모호성 감소와 구조적 정확성 향상을 이룬다.
- 도메인 특화 피지테이닝과 표현 방식 덕분에, 조건부 프롬프트를 최적화한 경우조차도 일반 목적의 LLM(GPT-4, ChatGLM)보다 분자 생성 과업에서 더 뛰어난 성능을 보인다.
- 기존 모델 대비 더 높은 성질 점수(logP, QED, SA 점수 등)를 가진 분자를 생성하여 원하는 약리학적 성질의 최적화가 더 잘 이루어졌음을 시사한다.
- 광범위한 아블레이션 연구를 통해 GMR 표현 방식과 소수의 예시 피지테이닝 전략이 모델 성능에 핵심적인 역할을 한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.