Skip to main content
QUICK REVIEW

[논문 리뷰] DrugAssist: A Large Language Model for Molecule Optimization

Geyan Ye, Xibao Cai|arXiv (Cornell University)|2023. 12. 28.
Machine Learning in Materials Science인용 수 4
한 줄 요약

DrugAssist는 Llama2-7B-Chat를 기반으로 한 상호작용형 대규모 언어모델로, 인간-기계 대화를 통해 분자의 최적화를 위한 반복적이고 전문가가 이끄는 개선을 가능하게 한다. 단일 및 다중 성질 최적화, 범위 제약이 있는 목표까지도 최신 기술 수준의 성능을 달성하며, 제로샷 및 소량 샘플 전이 능력이 뛰어나다.

ABSTRACT

Recently, the impressive performance of large language models (LLMs) on a wide range of tasks has attracted an increasing number of attempts to apply LLMs in drug discovery. However, molecule optimization, a critical task in the drug discovery pipeline, is currently an area that has seen little involvement from LLMs. Most of existing approaches focus solely on capturing the underlying patterns in chemical structures provided by the data, without taking advantage of expert feedback. These non-interactive approaches overlook the fact that the drug discovery process is actually one that requires the integration of expert experience and iterative refinement. To address this gap, we propose DrugAssist, an interactive molecule optimization model which performs optimization through human-machine dialogue by leveraging LLM's strong interactivity and generalizability. DrugAssist has achieved leading results in both single and multiple property optimization, simultaneously showcasing immense potential in transferability and iterative optimization. In addition, we publicly release a large instruction-based dataset called MolOpt-Instructions for fine-tuning language models on molecule optimization tasks. We have made our code and data publicly available at https://github.com/blazerye/DrugAssist, which we hope to pave the way for future research in LLMs' application for drug discovery.

연구 동기 및 목표

  • 기존의 LLM 기반 접근법에서 상호작용적이고 전문가 피드백 기반의 분자 최적화가 부족한 점을 보완한다.
  • 도메인 전문가와 LLM 간의 실시간 다회화를 통해 분자의 성질을 반복적으로 개선할 수 있도록 한다.
  • 특정 값 범위 내에서의 성질 최적화를 포함하여, 다수의 성질을 동시에 최적화할 수 있는 모델을 개발한다.
  • 학습 중에 볼 수 없었던 성질에 대해서도 제로샷 및 소량 샘플 최적화를 가능하게 하여 전이 능력을 향상시킨다.
  • LLM를 약물 발굴 분야에서 미세조정하기 위한 지침 기반 데이터셋인 MolOpt-Instructions를 공개함으로써 향후 연구를 지원한다.

제안 방법

  • 분자 최적화 작업을 위해 대규모 지침 기반 데이터셋인 MolOpt-Instructions를 기반으로 Llama2-7B-Chat를 미세조정한다.
  • 분자를 SMILES 문자열로 표현하고, 자연어 지시에 따라 조건부 생성 작업으로 최적화를 설정한다.
  • 사용자가 피드백과 새로운 최적화 목표를 제시할 수 있는 다회화를 지원하여 반복적 개선을 가능하게 한다.
  • 사용자가 모델 출력을 수정하고, 원하는 분자의 성질로 향한 다음 생성을 이끌 수 있도록 전문가 피드백을 통합한다.
  • 학습 중에 볼 수 없었던 새로운 성질 조합에 대해서도 일반화하여 제로샷 전이를 가능하게 한다.
  • 성공적인 최적화 예시를 몇 개 제공함으로써, 새로운 볼 수 없는 성질에 대한 최적화를 모델이 안내할 수 있도록 지원한다.

실험 결과

연구 질문

  • RQ1LLM 기반 모델이 도메인 전문가와의 자연어 대화를 통해 상호작용적이고 반복적인 분자 최적화를 효과적으로 지원할 수 있는가?
  • RQ2특정 값 범위 내에서 최적화하는 경우를 포함해, 다중 성질 최적화 작업에 대해 모델의 일반화 능력은 어느 정도인가?
  • RQ3학습 데이터에 포함되지 않은 성질을 최적화하기 위해 모델이 얼마나 잘 지식을 전이할 수 있는가?
  • RQ4다회화 환경에서 인간이 제공한 피드백을 통해 모델이 자신의 오류를 얼마나 효과적으로 수정할 수 있는가?
  • RQ5미세조정된 LLM이 상호작용성과 뛰어난 전이 능력을 유지하면서도 분자 최적화 분야에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • DrugAssist는 단일 및 다중 성질 최적화, 특히 도전적인 범위 제약이 있는 목표까지도 최신 기술 수준의 성능을 달성한다.
  • 모델는 강력한 제로샷 전이 능력을 보이며, 재학습 없이도 이전에 본 적 없는 성질 조합을 성공적으로 최적화한다.
  • 소량 샘플 설정에서는, 학습 데이터에 포함되지 않은 새로운 성질(예: logP)을 몇 가지 예시를 기반으로 최적화할 수 있다.
  • 모델는 견고한 반복 최적화 능력을 보이며, 初기 출력이 기준을 충족하지 못할 경우 인간이 제공한 예시를 바탕으로 접근 방식을 수정한다.
  • DrugAssist는 다양한 최적화 작업 전반에서 높은 유효성과 성공률을 유지하며, 이전의 LLM 기반 및 전통적 방법보다 일관되게 뛰어난 성능을 보인다.
  • 공개된 MolOpt-Instructions 데이터셋은 유사성 및 성질 차이 제약 조건을 모두 고려한 분자 최적화를 위한 LLM의 미세조정을 지원할 만큼 충분한 데이터 다양성을 포함하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.