[논문 리뷰] Multimodal Large Language Models for Inverse Molecular Design with Retrosynthetic Planning
Llamole는 역합성 계획을 통한 역분자 설계를 위한 혼합 텍스트 및 그래프 생성을 가능하게 하는 최초의 다중모odal 대규모 언어 모델(MLLM)이다. 기본 LLM에 그래프 확산 트랜스포머와 GNN을 통합하고, LLM 기반 휴리스틱을 사용한 A* 탐색을 통해 Llamole는 역합성 계획에서 35%의 성공률을 달성하였으며, 이는 이전 모델의 5.5%에서 크게 향상된 성과이다. 또한 12개의 지표에서 분자 설계 성능을 최대 80.9% 향상시켰다.
While large language models (LLMs) have integrated images, adapting them to graphs remains challenging, limiting their applications in materials and drug design. This difficulty stems from the need for coherent autoregressive generation across texts and graphs. To address this, we introduce Llamole, the first multimodal LLM capable of interleaved text and graph generation, enabling molecular inverse design with retrosynthetic planning. Llamole integrates a base LLM with the Graph Diffusion Transformer and Graph Neural Networks for multi-conditional molecular generation and reaction inference within texts, while the LLM, with enhanced molecular understanding, flexibly controls activation among the different graph modules. Additionally, Llamole integrates A* search with LLM-based cost functions for efficient retrosynthetic planning. We create benchmarking datasets and conduct extensive experiments to evaluate Llamole against in-context learning and supervised fine-tuning. Llamole significantly outperforms 14 adapted LLMs across 12 metrics for controllable molecular design and retrosynthetic planning.
연구 동기 및 목표
- 기존에 그래프 구조의 분자 자료를 다루는 데 어려움을 겪는 대규모 언어 모델(LLM)이 특정 성질과 합성 가능성의 분자를 생성하는 데 도전하는 문제를 해결하기 위해.
- 혼합 텍스트 및 분자 그래프 생성이 가능한 다중모달 LLM을 개발하여 제어 가능한 역분자 설계를 가능하게 하기 위해.
- 효율적인 역합성 경로 계획을 위해 LLM 기반 비용 함수를 사용한 A* 탐색을 통합하기 위해.
- 다중모달 생성을 평가하기 위한 실제적이고 인간과 유사한 분자 설계 지시를 포함한 벤치마크 데이터셋을 구축하기 위해.
- 텍스트 중심 LLM과 그래프 기반 방법의 한계를 극복하기 위해, 통합된 자동회귀 프레임워크를 통해 두 기법의 장점을 융합하기 위해.
제안 방법
- Llamole는 기반 LLM에 그래프 확산 트랜스포머(Graph DiT)와 GNN을 통합하여 다중 조건 기반 분자 생성 및 반응 템플릿 예측을 수행한다.
- 특수 토큰을 사용한 트리거-쿼리-예측 메커니즘을 통해 자동회귀 생성 중 그래프 모듈을 활성화하여 혼합 텍스트 및 그래프 생성을 가능하게 한다.
- 분자 또는 반응을 생성한 후, 기반 LLM은 이전에 생성된 분자 구조를 인코딩하는 그래프 인코더를 사용하여 텍스트 생성을 재개한다.
- 역합성 계획을 위해 LLM이 계산한 휴리스틱을 사용한 A* 탐색을 통해 큰 반응 공간을 효율적으로 탐색한다.
- 모델은 단어 어휘, 원소/결합 유형, 반응 템플릿에 대한 다중 클래스 예측 작업으로 생성 과정을 정의한다.
- 사용자 대화 스타일의 프롬프트와 역합성 경로를 포함한 다중모달 분자 설계 지시의 정제된 데이터셋을 기반으로 미세조정을 수행한다.

실험 결과
연구 질문
- RQ1다중모달 LLM은 제어 가능한 역분자 설계를 위한 혼합 텍스트 및 분자 그래프 생성을 일관성 있게 수행할 수 있는가?
- RQ2LLM에 그래프 모델을 통합함으로써 텍스트 중심 LLM에 비해 분자 생성의 제어성과 품질이 얼마나 향상되는가?
- RQ3그래프 통합이 된 LLM이 순수 LLM과 그래프 기반 베이스라인에 비해 역합성 계획에서 얼마나 뛰어난 성능을 보이는가?
- RQ4LLM 기반 휴리스틱을 기반으로 한 A* 탐색은 다단계 역합성에 대해 큰 반응 공간을 효율적으로 탐색할 수 있는가?
- RQ5제안된 프레임워크는 복잡한 다중 성질 요구사항을 충족하는 분자를 얼마나 효과적으로 생성하는가?
주요 결과
- Llamole는 역합성 계획에서 35%의 성공률을 달성하였으며, 가장 우수한 베이스라인 모델의 5.5%에서 크게 향상된 성과이다.
- 14개의 변형된 LLM에 비해 제어 가능한 분자 설계의 12개 지표에서 최대 80.9% 향상된 성능을 보였다.
- 반응 조건에 대한 텍스트 생성에서 Llamole는 ROUGE-L 점수 0.268을 기록하여 높은 구조적 일관성을 보였으며, 유효한 반응 조건의 다양성으로 인해 BLEU-4 점수는 낮게 나타났다.
- 사례 연구에서 Llamole는 화학적으로 타당하고 합성 가능한 분자를 복잡한 요구사항을 충족시키도록 생성하였고, ICL 및 SFT 베이스라인은 환각되거나 잘못된 구조를 생성하였다.
- 고분자 설계의 경우, Llamole는 원하는 성질을 가진 유효한 단량체 구조와 두 단계의 역합성 경로를 성공적으로 생성하였고, 베이스라인은 유효한 고분자를 생성하거나 지시를 따르지 못했다.
- 모델는 소분자와 고분자 등 다양한 분자 유형에서 뛰어난 지시 준수 능력과 화학적 타당성을 보이며 뛰어난 내구성을 입증하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.