[论文解读] Can LLMs Generate Diverse Molecules? Towards Alignment with Structural Diversity
本文提出一种两阶段微调方法——监督微调后接强化学习,以使大型语言模型(LLMs)能够基于先前生成的分子自回归地生成结构多样的分子。该方法显著提升了基线解码方案和当前最先进LLMs的分子多样性和质量,实现了更高的多样性评分,并在未见分子性质提示上表现更优。
Recent advancements in large language models (LLMs) have demonstrated impressive performance in molecular generation, which offers potential to accelerate drug discovery. However, the current LLMs overlook a critical requirement for drug discovery: proposing a diverse set of molecules. This diversity is essential for improving the chances of finding a viable drug, as it provides alternative molecules that may succeed where others fail in real-world validations. Nevertheless, the LLMs often output structurally similar molecules. While decoding schemes like diverse beam search may enhance textual diversity, this often does not align with molecular structural diversity. In response, we propose a new method for fine-tuning molecular generative LLMs to autoregressively generate a set of structurally diverse molecules, where each molecule is generated by conditioning on the previously generated molecules. Our approach consists of two stages: (1) supervised fine-tuning to adapt LLMs to autoregressively generate molecules in a sequence and (2) reinforcement learning to maximize structural diversity within the generated molecules. Our experiments show that the proposed approach enables LLMs to generate diverse molecules better than existing approaches for diverse sequence generation.
研究动机与目标
- 为解决当前LLMs在生成结构多样分子方面的关键缺口,而这是成功药物发现的关键要求。
- 克服现有解码方案的局限性,这些方案虽提升文本多样性,但未提升分子结构多样性。
- 开发一种自改进的微调框架,通过不依赖外部多样化分子数据集来增强分子多样性。
- 通过基于先前输出条件化后续分子生成,提升基于LLM的分子生成的鲁棒性。
- 证明基于分子粒度多样性奖励的强化学习相比其他训练策略能实现更优的多样性。
提出的方法
- 采用监督微调,使预训练LLM能够从单个提示自回归地生成一系列分子。
- 训练数据通过LLM自身迭代采样获得,并经过过滤以提升质量和多样性。
- 利用强化学习,通过基于分子相似性度量(如Tanimoto相似性和NCircles)定义的奖励函数来最大化结构多样性。
- 该方法采用多阶段强化学习设置,将每次分子生成视为一个步骤,并分配独立的多样性奖励。
- 模型使用自生成数据进行端到端训练,避免对外部多样化分子数据集的依赖。
- 该方法采用SMILES表示,并通过Bertz复杂度、QED以及基于分子指纹的相似性等指标评估多样性。
实验结果
研究问题
- RQ1LLMs能否被微调以生成一组多样分子,而非重复相似结构?
- RQ2基于先前生成分子的条件化分子生成是否能提升结构多样性?
- RQ3所提出的两阶段微调方法与标准解码方案(如束搜索)相比,在生成多样分子方面表现如何?
- RQ4基于分子粒度奖励的强化学习是否能优于基于多样性度量硬过滤的监督微调?
- RQ5与单阶段回报公式相比,多阶段强化学习设置是否能提升多样性?
主要发现
- 所提方法实现显著更高的结构多样性,NCircles得分为21.98(h=0.65),优于基线方法。
- 在DrugAssist基准上,该方法在所有分子性质提示(包括未见的QED相关提示)上均持续提升多样性和质量。
- 在生成155个分子时,该方法发现25.6个独特且多样的分子,而束搜索(BS=500)仅发现21.3个,表明其具有更优的可扩展性。
- 该方法相比束搜索将时间成本降低80%(65秒 vs. 585秒),同时生成更多样化的分子。
- 多阶段强化学习优于单阶段RL和硬过滤SFT,表明其具备更优的信用分配与多样性优化能力。
- 该方法在未见提示下仍保持高性能,展现出在分子生成中强大的泛化能力和鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。