[论文解读] Preference optimization of protein language models as a multi-objective binder design paradigm
该论文提出了一种多目标结合剂设计框架,通过在自回归蛋白质语言模型(pLMs)上使用直接偏好优化(DPO),生成具有更高结合亲和力和有利理化性质的肽类结合剂。通过在精选的偏好数据集(偏好序列与非偏好序列)上微调ProtGPT2,模型在等电点(pI)方面实现了17%–60%的中位数提升,有效对齐专家标注的设计标准,同时未降低序列困惑度。
We present a multi-objective binder design paradigm based on instruction fine-tuning and direct preference optimization (DPO) of autoregressive protein language models (pLMs). Multiple design objectives are encoded in the language model through direct optimization on expert curated preference sequence datasets comprising preferred and dispreferred distributions. We show the proposed alignment strategy enables ProtGPT2 to effectively design binders conditioned on specified receptors and a drug developability criterion. Generated binder samples demonstrate median isoelectric point (pI) improvements by $17\%-60\%$.
研究动机与目标
- 开发一种计算框架,将多种药物开发目标(超越结合亲和力)整合到基于语言模型的肽类设计中。
- 解决现有方法仅在后期优化结合亲和力,而非在生成过程中同步整合理化性质与可开发性约束的不足。
- 通过DPO实现专家筛选的偏好数据(偏好序列与非偏好序列)直接融入pLMs,避免依赖下游回归器或分类器。
- 通过偏好信号编码复杂且难以量化的标准(如合成可行性与表达失败),提升生成治疗可行先导分子的可能性。
- 证明DPO可有效对齐pLMs,生成pI更高的结合剂,同时保持序列质量与结合潜力。
提出的方法
- 该方法采用两阶段训练流程:首先,使用OpenAI chatML格式的受体-结合剂指令模板对ProtGPT2进行监督微调(SFT),以实现条件生成。
- 其次,应用直接偏好优化(DPO)对SFT模型进行微调,使用成对偏好数据:偏好结合剂(高pI)与非偏好结合剂(低pI),包括来自远距离蛋白的伪影或真实结合剂的突变体。
- 偏好数据集通过将每个真实结合剂与多个非偏好伪影配对构建,形成66,898个训练三元组(蛋白质,结合剂,伪影),其中3,345个用于测试。
- DPO目标函数在最大化偏好序列与非偏好序列之间奖励差距的同时,约束与SFT模型的KL散度,实现在不损害模型生成高质量序列能力的前提下实现对齐。
- 通过束搜索、top-k和贪婪采样进行序列生成,以评估困惑度、pI和与真实结合剂的对齐分数。
- 通过DPO损失、奖励差距、准确率、困惑度、pI提升和对齐分数等指标评估模型性能,以衡量多目标优化的成功程度。
实验结果
研究问题
- RQ1能否有效将直接偏好优化(DPO)应用于蛋白质语言模型,以生成满足多个设计目标(包括结合亲和力与理化性质)的肽类结合剂?
- RQ2DPO在保持低序列困惑度和与真实结合剂高相似度的前提下,能在多大程度上提升生成结合剂的等电点(pI)?
- RQ3包含专家筛选的偏好数据(整合了合成可行性或表达失败等非量化约束)如何影响生成结合剂的质量与多样性?
- RQ4DPO是否在生成与偏好序列分布一致且具备理想理化性质的结合剂方面优于标准SFT?
- RQ5该框架能否推广至肽类以外的蛋白质或小分子设计任务?
主要发现
- DPO微调后的模型在测试中达到97%的准确率和15.3的奖励差距,表明其在偏好与非偏好序列之间具有强大的判别能力。
- 在所有采样策略(束搜索、top-k、贪婪)下,模型均实现17%–60%的中位数pI提升,其中50%的结合剂pI提升达2倍。
- 所有采样方法的困惑度均保持较低水平,50%的生成结合剂困惑度低于1.5,90%低于40,表明DPO后序列质量未出现显著退化。
- 在相同蛋白簇中,DPO后与真实结合剂的对齐分数显著提高,证实生成序列与生物相关序列的相似性增强。
- 该框架成功通过偏好信号将复杂且非数值化的专家标准(如表达失败、合成不可行性)编码至模型中,将设计约束的范围从单一属性优化扩展至更广泛范畴。
- 该方法实现了多目标设计标准在pLMs中的端到端、无缝集成,减少了对后期筛选的依赖,显著提升了生成可开发先导化合物的可能性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。