[论文解读] Deep Extrapolation for Attribute-Enhanced Generation
本文提出 GENhance,一种深度生成模型,通过使用带有正则化的潜在空间,并联合训练生成器与判别器,实现对序列属性的分布外增强。该方法在生成高度正面的文本评论和更稳定的蛋白质序列方面达到最先进性能,且在训练过程中未接触过此类样本,显著优于基线模型在属性外推任务中的表现。
Attribute extrapolation in sample generation is challenging for deep neural networks operating beyond the training distribution. We formulate a new task for extrapolation in sequence generation, focusing on natural language and proteins, and propose GENhance, a generative framework that enhances attributes through a learned latent space. Trained on movie reviews and a computed protein stability dataset, GENhance can generate strongly-positive text reviews and highly stable protein sequences without being exposed to similar data during training. We release our benchmark tasks and models to contribute to the study of generative modeling extrapolation and data-driven design in biology and chemistry.
研究动机与目标
- 将属性增强生成任务形式化为序列建模中对训练分布之外的外推任务。
- 解决在训练数据中未见的改进属性(如情感、稳定性)序列的生成挑战。
- 开发一种生成框架,利用学习到的潜在空间引导生成过程向高属性区域推进。
- 发布基准数据集与模型,以支持生物学与自然语言处理中可复现的外推生成建模研究。
提出的方法
- GENhance 采用条件变自编码器(VAE)类架构,共享编码器与解码器,并与判别器联合训练,以最小化生成损失与判别损失。
- 引入潜在向量平滑技术,对潜在空间进行正则化,提升对分布外区域的泛化能力。
- 应用循环一致性损失,将重建序列与原始输入对齐,从而稳定训练并提升潜在空间质量。
- 框架采用生成器-判别器设置,通过对抗训练实现,其中判别器充当属性得分的排序器。
- 模型端到端训练,结合重构、对抗与循环一致性目标,以增强属性外推能力。
- 通过在目标属性值条件下的潜在空间采样实现属性增强生成,即使这些属性值在训练中未出现亦可实现。
实验结果
研究问题
- RQ1深度生成模型能否在自然语言与蛋白质序列中,外推生成显著超出训练分布的属性序列?
- RQ2与标准 GAN 方法或 MCMC 采样方法相比,带有正则化的学习潜在空间在属性外推方面有何优势?
- RQ3循环一致性损失在稳定训练与提升属性增强生成序列质量方面发挥何种作用?
- RQ4当仅提供少量分布外样本用于微调时,GENhance 能在多大程度上生成高质量、高属性的样本?
- RQ5将训练好的编码器与判别器结合,相比仅使用判别器的标准方法,如何提升理想序列的排序与生成性能?
主要发现
- GENhance 在蛋白质稳定性生成的所有指标上均显著优于所有基线模型,包括使用拒绝采样的 Gen-Disc 与基于 MCMC 的方法。
- GENhance 生成的序列平均 ddG 值低于训练集中任意序列,且有显著比例的序列比最稳定的训练样本更稳定。
- 该模型实现了更高的 PCI_yτ 值,表明生成序列中属性值超过最有利训练样本的比例更大。
- 如图 4 所示,GENhance 在生成序列分布上向更高稳定性方向发生最大偏移,相比训练分布。
- 消融实验表明,循环一致性损失提升了性能,而潜在空间平滑略微降低了性能,表明目标函数优化中存在权衡。
- 使用 GENhance 的编码器对基线生成器输出的序列进行重排序,可提升性能,证实了更优的编码与解码共同促成了模型的成功。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。