[论文解读] Latent Diffusion Model for DNA Sequence Generation
本文提出DiscDiff,一种用于生成高质量合成DNA序列的潜在扩散模型,通过使用变分自编码器(VAE)将离散DNA序列映射到连续潜在空间,从而能够使用强大的连续扩散模型。该方法在基序分布、潜在嵌入相似性和染色质谱对齐方面达到最先进性能,通过新型度量指标Fréchet重建距离(FReD)和一个包含15个物种共15万条启动子-基因序列的跨物种数据集得到验证。
The harnessing of machine learning, especially deep generative models, has opened up promising avenues in the field of synthetic DNA sequence generation. Whilst Generative Adversarial Networks (GANs) have gained traction for this application, they often face issues such as limited sample diversity and mode collapse. On the other hand, Diffusion Models are a promising new class of generative models that are not burdened with these problems, enabling them to reach the state-of-the-art in domains such as image generation. In light of this, we propose a novel latent diffusion model, DiscDiff, tailored for discrete DNA sequence generation. By simply embedding discrete DNA sequences into a continuous latent space using an autoencoder, we are able to leverage the powerful generative abilities of continuous diffusion models for the generation of discrete data. Additionally, we introduce Fréchet Reconstruction Distance (FReD) as a new metric to measure the sample quality of DNA sequence generations. Our DiscDiff model demonstrates an ability to generate synthetic DNA sequences that align closely with real DNA in terms of Motif Distribution, Latent Embedding Distribution (FReD), and Chromatin Profiles. Additionally, we contribute a comprehensive cross-species dataset of 150K unique promoter-gene sequences from 15 species, enriching resources for future generative modelling in genomics. We will make our code public upon publication.
研究动机与目标
- 为解决GAN在DNA序列生成中的局限性(如模式崩溃和多样性低),通过利用扩散模型来改进。
- 开发一种可泛化的离散数据生成框架,采用潜在扩散模型,适用于基因组学以外的领域。
- 引入一种新型评估度量指标——Fréchet重建距离(FReD),以定量评估生成DNA序列的质量。
- 创建并发布一个全面的跨物种数据集,包含15万条独特的启动子-基因序列,以供未来研究使用。
- 证明潜在扩散模型能够有效生成具有准确染色质谱和基序分布的生物上真实的DNA序列。
提出的方法
- 该方法采用变分自编码器(VAE)将离散DNA序列嵌入到连续潜在空间,从而支持使用连续扩散模型。
- 在潜在空间中训练一个去噪U-Net架构,以逆转一个逐步向潜在表示添加噪声的前向扩散过程。
- 反向过程采用随机微分方程(SDE)公式生成逼真的潜在序列,随后解码回DNA序列。
- 模型通过最小化每个时间步上预测与真实潜在状态之间的差异,使用去噪目标进行训练。
- 该框架将潜在分布的学习与去噪模型解耦,实现模块化训练并提升泛化能力。
- 引入一种新型评估度量指标——Fréchet重建距离(FReD),用于比较真实序列与生成序列之间潜在嵌入分布的差异。

实验结果
研究问题
- RQ1潜在扩散模型能否有效生成具有高多样性与准确基序分布的生物上真实的DNA序列?
- RQ2所提出的Fréchet重建距离(FReD)度量与定性方法相比,在评估DNA序列生成质量方面表现如何?
- RQ3该潜在扩散框架在多大程度上能保留真实启动子-基因序列的染色质谱分布?
- RQ4在潜在分布和基序分布相似性方面,模型性能如何随不同训练时长和超参数而变化?
- RQ5所提出的框架是否具备跨物种泛化能力,并可应用于启动子以外的其他离散基因组序列?
主要发现
- DiscDiff在200个训练周期时达到22.10的Fréchet重建距离(FReD),显著优于VAE基线(48.66),表明潜在分布对齐性能更优。
- 该模型在基序分布和染色质谱方面与真实DNA高度相似,如H3K4me3、H3K27me3和H3K9me3等顶级谱系在生成序列中得到良好保留。
- 潜在分布距离(FReD与Sei嵌入距离)从第0个周期到第200个周期急剧下降,随后逐渐上升,表明长期训练中整体表征与基序保真度之间存在权衡。
- 生成序列在染色质谱分布方面与真实DNA高度匹配,生成数据中前10个谱系与真实数据中的对应谱系高度一致。
- 训练过程显示,尽管TSS峰建模随训练时间延长而改善,但基序分布出现偏差,凸显了全局与局部序列保真度之间平衡的挑战。
- 作者发布了包含15个物种共15万条独特启动子-基因序列的新型跨物种数据集,为未来基因组建模研究提供了更丰富的资源。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。