[论文解读] Generating protein sequences from antibiotic resistance genes data using Generative Adversarial Networks
本文提出一种Wasserstein生成对抗网络(W-GAN),基于6,023个肠道驻留耐药基因数据生成合成蛋白序列。该模型成功学习了真实耐药蛋白序列的分布,并生成了与真实耐药基因高度相似的新型、生物上合理的序列。
We introduce a method to generate synthetic protein sequences which are predicted to be resistant to certain antibiotics. We did this using 6,023 genes that were predicted to be resistant to antibiotics in the intestinal region of the human gut and were fed as input to a Wasserstein generative adversarial network (W-GAN) model a variant to the original generative adversarial model which has been known to perform efficiently when it comes to mimicking the distribution of the real data in order to generate new data which is similar in style to the original data which was fed as the training data
研究动机与目标
- 开发一种深度生成模型,以生成模仿真实抗生素耐药基因的新型蛋白序列。
- 通过生成合成的、生物上合理的变体,解决公共数据库中多样耐药蛋白序列稀缺的问题。
- 利用生成建模技术,探索已知实例之外的耐药基因序列空间。
- 通过序列相似性等指标评估生成序列的质量与多样性。
- 为耐药机制的计算机模拟探索及潜在药物靶点发现提供工具。
提出的方法
- 采用Wasserstein GAN(W-GAN)架构以提升训练稳定性并生成更高质量的蛋白序列。
- 模型在来自人体肠道微生物组的6,023个抗生素耐药基因数据集上进行训练。
- 将蛋白序列分词为氨基酸标记,并嵌入潜在空间以供模型处理。
- 生成器网络学习生成的序列在判别器眼中与真实耐药基因无法区分。
- 通过梯度惩罚优化W-GAN损失函数,以强制实施Lipschitz约束,提升训练收敛性。
- 使用序列相似性指标对生成序列进行评估,并与真实耐药基因序列进行比较。
实验结果
研究问题
- RQ1W-GAN能否有效从肠道微生物组数据中学习真实抗生素耐药蛋白序列的分布?
- RQ2生成的蛋白序列在序列组成和结构方面与真实耐药基因的相似程度如何?
- RQ3生成的序列在多大程度上保留了与抗生素耐药性相关的功能基序?
- RQ4该模型能否生成原始训练集中不存在的多样化、新颖序列?
- RQ5与标准GAN相比,使用W-GAN在生成生物上合理的耐药蛋白序列方面有何影响?
主要发现
- W-GAN成功生成了在序列组成和长度分布方面与真实耐药基因高度相似的合成蛋白序列。
- 与标准GAN相比,该模型表现出更优的训练稳定性,并生成了更多样化的序列,表现为更低的模式崩溃现象。
- 生成的序列保留了已知耐药蛋白中的关键功能基序,表明其具有生物合理性。
- 定量评估显示,生成序列与真实耐药基因在序列相似性方面表现优异,尤其在保守结构域区域。
- W-GAN框架中引入梯度惩罚显著提升了生成序列的质量与多样性。
- 该模型生成了原始训练数据中不存在的新序列,扩展了已知耐药基因的序列空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。