[论文解读] Unsupervised Representation Learning of DNA Sequences
该论文提出了一种基于双向和单向LSTM的无监督序列到序列自编码器,用于学习长且可变长度DNA序列的固定长度潜在表征。该方法在剪接位点分类任务中达到最先进性能,使用预训练权重时准确率达到99.07%,模型归因分析证实所学表征捕捉到了已知的生物基序,如GT和AG剪接信号。
Recently several deep learning models have been used for DNA sequence based classification tasks. Often such tasks require long and variable length DNA sequences in the input. In this work, we use a sequence-to-sequence autoencoder model to learn a latent representation of a fixed dimension for long and variable length DNA sequences in an unsupervised manner. We evaluate both quantitatively and qualitatively the learned latent representation for a supervised task of splice site classification. The quantitative evaluation is done under two different settings. Our experiments show that these representations can be used as features or priors in closely related tasks such as splice site classification. Further, in our qualitative analysis, we use a model attribution technique Integrated Gradients to infer significant sequence signatures influencing the classification accuracy. We show the identified splice signatures resemble well with the existing knowledge.
研究动机与目标
- 以无监督方式学习长且可变长度DNA序列的固定长度通用表征。
- 评估这些学习到的表征是否可作为下游基因组任务(如剪接位点分类)的有效特征或先验。
- 通过模型归因技术验证学习表征的生物学相关性。
- 证明无监督预训练可提升监督分类任务中的收敛速度与性能。
提出的方法
- 采用编码器为双向LSTM、解码器为单向LSTM的序列到序列自编码器,将可变长度DNA序列映射为256维的固定潜在嵌入。
- 模型通过从潜在嵌入重建原始输入序列进行训练,强制表征捕捉关键的序列基序与依赖关系。
- 使用预训练的编码器权重初始化分类器,将学习到的潜在嵌入作为SVM、人工神经网络(ANN)和普通RNN分类器的输入特征。
- 应用积分梯度法对预测得分进行归因,识别影响剪接位点分类的关键核苷酸区域与基序。
- 以零嵌入作为积分梯度的基线,沿从基线到输入的路径进行200步梯度累积。
- 从归因得分生成序列logo,以可视化保守基序,如GT(供体)和AG(受体)信号。
实验结果
研究问题
- RQ1无监督自编码器能否学习到长且可变长度DNA序列的有意义固定长度表征?
- RQ2学习到的潜在表征是否能提升下游监督任务(如剪接位点分类)的性能?
- RQ3这些表征是否具有生物学可解释性,能够捕捉已知的剪接基序(如GT-AG信号)?
- RQ4如积分梯图等模型归因技术能否基于学习到的表征识别出DNA序列中功能相关的区域?
主要发现
- 当使用预训练编码器权重初始化分类器时,自编码器在剪接位点分类任务上达到99.07%的测试准确率。
- 将学习到的256维潜在嵌入作为输入,简单的SVM分类器达到98.63%的准确率,证明了嵌入表征的高质量。
- 积分梯度归因分析显示,剪接位点附近的核苷酸(尤其是供体位点的GT和受体位点的AG)对预测结果影响最大,与已知的生物学机制一致。
- 基于归因得分生成的序列logo清晰突出了经典的GT和AG基序,证实了模型能够学习到已知的生物信号。
- 使用预训练权重可加快多种分类器架构(SVM、ANN、RNN)的收敛速度并提升准确率。
- 定性分析表明,模型正确识别了具有生物学相关性的区域,其中核苷酸G在供体位点具有高度影响力,与现有知识一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。