[论文解读] Comparing Machine Learning Algorithms with or without Feature Extraction for DNA Classification
该论文提出了一种新颖的特征提取方法,利用DNA序列与随机生成的DNA子序列之间的Levenshtein距离,对病毒DNA进行分类,而无需依赖生物来源的引物。该方法在四个病毒疾病数据集上与3-gram特征提取方法及深度学习模型(CNN、DNN、N-gram)进行了比较,结果显示,在最小的SARS-CoV-2数据集上,随机序列方法表现优于其他方法(准确率为97.26%),而在更大规模数据集上,3-gram方法则实现了最高的整体准确率。
The classification of DNA sequences is a key research area in bioinformatics as it enables researchers to conduct genomic analysis and detect possible diseases. In this paper, three state-of-the-art algorithms, namely Convolutional Neural Networks, Deep Neural Networks, and N-gram Probabilistic Models, are used for the task of DNA classification. Furthermore, we introduce a novel feature extraction method based on the Levenshtein distance and randomly generated DNA sub-sequences to compute information-rich features from the DNA sequences. We also use an existing feature extraction method based on 3-grams to represent amino acids and combine both feature extraction methods with a multitude of machine learning algorithms. Four different data sets, each concerning viral diseases such as Covid-19, AIDS, Influenza, and Hepatitis C, are used for evaluating the different approaches. The results of the experiments show that all methods obtain high accuracies on the different DNA datasets. Furthermore, the domain-specific 3-gram feature extraction method leads in general to the best results in the experiments, while the newly proposed technique outperforms all other methods on the smallest Covid-19 dataset
研究动机与目标
- 评估机器学习模型在结合传统与新型特征提取技术时,对病毒DNA序列分类的性能表现。
- 探究随机生成的DNA序列是否能有效替代生物来源的引物,用于DNA分类中的特征提取。
- 比较深度学习模型(CNN、DNN、N-gram)与传统机器学习模型(SVM、Adaboost)在结合不同特征提取方法时的有效性。
- 评估数据集大小对模型性能的影响,特别是在低数据场景下的表现。
- 确定领域特定的3-gram特征还是所提出的基于随机序列的方法,在多种病毒疾病中能获得更高的分类准确率。
提出的方法
- 提出一种基于输入DNA序列与一组随机生成的DNA子序列之间Levenshtein距离的新型特征提取方法,用于计算信息丰富的特征。
- 采用领域特定的3-gram特征提取方法,将DNA序列中所有可能的3个核苷酸组合(如AAA、AAC等)编码为基于频率的向量。
- 将两种特征提取方法与多种机器学习算法结合:SVM、Adaboost、CNN、DNN以及N-gram概率模型。
- 使用四个真实世界的病毒DNA数据集:丙型肝炎、HIV(1型/2型)、流感/冠状病毒以及SARS-CoV-2,每个数据集代表不同的数据规模和病毒特性。
- 采用10折交叉验证进行模型评估,并报告重复实验中平均准确率及其标准差。
- 评估不同长度随机生成的DNA序列对性能的影响,以确定特征提取的最优序列长度。
实验结果
研究问题
- RQ1基于随机DNA子序列的特征提取方法,结合Levenshtein距离,能否有效替代生物来源的引物用于DNA序列分类?
- RQ2在不同病毒DNA数据集上,所提出的基于Levenshtein距离的方法与成熟的3-gram方法及深度学习模型(CNN、DNN、N-gram)相比,性能如何?
- RQ3特征提取方法的性能是否因数据集大小而显著不同,特别是在SARS-CoV-2等小规模数据集上?
- RQ4在结合每种特征提取方法时,哪种机器学习算法(SVM、Adaboost、CNN、DNN、N-gram)能达到最高准确率?
- RQ5在基于Levenshtein距离的特征提取方法中,是否存在一个一致最优的随机生成DNA序列长度?
主要发现
- 在丙型肝炎数据集上,3-gram特征提取方法与SVM或Adaboost结合,实现了最高的平均准确率(99.90% ± 0.32),在流感/冠状病毒数据集上达到99.99% ± 0.02。
- 在最小的SARS-CoV-2数据集(292个样本)上,基于随机DNA序列的Levenshtein距离方法实现了97.26% ± 3.34的准确率,比第二好的方法(3-gram)高出4.3个百分点。
- 3-gram方法在更大规模数据集上始终表现更优,在四个数据集中的三个实现了接近完美的准确率(超过99.7%)。
- 深度学习模型(CNN和DNN)在大规模数据集上取得了高准确率(98.50%至99.97%),但在最小的SARS-CoV-2数据集上表现欠佳,DNN仅达到90.12% ± 4.11。
- N-gram概率模型在所有数据集上均实现了高准确率(99.10%至99.97%),表明其在序列建模任务中表现强劲。
- 没有单一机器学习算法在所有数据集和特征提取方法中始终表现最优,但SVM和Adaboost与3-gram方法结合时最为具有竞争力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。