[论文解读] Fuzzy Gene Selection and Cancer Classification Based on Deep Learning Model
本文提出了一种新颖的模糊基因选择(FGS)方法,与多层感知机(MLP)深度学习模型相结合,以提升从高维基因表达数据中进行癌症分类的性能。通过结合互信息、F-ClassIf 和卡方检验得分,并引入模糊化与去模糊化处理,FGS 能够识别关键基因,降低数据维度并提升分类器性能——在六个数据集上实现了 96.5% 的准确率、96.2% 的精确率、96% 的召回率以及 95.9% 的 F1 分数,显著优于未进行基因选择的标准 MLP 模型。
Machine learning (ML) approaches have been used to develop highly accurate and efficient applications in many fields including bio-medical science. However, even with advanced ML techniques, cancer classification using gene expression data is still complicated because of the high dimensionality of the datasets employed. We developed a new fuzzy gene selection technique (FGS) to identify informative genes to facilitate cancer classification and reduce the dimensionality of the available gene expression data. Three feature selection methods (Mutual Information, F-ClassIf, and Chi-squared) were evaluated and employed to obtain the score and rank for each gene. Then, using Fuzzification and Defuzzification methods to obtain the best single score for each gene, which aids in the identification of significant genes. Our study applied the fuzzy measures to six gene expression datasets including four Microarray and two RNA-seq datasets for evaluating the proposed algorithm. With our FGS-enhanced method, the cancer classification model achieved 96.5%,96.2%,96%, and 95.9% for accuracy, precision, recall, and f1-score respectively, which is significantly higher than 69.2% accuracy, 57.8% precision, 66% recall, and 58.2% f1-score when the standard MLP method was used. In examining the six datasets that were used, the proposed model demonstrates it's capacity to classify cancer effectively.
研究动机与目标
- 解决高维基因表达数据在癌症分类中带来的挑战,此类数据会抑制模型性能并增加训练时间。
- 通过仅选择最具信息量的基因来降低数据集维度,以减轻过拟合并提升训练效率。
- 开发一种基于模糊逻辑的基因选择框架,整合多种特征评分方法,以增强基因排序与选择的准确性。
- 通过优化基因子集选择,提升深度学习分类器(尤其是 MLP)在基因表达数据上的性能。
- 为癌症研究与早期诊断中的进一步实验验证,提供一组具有生物学可解释性的候选基因。
提出的方法
- 应用三种特征选择方法——互信息、F-ClassIf 和卡方检验——在六个基因表达数据集上计算每个基因的初始得分与排名。
- 使用模糊化处理将清晰的特征得分转换为模糊隶属度值,以捕捉不确定性并提升基因排序的鲁棒性。
- 应用去模糊化技术(如重心法)为每个基因生成单一、统一的模糊得分,从而实现清晰的基因优先排序。
- 将 FGS 过程中选出的最高等级基因作为输入特征,输入多层感知机(MLP)分类器以执行癌症分类。
- 使用五折交叉验证,在 GEO 和 TCGA 数据库中的四个芯片数据集和两个 RNA-seq 数据集上训练并评估 FGS-MLP 模型。
- 使用标准深度学习超参数优化模型,并通过准确率、精确率、召回率和 F1 分数等指标验证性能。

实验结果
研究问题
- RQ1基于模糊逻辑的基因选择方法能否有效降低高维基因表达数据的维度,同时保留与分类相关的关键特征?
- RQ2将 FGS 与深度学习分类器(MLP)结合后,相较于未进行基因选择的标准 MLP,癌症分类性能是否得到显著提升?
- RQ3FGS 在基于基因表达数据训练的癌症分类模型中,能在多大程度上减少过拟合现象并缩短训练时间?
- RQ4在通过模糊逻辑融合时,互信息、F-ClassIf 和卡方检验这三种特征选择方法的何种组合能产生最稳健且一致的基因排序?
- RQ5FGS 过程中选出的基因是否可作为具有生物学意义的生物标志物,以供后续在癌症发生机制研究中的实验验证?
主要发现
- FGS-MLP 模型在六个基因表达数据集上的平均准确率达到 96.5%,显著高于未使用基因选择的标准 MLP 模型(准确率仅为 69.2%)。
- 引入 FGS 后,精确率、召回率和 F1 分数分别提升至 96.2%、96% 和 95.9%,而未使用 FGS 时分别为 57.8%、66% 和 58.2%,表明性能有显著提升。
- FGS 方法将输入基因数量减少至最小且具有生物学意义的集合,从而降低了训练时间并减少了过拟合风险。
- 当与 FGS 结合时,MLP 的准确率提升幅度最大(达 27.3%),表明其与所提出的基因选择方法具有极强的协同效应。
- 在各个独立数据集中,模型的分类准确率范围为 93% 至 99%,其中在 GSE33630 甲状腺癌数据集中达到最高准确率(99%)。
- FGS 选出的基因具有生物学合理性,可作为候选生物标志物,供后续在癌症研究与早期诊断中的实验验证。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。