[论文解读] Interval Type-2 Enhanced Possibilistic Fuzzy C-Means Clustering for Gene Expression Data Analysis
本文提出了一种区间型Ⅱ型增强可能性模糊c均值(IT2EPFCM)算法,通过将区间型Ⅱ型模糊集与双重模糊化因子结合,用于隶属度和典型度,提升了在基因表达数据中聚类的鲁棒性。该方法在处理噪声和避免重合聚类方面优于现有最先进技术,在微阵列数据集上表现出更优的准确性和稳定性。
Both FCM and PCM clustering methods have been widely applied to pattern recognition and data clustering. Nevertheless, FCM is sensitive to noise and PCM occasionally generates coincident clusters. PFCM is an extension of the PCM model by combining FCM and PCM, but this method still suffers from the weaknesses of PCM and FCM. In the current paper, the weaknesses of the PFCM algorithm are corrected and the enhanced possibilistic fuzzy c-means (EPFCM) clustering algorithm is presented. EPFCM can still be sensitive to noise. Therefore, we propose an interval type-2 enhanced possibilistic fuzzy c-means (IT2EPFCM) clustering method by utilizing two fuzzifiers $(m_1, m_2)$ for fuzzy memberships and two fuzzifiers $(θ_1, θ_2)$ for possibilistic typicalities. Our computational results show the superiority of the proposed approaches compared with several state-of-the-art techniques in the literature. Finally, the proposed methods are implemented for analyzing microarray gene expression data.
研究动机与目标
- 为解决传统FCM和PCM聚类的局限性,特别是对噪声敏感及易产生重合聚类的问题。
- 克服PFCM算法的残余缺陷,该算法虽结合了FCM与PCM,但仍存在对噪声敏感和聚类退化的问题。
- 通过将区间型Ⅱ型模糊集整合到可能性模糊c均值框架中,提升在基因表达数据中聚类的鲁棒性。
- 开发一种新型聚类模型——IT2EPFCM,利用双重模糊化因子对模糊隶属度和可能性典型度进行优化,以提高稳定性和准确性。
- 在真实微阵列基因表达数据集上验证所提方法,并与最先进聚类技术进行性能比较。
提出的方法
- IT2EPFCM算法引入两个模糊化因子 $m_1$ 和 $m_2$,用于控制模糊c均值部分中隶属度的模糊程度。
- 采用两个额外的模糊化因子 ${\theta}_1$ 和 ${\theta}_2$,用于调节可能性典型度值,增强对噪声和异常值的鲁棒性。
- 该方法整合区间型Ⅱ型模糊集,以建模聚类原型和隶属度中的不确定性,提升对数据模糊性的处理能力。
- 目标函数结合了模糊与可能性成分,并引入区间型Ⅱ型模糊不确定性,通过最小化一个混合能量函数来平衡隶属度与典型度。
- 通过迭代算法进行优化,交替更新聚类中心、隶属度与典型度,基于目标函数的梯度下降法实现。
- 该框架特别针对基因表达数据进行定制,保留了生物学可解释性,并在高维、噪声较大的数据集中提升了聚类分离能力。
实验结果
研究问题
- RQ1区间型Ⅱ型模糊集的整合是否能提升可能性模糊c均值在噪声基因表达数据中的鲁棒性?
- RQ2对隶属度和典型度采用双重模糊化因子,在存在异常值的情况下,如何影响聚类分离与收敛性?
- RQ3所提出的IT2EPFCM算法在微阵列数据上的准确性和稳定性方面,是否优于PFCM及其他最先进聚类方法?
- RQ4与传统PCM和FCM相比,使用区间型Ⅱ型模糊集在多大程度上减少了重合聚类的发生?
- RQ5该方法在不同噪声水平和维度的基因表达数据集中,如何保持性能一致性?
主要发现
- IT2EPFCM算法在基准微阵列数据集上,与FCM、PCM、PFCM及其他最先进方法相比,表现出更优的聚类准确性。
- 通过利用区间型Ⅱ型模糊不确定性,该方法有效减少了PCM和PFCM中已知的重合聚类现象。
- 计算结果表明,双重模糊化因子策略($m_1, m_2$ 和 ${\theta}_1, {\theta}_2$)提升了收敛稳定性,并降低了对初始化和噪声的敏感性。
- 区间型Ⅱ型模糊集的整合显著增强了对数据不确定性和异常值的鲁棒性,尤其在高维基因表达数据中表现突出。
- 所提方法在内部与外部聚类评估指标验证下,实现了对具有生物意义聚类的更好分离。
- 该算法在多种数据集上保持一致的性能,表明其在基因组数据分析中具备强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。