[论文解读] Improving Image Clustering With Multiple Pretrained CNN Feature Extractors
本文提出一种两阶段方法,通过利用多个预训练CNN作为互补视图来提升图像聚类性能,随后采用端到端多输入神经网络(DMVC)联合优化聚类与特征学习。该方法通过消除单一特征提取器的任意选择,并在端到端训练中学习统一且紧凑的表示,实现了在VOC2007、COIL100和UMist数据集上的最先进性能。
For many image clustering problems, replacing raw image data with features extracted by a pretrained convolutional neural network (CNN), leads to better clustering performance. However, the specific features extracted, and, by extension, the selected CNN architecture, can have a major impact on the clustering results. In practice, this crucial design choice is often decided arbitrarily due to the impossibility of using cross-validation with unsupervised learning problems. However, information contained in the different pretrained CNN architectures may be complementary, even when pretrained on the same data. To improve clustering performance, we rephrase the image clustering problem as a multi-view clustering (MVC) problem that considers multiple different pretrained feature extractors as different "views" of the same data. We then propose a multi-input neural network architecture that is trained end-to-end to solve the MVC problem effectively. Our experimental results, conducted on three different natural image datasets, show that: 1. using multiple pretrained CNNs jointly as feature extractors improves image clustering; 2. using an end-to-end approach improves MVC; and 3. combining both produces state-of-the-art results for the problem of image clustering.
研究动机与目标
- 解决在图像聚类中任意选择单一预训练CNN所带来的性能显著影响问题。
- 探究多个预训练CNN提供的互补信息是否能提升聚类性能。
- 开发一种端到端深度多视图聚类框架,联合优化特征学习与聚类。
- 通过将多个CNN视为多视图数据,消除在特征提取器选择中的手动设计选择。
- 建立使用预训练特征进行多视图聚类的新基准。
提出的方法
- 通过从多个预训练CNN中提取特征,将图像聚类重新表述为多视图聚类(MVC)问题,将每个CNN视为同一数据的独立视图。
- 提出一种多输入神经网络架构(MVnet),并行处理来自不同CNN的特征,并学习共享的统一表示。
- 使用JULE深度聚类框架对整个流程进行端到端训练,以联合优化聚类分配与特征表示。
- 采用联合损失函数,结合聚类损失与重建损失,以在不同视图之间优化统一表示。
- 在中间表示上应用t-SNE可视化与KMeans聚类,分析各阶段管道中特征的紧凑性与分离度。
- 在三个基准数据集(VOC2007、COIL100和UMist)上评估该方法,并与最先进聚类基线进行比较。
实验结果
研究问题
- RQ1与仅使用单一CNN相比,结合多个预训练CNN的特征是否能提升图像聚类性能?
- RQ2与分阶段优化相比,多视图聚类网络的端到端训练是否能带来更好的聚类结果?
- RQ3所提出的端到端框架学习到的表示是否比单个CNN或固定特征提取器的表示更紧凑且更易分离?
- RQ4该方法是否能消除在无监督图像聚类中对单一CNN架构任意选择的需求?
- RQ5即使在相同ImageNet数据集上预训练,不同预训练CNN是否仍能提供互补信息?
主要发现
- 所提出的结合多个预训练CNN与端到端多视图聚类(DMVC)的方法,在VOC2007、COIL100和UMist数据集上实现了最先进性能。
- 使用多个CNN作为视图可提升聚类性能,相较于单一CNN,UMist数据集上NMI从0.624(InceptionV3)提升至0.786(DMVC)。
- DMVC框架的端到端训练使聚类更加紧凑且分离度更高,KMeans聚类分析中间表示显示,UMist上NMI从0.759(DMVC-fix)提升至0.973。
- t-SNE可视化证实,最终DMVC表示比单个CNN或中间阶段的表示更具判别性且分离度更好。
- 该方法在所有三个数据集上均优于强基线模型(包括JULE和其他MVC方法),证明了联合多视图学习的有效性。
- 消融实验表明,ResNet50单独已表现优异(VOC2007上NMI = 0.997),但与其他网络结合仍能进一步提升性能,表明不同架构间存在互补知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。