[论文解读] Image Clustering without Ground Truth
该论文提出了一种基于众包的聚类集成方法,通过整合非专家工作者提供的多样化图像聚类解决方案(每个解决方案可能使用不同的聚类数量)来生成稳健的共识聚类结果,而无需依赖真实标签。通过使用基于质心的相似性度量和优化的距离度量,该方法在与专家标注的聚类结果对比时表现出高一致性,即使聚类数量不一致,其性能也优于传统集成技术。
Cluster analysis has become one of the most exercised research areas over the past few decades in computer science. As a consequence, numerous clustering algorithms have already been developed to find appropriate partitions of a set of objects. Given multiple such clustering solutions, it is a challenging task to obtain an ensemble of these solutions. This becomes more challenging when the ground truth about the number of clusters is unavailable. In this paper, we introduce a crowd-powered model to collect solutions of image clustering from the general crowd and pose it as a clustering ensemble problem with variable number of clusters. The varying number of clusters basically reflects the crowd workers' perspective toward a particular set of objects. We allow a set of crowd workers to independently cluster the images as per their perceptions. We address the problem by finding out centroid of the clusters using an appropriate distance measure and prioritize the likelihood of similarity of the individual cluster sets. The effectiveness of the proposed method is demonstrated by applying it on multiple artificial datasets obtained from crowd.
研究动机与目标
- 解决真实世界数据集中真实聚类数量未知时的图像聚类挑战,这是常见问题。
- 利用非专家众包工作者的集体人类智能,生成具有不同聚类数量的多样化聚类解决方案。
- 开发一种稳健的聚类集成框架,将这些异构解决方案整合为单一高质量的共识聚类结果。
- 在模糊且人类难以判断的图像聚类任务中验证该方法的有效性,这些任务中基于机器的方法往往表现不佳。
提出的方法
- 从多名众包工作者处收集聚类解决方案,每位工作者独立根据其个人感知将图像分配到聚类中。
- 将每位工作者的解决方案表示为图像到可变数量聚类的划分,以反映主观理解的差异。
- 使用调整兰德指数(ARI)计算聚类解决方案之间的成对相似性,以衡量不同众包生成划分之间的一致性。
- 应用基于质心的聚类集成方法,通过最小化所有输入解决方案中的类内方差,识别具有代表性的聚类结构。
- 使用距离度量来优先考虑聚类集合之间相似性的可能性,从而在聚类数量不同的情况下实现共识形成。
- 自动确定共识解决方案中的最终聚类数量,无需事先知识或手动调参。
实验结果
研究问题
- RQ1当真实聚类数量未知时,非专家的集体人类智能能否产生可靠且多样的图像聚类解决方案?
- RQ2在无真实标签的情况下,聚类集成方法如何适应输入解决方案中聚类数量可变的情况?
- RQ3基于质心的集成方法在模糊图像聚类任务中,与传统聚类集成算法(如CSPA、HGPA、MCLA)相比,能多大程度上实现性能超越?
- RQ4与专家标注的真实标签相比,该方法的性能如何,特别是在标准化互信息和调整兰德指数方面的表现?
主要发现
- 在第三个数据集上,所提方法在共识聚类结果中实现了0.6909的调整兰德指数(ARI),优于需要固定聚类数量的最先进集成方法。
- 在第二个数据集上,与单个工作者解决方案相比,该方法实现了0.6034的ARI,且在所有测试聚类数量下,性能与CSPA、HGPA和MCLA相当或更优。
- 该方法在无需输入聚类数量的情况下,始终能生成高质量的共识结果,证明了其对可变聚类数量的鲁棒性。
- 所有数据集上的平均ARI表明,该方法即使与专家标注的真实标签相比,也保持了强劲的性能,表明其与人类感知高度一致。
- 在聚类边界不清晰的模糊图像集合上,该方法优于传统集成算法,凸显其在真实世界非平凡聚类场景中的有效性。
- 结果证实,人类生成的聚类解决方案多样性——尤其是聚类数量不同时——可被有效利用,以生成更准确、更可靠的共识结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。