Skip to main content
QUICK REVIEW

[论文解读] Relaxed Oracles for Semi-Supervised Clustering

Taewan Kim, Joydeep Ghosh|arXiv (Cornell University)|Nov 20, 2017
Advanced Clustering Algorithms Research参考文献 18被引用 3
一句话总结

本文提出了一种用于半监督聚类的松弛型预言机模型,允许对成对同簇查询返回‘不确定’响应,从而在现实场景中提升鲁棒性。通过基于到聚类中心距离的策略性选择查询对,该方法在存在不确定性的情况下,以极低的查询复杂度实现了高聚类准确率,即使在合成数据和真实数据(MNIST)上也优于标准SSAC。

ABSTRACT

Pairwise "same-cluster" queries are one of the most widely used forms of supervision in semi-supervised clustering. However, it is impractical to ask human oracles to answer every query correctly. In this paper, we study the influence of allowing "not-sure" answers from a weak oracle and propose an effective algorithm to handle such uncertainties in query responses. Two realistic weak oracle models are considered where ambiguity in answering depends on the distance between two points. We show that a small query complexity is adequate for effective clustering with high probability by providing better pairs to the weak oracle. Experimental results on synthetic and real data show the effectiveness of our approach in overcoming supervision uncertainties and yielding high quality clusters.

研究动机与目标

  • 解决在半监督聚类中要求人类预言机提供完美响应的不切实际问题。
  • 建模现实中的弱预言机行为,其中因点间距离模糊而产生‘不确定’回答。
  • 开发一种改进的SSAC算法,即使在预言机响应存在不确定性的情况下仍能保持高聚类准确率。
  • 从理论和实证上验证:少量精心选择的查询足以在不确定性下实现有效聚类。
  • 在合成数据和真实世界MNIST嵌入数据上,展示算法的鲁棒性与可扩展性。

提出的方法

  • 提出两种基于距离的弱预言机模型,其中模糊性随簇间接近程度或簇内离散度增加而增加。
  • 引入一种改进的SSAC算法,通过在排序数据上使用二分查找,提高查询效率并降低失败概率。
  • 采用参数为$\eta$的采样策略,选择$r = \lceil k\eta \rceil$个点进行聚类分配查询。
  • 使用成对查询$Q(x,y)$,其响应有三种可能:1(同簇)、0(不确定)、-1(不同簇)。
  • 通过概率分析表明,当至少有一个点靠近聚类中心时,可高概率实现聚类恢复。
  • 在二分查找步骤中,通过优先选择靠近估计聚类中心的点来优化查询选择,以提高预言机可靠性。

实验结果

研究问题

  • RQ1当预言机因成对比较模糊而返回‘不确定’响应时,半监督聚类是否仍能保持有效性?
  • RQ2在主动学习框架中,‘不确定’响应的引入如何影响查询复杂度与聚类准确率?
  • RQ3在具有距离相关模糊性的弱预言机模型下,何种查询选择策略能最小化失败概率?
  • RQ4当至少有一个点靠近聚类中心时,是否能显著提升对预言机不确定性的鲁棒性?
  • RQ5在现实预言机模型下,所提算法与原始SSAC相比,在准确率与失败率方面表现如何?

主要发现

  • 所提算法在所有测试设置下均取得高于原始SSAC的聚类准确率,尤其当$\eta \geq 5$时表现更优。
  • 随着$\eta$增大,失败率显著下降,表明充分采样可提升对预言机不确定性的鲁棒性。
  • 在合成数据上,改进算法在相同条件下相比原始SSAC将失败率降低超过50%。
  • 在MNIST数据上,即使$c_{dist} = 0.6$(强距离相关模糊性),算法仍能保持高于90%的准确率,表明对模糊性的强鲁棒性。
  • 只要至少有一个点靠近聚类中心,即使预言机的‘不确定’阈值较高,该方法仍具有效性。
  • 实证结果证实,在弱预言机模型下,基于靠近估计中心的点选择查询对,能显著提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。