Skip to main content
QUICK REVIEW

[论文解读] Correlation Clustering with Adaptive Similarity Queries

Marco Bressan, Nicolò Cesa‐Bianchi|arXiv (Cornell University)|May 28, 2019
Advanced Clustering Algorithms Research被引用 9
一句话总结

本文提出了用于相关聚类的自适应相似性查询算法,旨在最小化聚类误差和查询成本。提出了ACC与ACCESS,实现了查询次数与误差之间的近似最优权衡,并在对抗性扰动下提供了聚类恢复的理论保证,以及在给定误差水平下的信息论查询复杂度下界。

ABSTRACT

In correlation clustering, we are given $n$ objects together with a binary similarity score between each pair of them. The goal is to partition the objects into clusters so to minimise the disagreements with the scores. In this work we investigate correlation clustering as an active learning problem: each similarity score can be learned by making a query, and the goal is to minimise both the disagreements and the total number of queries. On the one hand, we describe simple active learning algorithms, which provably achieve an almost optimal trade-off while giving cluster recovery guarantees, and we test them on different datasets. On the other hand, we prove information-theoretical bounds on the number of queries necessary to guarantee a prescribed disagreement bound. These results give a rich characterization of the trade-off between queries and clustering error.

研究动机与目标

  • 解决在相关聚类中最小化聚类误差的同时减少相似性查询次数的挑战。
  • 设计主动学习算法,自适应地选择需查询的成对相似性,平衡准确性与查询效率。
  • 在底层聚类受到对抗性扰动时,提供聚类恢复的理论保证。
  • 建立实现给定聚类误差水平所需查询次数的信息论紧下界。
  • 刻画主动相关聚类中查询次数与聚类误差之间的基本权衡。

提出的方法

  • 提出ACC(自适应相关聚类),作为KwikCluster的变体,自适应选择查询以在确定的查询预算下最小化误差。
  • 提出ACCESS(自适应早期停止相关聚类),通过在收集到足够信息时提前停止来减少查询次数。
  • 采用查询选择与误差传播的概率分析,通过真实聚类的对称差来建模期望的不一致数量。
  • 应用Yao的最小最大原理,推导出实现目标误差水平所需查询复杂度的信息论下界。
  • 利用集中不等式分析对抗性扰动下的聚类恢复,计算真实聚类与恢复聚类之间期望的对称差。
  • 利用图论表示:相似性+1对应一条边,并使用线性规划松弛技术作为误差边界的基准。

实验结果

研究问题

  • RQ1在相关聚类中,实现给定聚类误差所需的最少相似性查询次数是多少?
  • RQ2在固定查询预算下,自适应查询策略是否能优于非自适应或贪心方法,获得更好的误差保证?
  • RQ3当潜在聚类受到对抗性边修改扰动时,主动学习算法能多好地恢复原始聚类?
  • RQ4在主动相关聚类中,查询次数与聚类误差之间的信息论极限是什么?
  • RQ5早期停止策略是否能显著减少查询使用量而不牺牲聚类准确性?

主要发现

  • ACC在确定的查询预算 $ Q = \Omega(n) $ 下,实现期望聚类误差为 $ 3\mathrm{OPT} + \mathcal{O}(n^3 / Q) $,优于先前方法。
  • 当 $ \mathrm{OPT} = 0 $ 时,ACCESS将期望查询次数降低至 $ \widetilde{\mathcal{O}}(n^3 / Q) $,在某些情形下相比ACC实现平方根级改进。
  • 对于扰动比例为 $ \varepsilon $ 的对抗性扰动聚类,ACC实现的期望对称差为 $ \mathcal{O}(\varepsilon |C| + n^2 / Q) $,表明对大聚类具有高保真度恢复。
  • 论文证明了一个下界:任何查询少于 $ \Omega(n / \varepsilon) $ 次的算法,其误差至少为 $ \mathbb{E}[\mathrm{OPT}] + \Omega(\varepsilon n^2) $,从而确立了紧致的权衡关系。
  • 在更强假设下,独立运行ACC可高概率地完全恢复所有大聚类。
  • 理论分析证实,查询与误差之间的权衡近乎最优,上下界仅相差对数因子。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。