Skip to main content
QUICK REVIEW

[论文解读] Co-clustering through Optimal Transport

Charlotte Laclau, Ievgen Redko|arXiv (Cornell University)|May 17, 2017
Domain Adaptation and Few-Shot Learning参考文献 31被引用 7
一句话总结

该论文提出了一种名为协同聚类最优传输(Co-clustering through Optimal Transport, CCOT)的新无监督方法,通过建模其概率耦合关系,利用熵正则化最优传输联合聚类数据实例和特征。该方法可自动确定行与列聚类的数量,并在真实世界数据集(包括具有9×15块结构的MovieLens数据集)上验证了其最先进的准确率与速度。

ABSTRACT

In this paper, we present a novel method for co-clustering, an unsupervised learning approach that aims at discovering homogeneous groups of data instances and features by grouping them simultaneously. The proposed method uses the entropy regularized optimal transport between empirical measures defined on data instances and features in order to obtain an estimated joint probability density function represented by the optimal coupling matrix. This matrix is further factorized to obtain the induced row and columns partitions using multiscale representations approach. To justify our method theoretically, we show how the solution of the regularized optimal transport can be seen from the variational inference perspective thus motivating its use for co-clustering. The algorithm derived for the proposed method and its kernelized version based on the notion of Gromov-Wasserstein distance are fast, accurate and can determine automatically the number of both row and column clusters. These features are vividly demonstrated through extensive experimental evaluations.

研究动机与目标

  • 为解决现有协同聚类方法的局限性,特别是需要预先指定聚类数量的问题。
  • 开发一种可扩展且准确的协同聚类方法,同时对数据实例和特征进行分组。
  • 实现在无先验知识的情况下自动检测行与列聚类数量。
  • 通过将最优传输与变分推断通过反向Kullback-Leibler散度最小化相联系,提供理论基础。

提出的方法

  • 该方法将协同聚类问题建模为定义在数据实例与特征上的经验测度之间的最优传输问题。
  • 通过熵正则化确保耦合矩阵的计算效率与平滑性,从而实现快速且可并行优化。
  • 最优传输解生成一个双随机耦合矩阵,可解释为实例与特征上的联合概率分布。
  • 利用多尺度表示对这一耦合矩阵进行分解,以提取对应于协同聚类的行与列划分。
  • 核化变体使用Gromov-Wasserstein距离在相似性矩阵上操作,使该方法能够处理非欧几里得数据结构。
  • 通过证明通过最优传输进行密度估计等价于反向KL散度最小化的变分推断,提供理论支持。

实验结果

研究问题

  • RQ1能否有效将最优传输重新定位为一种具有自动聚类数量检测能力的协同聚类原则性框架?
  • RQ2在最优传输中使用熵正则化相较于传统度量或概率方法,在协同聚类中的可扩展性与准确性方面有何提升?
  • RQ3最优传输生成的耦合矩阵在推导行与列划分时,能否提供有意义的联合分布?
  • RQ4该方法是否可推广至使用相似性矩阵上Gromov-Wasserstein距离的核化设置?
  • RQ5最优传输解的变分推断解释是否从统计学习角度为该方法在协同聚类中的应用提供了合理依据?

主要发现

  • CCOT-GW在MovieLens数据集中自动检测到9×15的协同聚类结构,且各次运行间的划分高度一致(标准化互信息 >0.8)。
  • 该方法实现了准确且可解释的协同聚类:M1包含《星球大战》(1977)等高分热门电影,而M15则包含《艾米蒂维尔:新世代》(1993)等评价较低的影片。
  • 用户聚类揭示了不同的打分行为,最后两个聚类的打分始终低于平均水平,表明存在系统性的用户偏好。
  • 耦合矩阵有效总结了数据矩阵,块内均值清晰显示出协同聚类内部一致的打分模式。
  • 该算法表现出高计算效率与可扩展性,得益于熵正则化与并行化实现的快速收敛。
  • 通过反向KL散度最小化与变分推断的理论联系,为该方法的设计提供了坚实的统计基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。