Skip to main content
QUICK REVIEW

[论文解读] Semi-crowdsourced Clustering with Deep Generative Models

Yucen Luo, Tian Tian|arXiv (Cornell University)|Oct 29, 2018
Anomaly Detection Techniques and Applications参考文献 26被引用 7
一句话总结

本文提出半人工众包深度聚类(SCDC),一种联合模型,结合深度生成模型(DGMs)用于原始数据表征,以及统计关系模型用于对数据子集的噪声成对众包标签。该方法使用快速自然梯度随机变分推断,统一了压缩DGM学习与变分消息传递,实现了在MNIST和CIFAR-10上的最先进聚类性能,且人工标注成本极低,并通过其完全贝叶斯变体实现了自动复杂度控制。

ABSTRACT

We consider the semi-supervised clustering problem where crowdsourcing provides noisy information about the pairwise comparisons on a small subset of data, i.e., whether a sample pair is in the same cluster. We propose a new approach that includes a deep generative model (DGM) to characterize low-level features of the data, and a statistical relational model for noisy pairwise annotations on its subset. The two parts share the latent variables. To make the model automatically trade-off between its complexity and fitting data, we also develop its fully Bayesian variant. The challenge of inference is addressed by fast (natural-gradient) stochastic variational inference algorithms, where we effectively combine variational message passing for the relational part and amortized learning of the DGM under a unified framework. Empirical results on synthetic and real-world datasets show that our model outperforms previous crowdsourced clustering methods.

研究动机与目标

  • 解决现有众包聚类方法依赖低级特征、忽略工作者噪声与差异性的局限性。
  • 通过仅使用少量成对标注,降低标注成本,同时保持高聚类准确率。
  • 通过共享潜在变量,联合建模原始数据与噪声众包标签,实现端到端学习。
  • 开发完全贝叶斯变体,自动控制模型复杂度,无需人工调参。
  • 通过统一框架结合压缩DGM学习与变分消息传递,实现高效推断。

提出的方法

  • 该模型使用深度生成模型(DGM)从原始数据中学习分层非线性表征,由${\bm{\gamma}}$参数化,观测数据$\mathbf{o}_n$由潜在因子$\mathbf{x}_n$生成。
  • 通过离散潜在变量$\mathbf{z}_n$定义聚类成员关系的高斯混合模型,包含聚类均值$\bm{\mu}$、协方差$\bm{\Sigma}$与混合比例$\bm{\pi}$。
  • 通过统计关系模型对众包成对标签$\mathbf{L}$进行建模,考虑工作者特定的准确率($\bm{\alpha}, \bm{\beta}$)与偏好。
  • DGM与关系模型共享相同的潜在变量$\mathbf{z}_n$,实现联合推断与端到端训练。
  • 通过在$\bm{\alpha}, \bm{\beta}, \bm{\pi}$上施加共轭先验,引入完全贝叶斯变体,实现自动模型复杂度控制。
  • 通过使用自然梯度更新共轭部分与压缩推断处理非共轭DGM组件的统一随机变分推断框架,实现快速推断。

实验结果

研究问题

  • RQ1当与来自众包的噪声成对标注结合时,深度生成模型是否能提升聚类性能?
  • RQ2在半监督设置中,共享潜在变量如何有效统一原始数据建模与噪声标签建模?
  • RQ3该模型的完全贝叶斯变体是否能自动控制复杂度,避免过拟合并无需人工超参数调优?
  • RQ4所提出的推断框架如何在压缩DGM学习与关系组件的变分消息传递之间实现平衡?
  • RQ5与先前方法相比,该模型在多大程度上降低了标注成本,同时保持或提升了聚类准确率?

主要发现

  • 在MNIST上,BayesSCDC在使用噪声标注时达到84.24%的聚类准确率与0.8120的NMI,显著优于SCDC(81.87%准确率,0.7657 NMI)与无标注基线。
  • BayesSCDC通过避免与聚类数量线性相关,将每轮训练时间从201.7秒减少至16.4秒,展现出计算效率。
  • 在CIFAR-10上,SCDC使用标注后达到50.09%准确率与0.5549 NMI,显著优于无标注时的14.23%准确率与0.0424 NMI。
  • 完全贝叶斯变体(BayesSCDC)在训练过程中自动确定了聚类数量,如随时间变化的聚类比例可视化所示。
  • 模型在多次随机初始化下表现稳定,结果方差低,表明优化过程稳定。
  • 所提出的推断框架成功结合了变分消息传递与压缩学习,实现了在复杂数据上的可扩展且准确的联合推断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。