[论文解读] Semi-crowdsourced Clustering with Deep Generative Models
本文提出半人工众包深度聚类(SCDC),一种联合模型,结合深度生成模型(DGMs)用于原始数据表征,以及统计关系模型用于对数据子集的噪声成对众包标签。该方法使用快速自然梯度随机变分推断,统一了压缩DGM学习与变分消息传递,实现了在MNIST和CIFAR-10上的最先进聚类性能,且人工标注成本极低,并通过其完全贝叶斯变体实现了自动复杂度控制。
We consider the semi-supervised clustering problem where crowdsourcing provides noisy information about the pairwise comparisons on a small subset of data, i.e., whether a sample pair is in the same cluster. We propose a new approach that includes a deep generative model (DGM) to characterize low-level features of the data, and a statistical relational model for noisy pairwise annotations on its subset. The two parts share the latent variables. To make the model automatically trade-off between its complexity and fitting data, we also develop its fully Bayesian variant. The challenge of inference is addressed by fast (natural-gradient) stochastic variational inference algorithms, where we effectively combine variational message passing for the relational part and amortized learning of the DGM under a unified framework. Empirical results on synthetic and real-world datasets show that our model outperforms previous crowdsourced clustering methods.
研究动机与目标
- 解决现有众包聚类方法依赖低级特征、忽略工作者噪声与差异性的局限性。
- 通过仅使用少量成对标注,降低标注成本,同时保持高聚类准确率。
- 通过共享潜在变量,联合建模原始数据与噪声众包标签,实现端到端学习。
- 开发完全贝叶斯变体,自动控制模型复杂度,无需人工调参。
- 通过统一框架结合压缩DGM学习与变分消息传递,实现高效推断。
提出的方法
- 该模型使用深度生成模型(DGM)从原始数据中学习分层非线性表征,由${\bm{\gamma}}$参数化,观测数据$\mathbf{o}_n$由潜在因子$\mathbf{x}_n$生成。
- 通过离散潜在变量$\mathbf{z}_n$定义聚类成员关系的高斯混合模型,包含聚类均值$\bm{\mu}$、协方差$\bm{\Sigma}$与混合比例$\bm{\pi}$。
- 通过统计关系模型对众包成对标签$\mathbf{L}$进行建模,考虑工作者特定的准确率($\bm{\alpha}, \bm{\beta}$)与偏好。
- DGM与关系模型共享相同的潜在变量$\mathbf{z}_n$,实现联合推断与端到端训练。
- 通过在$\bm{\alpha}, \bm{\beta}, \bm{\pi}$上施加共轭先验,引入完全贝叶斯变体,实现自动模型复杂度控制。
- 通过使用自然梯度更新共轭部分与压缩推断处理非共轭DGM组件的统一随机变分推断框架,实现快速推断。
实验结果
研究问题
- RQ1当与来自众包的噪声成对标注结合时,深度生成模型是否能提升聚类性能?
- RQ2在半监督设置中,共享潜在变量如何有效统一原始数据建模与噪声标签建模?
- RQ3该模型的完全贝叶斯变体是否能自动控制复杂度,避免过拟合并无需人工超参数调优?
- RQ4所提出的推断框架如何在压缩DGM学习与关系组件的变分消息传递之间实现平衡?
- RQ5与先前方法相比,该模型在多大程度上降低了标注成本,同时保持或提升了聚类准确率?
主要发现
- 在MNIST上,BayesSCDC在使用噪声标注时达到84.24%的聚类准确率与0.8120的NMI,显著优于SCDC(81.87%准确率,0.7657 NMI)与无标注基线。
- BayesSCDC通过避免与聚类数量线性相关,将每轮训练时间从201.7秒减少至16.4秒,展现出计算效率。
- 在CIFAR-10上,SCDC使用标注后达到50.09%准确率与0.5549 NMI,显著优于无标注时的14.23%准确率与0.0424 NMI。
- 完全贝叶斯变体(BayesSCDC)在训练过程中自动确定了聚类数量,如随时间变化的聚类比例可视化所示。
- 模型在多次随机初始化下表现稳定,结果方差低,表明优化过程稳定。
- 所提出的推断框架成功结合了变分消息传递与压缩学习,实现了在复杂数据上的可扩展且准确的联合推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。