Skip to main content
QUICK REVIEW

[论文解读] Meta-Unsupervised-Learning: A supervised approach to unsupervised learning

Vikas Garg, Adam Tauman Kalai|arXiv (Cornell University)|Dec 29, 2016
Anomaly Detection Techniques and Applications参考文献 14被引用 3
一句话总结

本文提出元无监督学习(meta-unsupervised-learning),一种将无监督学习任务——如聚类、异常检测和相似性预测——转化为监督学习问题的框架,通过利用先前的标注数据集实现。该方法在包含100多个分类问题的数据集上进行训练,学习选择最优的聚类算法、超参数和异常值阈值,即使在未见过的数据上也显著优于基线启发式方法,并绕过了聚类的Kleinberg不可能定理。

ABSTRACT

We introduce a new paradigm to investigate unsupervised learning, reducing unsupervised learning to supervised learning. Specifically, we mitigate the subjectivity in unsupervised decision-making by leveraging knowledge acquired from prior, possibly heterogeneous, supervised learning tasks. We demonstrate the versatility of our framework via comprehensive expositions and detailed experiments on several unsupervised problems such as (a) clustering, (b) outlier detection, and (c) similarity prediction under a common umbrella of meta-unsupervised-learning. We also provide rigorous PAC-agnostic bounds to establish the theoretical foundations of our framework, and show that our framing of meta-clustering circumvents Kleinberg's impossibility theorem for clustering.

研究动机与目标

  • 通过将无监督学习建模为元学习问题,解决其内在的主观性以及缺乏客观评估的问题。
  • 通过从先前的监督任务中提取可迁移的数据驱动知识,降低选择聚类算法、聚类数量和异常值阈值的难度。
  • 提供一种理论上有依据的方法,通过在无监督问题的元分布上建模,绕过聚类的Kleinberg不可能定理。
  • 证明异构的先前标注数据集可用于提升新无标签无监督问题的性能。
  • 表明在来自多个领域聚合的无标签数据上训练的神经网络,能够泛化到新的无监督任务。

提出的方法

  • 将每个标注数据集视为一个元样本,其中真实聚类(由标签定义)作为无监督学习的目标。
  • 将聚类和相似性预测等无监督问题简化为成对二分类问题,标签表示两个实例是否属于同一聚类。
  • 在来自OpenML的100多个数据集的仓库上训练深度神经网络,使用基于聚类指标和数据属性的特征向量。
  • 采用4层前馈网络,使用ReLU激活函数和log-softmax输出,通过Adadelta优化器在10个周期内训练,损失函数为负对数似然。
  • 在预测时,对一对样本及其反向对的模型输出取平均,以确保对称性,若平均概率超过0.5则分配至同一聚类。
  • 在内部和外部测试集上评估性能,包括未用于训练的分区数据,以评估泛化能力。

实验结果

研究问题

  • RQ1能否通过利用先前的标注数据,系统性地将无监督学习问题简化为监督学习问题?
  • RQ2能否通过从先前的监督任务中学习,利用元方法在多样化数据集上提升聚类性能?
  • RQ3利用异构的标注数据集仓库,是否能比启发式默认方法更优地选择聚类算法和超参数?
  • RQ4该框架能否在训练数据不包含此类数据分布的情况下,泛化到未见过的数据分布?
  • RQ5在来自多个领域的聚合无标签数据上训练的神经网络,在多大程度上能提升无监督决策能力?

主要发现

  • 该元方法在内部和外部测试集上均显著优于多数类基线,元外部测试集(meta-ET)的平均准确率达到0.75,表现出强大的泛化能力。
  • 基于数据驱动的评估,K-means聚类在数据集仓库中优于其他四种算法,而非依赖启发式偏好。
  • 在标准启发式方法选择聚类数量时发现了系统性偏差,而这些偏差可通过元学习知识得到纠正。
  • 通过从先前数据中学习最优阈值,该方法在异常值去除中提升了性能,从而改善了聚类质量。
  • 在来自多个领域聚合的无标签数据上训练的神经网络模型,即使测试数据来自训练中未使用的分区,也能有效泛化到新的、未见过的无监督问题。
  • 该框架提供了理论基础,通过在学习任务的元分布上建模,绕过了聚类的Kleinberg不可能定理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。