Skip to main content
QUICK REVIEW

[论文解读] Learning Concept Embeddings with Combined Human-Machine Expertise

Michael J. Wilber, Iljung S. Kwak|arXiv (Cornell University)|Sep 24, 2015
Data Stream Mining Techniques参考文献 35被引用 6
一句话总结

本文提出SNaCK,一种新颖算法,通过结合人工提供的三元组约束与机器生成的相似性核函数,构建低维概念嵌入。借助深度学习的视觉特征与专家提示,SNaCK在概念学习任务中实现了最先进性能——如检测CUB-200中的标注错误、捕捉食物口味偏好以及组织象形文字——同时相比以往方法显著减少了人工监督需求。

ABSTRACT

This paper presents our work on "SNaCK," a low-dimensional concept embedding algorithm that combines human expertise with automatic machine similarity kernels. Both parts are complimentary: human insight can capture relationships that are not apparent from the object's visual similarity and the machine can help relieve the human from having to exhaustively specify many constraints. We show that our SNaCK embeddings are useful in several tasks: distinguishing prime and nonprime numbers on MNIST, discovering labeling mistakes in the Caltech UCSD Birds (CUB) dataset with the help of deep-learned features, creating training datasets for bird classifiers, capturing subjective human taste on a new dataset of 10,000 foods, and qualitatively exploring an unstructured set of pictographic characters. Comparisons with the state-of-the-art in these tasks show that SNaCK produces better concept embeddings that require less human supervision than the leading methods.

研究动机与目标

  • 解决在标注数据稀缺或概念主观且难以形式化定义时学习概念嵌入的挑战。
  • 通过结合专家提示与自动相似性核函数,减少感知嵌入任务中的人工标注负担。
  • 通过整合人类反馈与学习到的视觉表征,实现对未标注数据的交互式、高效探索。
  • 提升在标注错误检测、食物口味建模和视觉组织等任务中概念嵌入的准确率与泛化能力。
  • 证明机器辅助的相似性核函数可显著减少高质量嵌入所需的人工提供约束数量。

提出的方法

  • SNaCK采用两阶段方法:首先计算机器相似性核函数(如来自深度特征或成分列表),然后利用人工提供的三元组约束(形式为‘i 应比 k 更接近 j’)进行优化。
  • 该方法结合t-SNE风格的流形学习与随机三元组嵌入目标,以同时保留全局结构与局部人工指定约束。
  • 采用两种类型的相似性核函数:一种基于深度学习的视觉特征(如ImageNet中的特征),另一种基于语义属性(如食物成分)。
  • 该算法采用可微分优化过程,最小化结合了随机邻域嵌入目标与三元组约束违反情况的损失函数。
  • 支持通过GUI进行交互式优化,用户可选择图像组并指出其共享概念(如情绪),从而以最少输入实现动态嵌入更新。
  • 该方法在特定参数设置下被证明等价于t-STE,为其设计提供了理论基础。

实验结果

研究问题

  • RQ1将人工提供的三元组约束与机器生成的相似性核函数相结合,能否产生比纯人工或纯机器驱动方法泛化能力更强的概念嵌入?
  • RQ2机器核函数在多大程度上能减少高质量概念嵌入所需的人工标注三元组数量?
  • RQ3SNaCK在真实世界数据集(如CUB-200)中检测标注错误的效率如何,尤其是在视觉相似性不总能反映真实类别归属时?
  • RQ4SNaCK能否捕捉主观的人类概念(如食物口味或表情包中的情绪表达),即使这些概念在视觉外观中反映较弱?
  • RQ5在专家输入极少的交互式、半监督数据探索任务中,SNaCK的性能如何?

主要发现

  • 使用核函数2(深度学习视觉特征)的SNaCK在三元组泛化误差上达到28%,优于t-STE的33%,证明其在监督有限条件下的更优泛化能力。
  • SNaCK在概念嵌入任务中实现相当或更优性能所依赖的人工提供三元组数量,显著少于当前最先进方法。
  • 在CUB-200数据集中,SNaCK成功识别出标注错误——例如将红头啄木鸟错误分类至匹利阿特啄木鸟簇中——通过捕捉超越视觉相似性的专家知识。
  • 在包含10,000道食物菜肴的新数据集上,SNaCK以高保真度捕捉了主观口味偏好,从而构建出超越此前最先进水平的深度学习食物分类器(在Food-101上表现更优)。
  • 在象形文字探索任务中,SNaCK自动将嵌入重新组织,按情绪对表情包进行分组,甚至将孤立的面部(如恐惧表情)移动至正确簇中,而无需在它们之间显式提供三元组约束。
  • 本研究首次在特定参数设置下证明了CKL与t-STE在二维情况下的等价性,这一联系此前在文献中未被承认。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。