Skip to main content
QUICK REVIEW

[论文解读] Learning visual biases from human imagination

Carl Vondrick, Hamed Pirsiavash|arXiv (Cornell University)|Oct 17, 2014
Advanced Image and Video Retrieval Techniques参考文献 36被引用 14
一句话总结

本文提出了一种新颖方法,通过在深度特征空间中生成随机噪声,并利用众包方式识别人类感知到的特定物体(如汽车)的噪声模式,从而从人类视觉系统中学习视觉偏差。由此生成的人类衍生模板随后被用作SVM中的方向先验,显著提升了物体识别性能,尤其在低数据量设置和跨领域分布变化下表现突出,证明了人类感知偏差可增强机器学习的泛化能力。

ABSTRACT

Although the human visual system can recognize many concepts under challengingconditions, it still has some biases. In this paper, we investigate whether wecan extract these biases and transfer them into a machine recognition system.We introduce a novel method that, inspired by well-known tools in humanpsychophysics, estimates the biases that the human visual system might use forrecognition, but in computer vision feature spaces. Our experiments aresurprising, and suggest that classifiers from the human visual system can betransferred into a machine with some success. Since these classifiers seem tocapture favorable biases in the human visual system, we further present an SVMformulation that constrains the orientation of the SVM hyperplane to agree withthe bias from human visual system. Our results suggest that transferring thishuman bias into machines may help object recognition systems generalize acrossdatasets and perform better when very little training data is available.

研究动机与目标

  • 本文旨在探究人类视觉系统中固有的偏差是否可以被提取并转移到机器视觉系统中。
  • 解决在低数据量或领域分布变化条件下物体识别泛化能力差的问题。
  • 开发一种方法,用于在深度特征空间中学习人类感知偏差,并将其整合到学习算法中。
  • 通过利用类人归纳偏差而非数据集特定偏差,提升跨数据集泛化能力。

提出的方法

  • 该方法使用从标准正态分布中采样的随机噪声作为输入,模拟深度特征空间(如CNN或HOG)中的视觉特征。
  • 通过Amazon Mechanical Turk众包平台,工作人员对数千个此类噪声样本进行分类,判断其是否为'汽车'或'非汽车',并计算'汽车'类响应的平均值,形成人类想象的模板。
  • 所得模板被解释为一个偏差向量,表示人类如何将中层视觉特征与物体类别关联。
  • 该偏差向量随后被用作改进SVM公式中的方向先验,以约束决策超平面与人类偏差方向对齐。
  • SVM通过在权重向量方向上施加圆锥约束进行训练,其角度θ(设为30°)定义了约束,确保分类器与人类偏差对齐,同时不约束其大小。
  • 该方法在PASCAL VOC 2011和Caltech-101数据集上使用CNN特征进行评估,比较了加入与不加入人类偏差先验的性能表现。

实验结果

研究问题

  • RQ1能否可靠地估计并转移由人类在噪声中想象物体所获得的人类视觉偏差至机器学习系统?
  • RQ2在训练数据稀缺时,这些人类衍生的偏差能在多大程度上提升物体识别性能?
  • RQ3在数据集间存在冲突偏差的情况下,整合人类感知偏差是否能增强跨数据集泛化能力?
  • RQ4与标准SVM或仅使用人类偏差相比,方向约束SVM公式在性能上提升了多少?

主要发现

  • 仅使用人类想象的模板(无任何训练数据),该方法在汽车分类任务上达到了27.5%的平均精度(AP),显著优于随机猜测水平(7.3%)。
  • 当仅有一个正样本可用时,加入人类偏差先验的SVM在汽车分类任务上达到37.8%的AP,较标准SVM(27.5%)提升了10.3%,较仅使用人类偏差本身提升了30.5%。
  • 在跨数据集评估中,将SVM约束于人类偏差方向,使从Caltech-101到PASCAL VOC 2011的泛化性能在低数据量设置下提升了超过5%的AP。
  • 即使在PASCAL VOC 2011数据集上进行训练、在Caltech-101上进行测试时,该方法仍提升了PASCAL VOC 2011的性能,表明其对数据集偏差具有鲁棒性。
  • 方向约束SVM公式在低维和高维特征空间中均有效,且在高维空间中约束更为严格。
  • 结果表明,通过在噪声中想象获得的人类视觉偏差,可作为强有力的归纳先验,显著提升计算机视觉中的泛化能力和数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。