Skip to main content
QUICK REVIEW

[论文解读] Learning to Learn from Noisy Web Videos

Serena Yeung, Vignesh Ramanathan|arXiv (Cornell University)|Jun 9, 2017
Human Pose and Action Recognition参考文献 27被引用 8
一句话总结

本文提出了一种强化学习框架,用于从噪声较大的网络视频中学习数据标注策略,利用分类器得分分布作为状态表示,以平衡多样性与语义漂移。在Sports-1M基准测试中,该方法相较于贪婪和启发式基线模型提升了2.2%的mAP,无需人工调校规则即可学习到动作上下文和子类别变化等特定领域知识。

ABSTRACT

Understanding the simultaneously very diverse and intricately fine-grained set of possible human actions is a critical open problem in computer vision. Manually labeling training videos is feasible for some action classes but doesn't scale to the full long-tailed distribution of actions. A promising way to address this is to leverage noisy data from web queries to learn new actions, using semi-supervised or "webly-supervised" approaches. However, these methods typically do not learn domain-specific knowledge, or rely on iterative hand-tuned data labeling policies. In this work, we instead propose a reinforcement learning-based formulation for selecting the right examples for training a classifier from noisy web search results. Our method uses Q-learning to learn a data labeling policy on a small labeled training dataset, and then uses this to automatically label noisy web data for new visual concepts. Experiments on the challenging Sports-1M action recognition benchmark as well as on additional fine-grained and newly emerging action classes demonstrate that our method is able to learn good labeling policies for noisy data and use this to learn accurate visual concept classifiers.

研究动机与目标

  • 为解决在长尾、细粒度或罕见动作类别中手动标注不可行的问题,实现动作识别的可扩展性。
  • 克服现有弱监督学习方法依赖人工调校数据标注策略的局限,并避免其无法学习特定领域知识的问题。
  • 开发一个统一框架,从噪声较大的网络搜索结果中联合学习数据选择策略与视觉分类器。
  • 实现使用极少标注数据和噪声网络查询的鲁棒、可扩展的新视觉概念学习。

提出的方法

  • 该方法使用Q-learning训练一个策略,基于分类器得分分布从网络搜索结果中选择正样本。
  • 采用联合训练机制,在更新分类器与Q-learning智能体之间交替进行,奖励由在保留验证集上的下游分类器准确率决定。
  • 状态表示定义为候选视频中分类器得分的分布,使智能体能够评估不确定性和多样性。
  • 该策略首先在少量人工标注类别上进行训练,然后在推理阶段迁移到新的、未见过的类别。
  • 该框架将数据收集与模型训练整合为单一端到端流程,避免了分离的迭代优化过程。
  • 基于得分分布的新型状态表示使智能体能够检测并避免语义漂移,同时促进多样且高质量的正样本选择。

实验结果

研究问题

  • RQ1强化学习智能体能否学习到一种数据标注策略,有效平衡噪声网络视频数据中的样本多样性与语义漂移?
  • RQ2此类策略是否能在无需人工重新调校的情况下泛化到新的、未见过的动作类别?
  • RQ3学习特定领域知识(如区分人体运动线索与外观线索)是否能提升对长尾动作的分类器性能?
  • RQ4在低数据设置下,该方法与启发式或贪婪基线相比,在准确率和鲁棒性方面表现如何?

主要发现

  • 在Sports-1M基准测试中,该方法在100个正样本的预算下,相较于贪婪和启发式基线模型,mAP提升了2.2%。
  • 在'自拍'类别上,该方法实现了更高的查询召回率(9/16 vs. 6/16)和视频召回率(90% vs. 75%),表明其在多样性与噪声规避方面表现更优。
  • 在'奥运体操'类别中,该方法选中了18个真实正样本中的10个(而贪婪基线仅选中7个),展示了对如杂技动作和呼啦圈动作等子类别的更好覆盖能力。
  • 该策略成功避免了语义漂移,例如未将视频游戏片段误选为'bobsleigh',也未选择过于相似的自拍照,而贪婪基线则存在此类问题。
  • 在MNIST上,该方法在受控环境中验证了核心强化学习公式的可行性,为后续扩展到视频任务奠定了基础。
  • 该模型在无需显式规则工程的情况下,学习到了特定领域知识,例如在与动物相关的动作中优先关注运动线索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。