Skip to main content
QUICK REVIEW

[论文解读] Grounding Object Detections With Transcriptions

Yasufumi Moriya, Ramon Sanabria|arXiv (Cornell University)|Jun 13, 2019
Multimodal Machine Learning Applications参考文献 32被引用 5
一句话总结

本论文提出一种方法,通过将教学视频中的语音转录文本与视频帧对齐,自动生成目标检测和视觉定位标注,利用时间对齐的转录文本识别实体。该方法在How2和Flickr30k数据集上取得了具有竞争力的性能,表明基于自动生成标签的弱监督模型无需人工标注的边界框或标签,也能学习到有意义的视觉-语言关系。

ABSTRACT

A vast amount of audio-visual data is available on the Internet thanks to video streaming services, to which users upload their content. However, there are difficulties in exploiting available data for supervised statistical models due to the lack of labels. Unfortunately, generating labels for such amount of data through human annotation can be expensive, time-consuming and prone to annotation errors. In this paper, we propose a method to automatically extract entity-video frame pairs from a collection of instruction videos by using speech transcriptions and videos. We conduct experiments on image recognition and visual grounding tasks on the automatically constructed entity-video frame dataset of How2. The models will be evaluated on new manually annotated portion of How2 dev5 and val set and on the Flickr30k dataset. This work constitutes a first step towards meta-algorithms capable of automatically construct task-specific training sets.

研究动机与目标

  • 解决真实世界视频应用中监督学习面临标注视觉数据有限的挑战。
  • 通过从语音转录文本自动生成视频帧-目标对,减少对昂贵且易出错的人工标注的依赖。
  • 探究语音转录文本是否能在非脚本化、教学类视频中有效定位到视觉实体。
  • 评估在自动构建的数据集上训练的目标识别与视觉定位模型的性能。
  • 为元算法奠定基础,使其能从原始音视频数据自动构建特定任务的训练集。

提出的方法

  • 利用时间对齐的自动语音识别(ASR)转录文本,识别教学视频中的名词实体及其对应时间戳。
  • 在每个名词出现的时间点提取视频帧,并将其与对应实体配对,用于构建训练数据。
  • 使用VGG-16网络进行目标识别,基于自动生成的数据集进行微调,采用一对一(softmax)和一对多(sigmoid)两种训练策略。
  • 采用多实例学习(MIL)和基于重构的方法进行弱监督视觉定位,使用区域提议和ResNet-152的特征嵌入。
  • 使用交叉熵损失进行分类,使用排序损失进行定位,特征表示来自深度神经网络。
  • 在How2开发集/验证集的人工标注部分以及Flickr30k数据集上评估模型,以评估泛化能力和性能。

实验结果

研究问题

  • RQ1能否在无需人工标注的情况下,可靠地利用语音转录文本生成准确的目标检测与视觉定位标注?
  • RQ2在基于音视频数据自动生成标签的弱监督模型,在目标识别与定位任务中的有效性如何?
  • RQ3在弱标签数据上,采用Sigmoid激活函数的一对多训练策略是否优于使用Softmax的一对一训练策略?
  • RQ4在自动生成标签上训练时,多实例学习(MIL)方法是否优于基于重构的方法?
  • RQ5在自动构建的数据集上训练的模型,其泛化能力在其他基准(如Flickr30k)上的表现如何?

主要发现

  • 在How2数据集上,采用Sigmoid激活函数和二元交叉熵损失的一对多训练策略在验证集上达到9.54的MAP@20,优于一对一方法,表现出更高的平均精度(MAP)。
  • 在Flickr30k数据集上,多标签系统在验证集上达到44.34的MAP@20,显著优于单标签系统,表明在多目标图像上具有更好的泛化能力。
  • 基于MIL的视觉定位模型在How2 dev5集上达到最高的IoU@0.5分数(9.3%),优于随机基线(7.6%)和重构方法(7.9%),表明弱监督下实现了有效的定位。
  • 在Flickr30k上,MIL模型在测试集上达到19.6%的IoU@0.5分数,持续优于基线,验证了该方法在其他数据集上的可迁移性。
  • 在How2和Flickr30k上的上限IoU分数表明,当前模型与最优性能之间的差距仍然显著,提示视觉定位算法仍有较大改进空间。
  • 尽管使用了非最先进方法,基于自动生成标签训练的模型仍取得了有意义的性能,证明了从‘真实世界’视频中自动构建数据的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。