Skip to main content
QUICK REVIEW

[论文解读] MTLE: A Multitask Learning Encoder of Visual Feature Representations for Video and Movie Description

Oliver Nina, Washington García|arXiv (Cornell University)|Sep 19, 2018
Multimodal Machine Learning Applications参考文献 34被引用 3
一句话总结

本文提出MTLE,一种多任务学习编码器-解码器框架,通过联合训练双向RNN编码器与多个解码器,并利用语义距离函数选择多样化的字幕对,从而提升视频和电影字幕生成性能。该方法在多个基准测试中达到最先进水平,并在LSMDC 2017挑战赛中获得人类评估者对视障人士实用性评分最高。

ABSTRACT

Learning visual feature representations for video analysis is a daunting task that requires a large amount of training samples and a proper generalization framework. Many of the current state of the art methods for video captioning and movie description rely on simple encoding mechanisms through recurrent neural networks to encode temporal visual information extracted from video data. In this paper, we introduce a novel multitask encoder-decoder framework for automatic semantic description and captioning of video sequences. In contrast to current approaches, our method relies on distinct decoders that train a visual encoder in a multitask fashion. Our system does not depend solely on multiple labels and allows for a lack of training data working even with datasets where only one single annotation is viable per video. Our method shows improved performance over current state of the art methods in several metrics on multi-caption and single-caption datasets. To the best of our knowledge, our method is the first method to use a multitask approach for encoding video features. Our method demonstrates its robustness on the Large Scale Movie Description Challenge (LSMDC) 2017 where our method won the movie description task and its results were ranked among other competitors as the most helpful for the visually impaired.

研究动机与目标

  • 解决在训练标注稀疏或有限的情况下,学习鲁棒视觉特征表示的挑战,以用于视频字幕生成。
  • 通过引入多任务学习框架,克服基于单解码器RNN的编码器在视频字幕生成中的偏差与泛化能力差的问题。
  • 通过基于距离的损失函数利用语义多样性,实现在每视频仅有一个字幕的数据集(如LSMDC)上的有效训练与性能提升。
  • 通过联合训练编码器与多个解码器,将字幕映射到共享语义空间,从而提升模型泛化能力。
  • 开发一种在自动指标与人类评估中均表现优异的框架,尤其适用于真实世界中的可访问性应用。

提出的方法

  • 使用CNN从每帧视频中提取视觉特征,随后通过双向RNN编码器生成单一视觉特征编码。
  • 在多任务学习设置下,联合训练编码器与多个解码器,其中每个解码器以编码器输出为条件,预测字幕。
  • 在训练过程中,应用语义距离函数(SDF)选择每段视频中语义距离最大的字幕对,以确保监督信号的多样性。
  • 提出一种新颖的多任务损失函数,结合来自多个字幕对的监督信号,即使在单字幕数据上也能实现正则化与泛化能力提升。
  • 在解码器中使用软注意力机制,动态关注生成字幕过程中相关的视觉特征。
  • 通过反向传播端到端优化编码器与解码器,所有解码器共享相同的编码器权重,以保持视觉表征学习的一致性。

实验结果

研究问题

  • RQ1当训练数据稀疏或每视频仅有一个字幕时,多任务学习框架是否能提升视频字幕中视觉特征编码器的泛化能力?
  • RQ2在训练过程中选择语义距离最大的字幕对是否能带来更优的视觉表征学习与更高的字幕质量?
  • RQ3MTLE框架在自动指标与人类评估方面,与最先进方法相比表现如何,特别是在可访问性应用方面?
  • RQ4在多个解码器分别基于多样化字幕对进行训练时,能否有效共享单一编码器而不导致性能下降?
  • RQ5多任务损失函数在多大程度上减少了对单个字幕的偏差,并提升了零样本或低资源场景下的鲁棒性?

主要发现

  • 在LSMDC 2017挑战赛中,MTLE在所有参赛方法中获得最高的人类评估得分(2.50/5.0),在视障人士实用性方面优于Fcrerank(2.18)与PostProp(2.17)等顶尖方法。
  • 在LSMDC 2017数据集上,MTLE的CIDEr得分为0.073,优于多个强基线方法,包括FuseNet(0.083)与Attn2l(0.073),BLEU得分为0.003,METEOR得分为0.052。
  • 该方法展现出卓越的鲁棒性,人类判断直方图中轻微与严重错误的比例最小,表明其字幕质量更可靠。
  • 定性结果表明,MTLE生成的字幕通常与人类水平表现相当或接近,部分案例甚至正确识别出真实字幕中未包含的属性(如性别)。
  • MTLE在多个数据集(包括MSVD、MSR-VTT、TRECVID与LSMDC)上均表现出强泛化能力,在多种指标上持续优于基线方法。
  • 该框架通过在损失函数中引入正则化项,成功处理了单字幕数据集,即使每视频仅有一个字幕,也能利用语义多样性实现有效训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。