Skip to main content
QUICK REVIEW

[论文解读] Keyframe Segmentation and Positional Encoding for Video-guided Machine Translation Challenge 2020

Tosho Hirasawa, Zhishen Yang|arXiv (Cornell University)|Jun 23, 2020
Multimodal Machine Learning Applications参考文献 10被引用 8
一句话总结

本论文提出了一种基于关键帧的视频引导机器翻译系统,通过将视频特征与位置编码相结合,以保持时间顺序,从而提升翻译质量。该系统采用分层注意力模型,结合模态特定注意力与特征融合,最终在VMT Challenge 2020中取得36.60的BLEU-4得分,位列所有提交结果的第一名。

ABSTRACT

Video-guided machine translation as one of multimodal neural machine translation tasks targeting on generating high-quality text translation by tangibly engaging both video and text. In this work, we presented our video-guided machine translation system in approaching the Video-guided Machine Translation Challenge 2020. This system employs keyframe-based video feature extractions along with the video feature positional encoding. In the evaluation phase, our system scored 36.60 corpus-level BLEU-4 and achieved the 1st place on the Video-guided Machine Translation Challenge 2020.

研究动机与目标

  • 通过利用视频中的视觉信息,提升视频引导机器翻译的性能。
  • 解决视频特征表示中缺乏时间顺序建模的问题。
  • 通过基于关键帧的特征提取与位置编码,提升翻译质量。
  • 评估不同类型的视频特征(动作、物体和场景特征)对翻译性能的影响。
  • 通过融合多种视频特征类型的模型,实现最先进性能。

提出的方法

  • 从视频中提取关键帧,并通过独立的ResNet-152(用于物体识别)和ResNet-50(用于场景识别)编码器进行处理。
  • 使用I3D模型从视频片段中提取动作特征,而外观特征(物体与场景)则从关键帧中提取。
  • 在视频表示中加入位置编码以保持时间顺序,采用基于位置和维度的正弦函数:$ PE_{(pos,2i)} = sin(pos/10000^{2i/d}) $,$ PE_{(pos,2i+1)} = cos(pos/10000^{2i/d}) $。
  • 采用分层注意力机制,分别为文本和视频模态计算独立的上下文向量,并通过模态注意力实现加权融合。
  • 解码器使用两层GRU,对文本和视频特征均应用注意力机制,最终的上下文向量通过模态特定上下文向量的加权和计算得出。
  • 将基于不同视频特征(动作、物体、场景)训练的多个模型进行模型融合,以提升鲁棒性与性能。

实验结果

研究问题

  • RQ1基于关键帧的视频特征提取是否能提升视频引导机器翻译中的翻译质量?
  • RQ2在视频表示中引入位置编码是否能通过保持时间顺序来提升翻译性能?
  • RQ3不同类型的视频特征(动作、物体、场景)对翻译质量的贡献如何?
  • RQ4融合基于多样化视频特征训练的模型是否能带来进一步的性能提升?
  • RQ5在VMT设置下,官方I3D特征与基于关键帧的特征相比,其相对影响如何?

主要发现

  • 该系统在公开测试集上取得了36.60的BLEU-4得分,在2020年视频引导机器翻译挑战赛中位列第一。
  • 添加位置编码使BLEU得分相比基线提升+0.18,而省略位置编码则导致BLEU轻微下降-0.08。
  • 使用物体特征与文本结合,使BLEU相比仅使用文本的基线提升0.19,相比官方I3D基线提升0.01。
  • 动作特征带来的提升最高,相比仅使用文本的基线提升0.32,相比I3D基线提升0.14。
  • 融合三个分别基于动作、物体和场景特征训练的模型,使性能相比最佳单特征模型提升0.96 BLEU。
  • 最终的集成模型结合了三种变体(动作、物体、场景),性能最高,被作为最终提交版本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。