Skip to main content
QUICK REVIEW

[论文解读] A Data Augmentation Approach for Sign-Language-To-Text Translation In-The-Wild

Xiujun Li, Xi Yin|arXiv (Cornell University)|Apr 13, 2020
Multimodal Machine Learning Applications参考文献 48被引用 134
一句话总结

本文提出Oscar,一种视觉-语言预训练方法,通过在图像中检测到的物体标签作为语义锚点,以提升跨模态对齐效果。通过在统一的Transformer框架中整合物体标签、区域特征与文本嵌入,Oscar在六个视觉-语言任务上实现最先进性能,在VQA、图像字幕生成和NLVR2等基准测试中显著超越先前方法。

ABSTRACT

In this paper, we describe the current main approaches to sign language translation which use deep neural networks with videos as input and text as output. We highlight that, under our point of view, their main weakness is the lack of generalization in daily life contexts. Our goal is to build a state-of-the-art system for the automatic interpretation of sign language in unpredictable video framing conditions. Our main contribution is the shift from image features to landmark positions in order to diminish the size of the input data and facilitate the combination of data augmentation techniques for landmarks. We describe the set of hypotheses to build such a system and the list of experiments that will lead us to their verification.

研究动机与目标

  • 解决视觉-语言预训练中弱监督跨模态对齐的挑战,即图像区域与文本词元缺乏显式对齐监督。
  • 利用现代目标检测器的高精度,识别显著且语义有意义的物体作为对齐的锚点。
  • 通过物体标签提供显式、有监督的对齐信号,提升图像-文本语义对齐的学习效率与效果。
  • 通过改进的预训练策略,在多样化视觉-语言理解与生成任务上实现最先进性能。
  • 通过分析物体标签在表征学习中的作用,证明其作为对齐锚点比直接作为视觉特征更有效。

提出的方法

  • 将每个图像-文本对表示为三元组:词元、物体标签(通过目标检测器生成)和图像区域特征。
  • 对文本和物体标签均使用预训练词嵌入,并通过词典查找将其对齐至共享语义空间。
  • 采用两种预训练目标:对词元和标签进行掩码词元预测,以及对物体标签与其对应图像区域之间的对比损失。
  • 将物体标签作为锚点,引导Transformer编码器中的自注意力机制,提升视觉区域与语言单元之间的对齐效果。
  • 利用语言语义空间(如BERT嵌入)增强物体标签的表征质量,使其比原始区域特征更具判别性。
  • 在下游任务(包括VQA、图像字幕生成和图文检索)上使用标准微调协议,对预训练的Oscar模型进行微调。

实验结果

研究问题

  • RQ1图像中检测到的物体标签能否作为有效锚点,以提升视觉-语言预训练中的跨模态对齐?
  • RQ2与仅依赖原始区域特征和词元的自注意力机制相比,使用物体标签作为语义锚点有何优势?
  • RQ3使用物体标签进行预训练是否能提升视觉-语言理解与生成任务的性能?
  • RQ4不同物体标签来源(如Visual Genome与Open Images)对下游性能有何影响?
  • RQ5物体标签能否提升零样本或少样本设置下的泛化能力,例如新物体字幕生成?

主要发现

  • Oscar在六个成熟的视觉-语言基准上取得新的最先进结果,包括VQA、图像字幕生成和NLVR2。
  • 在VQA开发集上,Oscar将准确率提升至71.70,相较无物体标签的基线模型(70.93)相对提升1.1%。
  • 在图像字幕生成任务中,Oscar的BLEU-4得分为36.4,ROUGE-L为30.3,CIDEr得分为123.4,分别优于基线模型1.9、1.2和7.8分。
  • 即使使用相同的区域特征,使用物体标签作为锚点也显著优于不使用它们的基线模型。
  • 使用Visual Genome(VG)物体标签预训练的模型优于使用Open Images(OI)标签的模型,可能归因于VG数据集中物体种类更多样。
  • 消融实验表明,物体标签作为对齐锚点时效果最佳,而非直接作为视觉特征使用,因其能提升对齐效果而不增加特征冗余。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。