Skip to main content
QUICK REVIEW

[论文解读] TVLT: Textless Vision-Language Transformer

Zineng Tang, Jaemin Cho|arXiv (Cornell University)|Sep 28, 2022
Multimodal Machine Learning Applications被引用 16
一句话总结

TVLT 提出了一种无需文本的视觉-语言变换器,通过统一的变换器架构,直接从原始视频帧和音频频谱图中学习视觉-语言表征,无需依赖文本特异性模块(如分词或自动语音识别)。该方法在多模态任务上的性能与基于文本的模型相当,同时将参数量减少至1/3,并将推理速度提升28倍。

ABSTRACT

In this work, we present the Textless Vision-Language Transformer (TVLT), where homogeneous transformer blocks take raw visual and audio inputs for vision-and-language representation learning with minimal modality-specific design, and do not use text-specific modules such as tokenization or automatic speech recognition (ASR). TVLT is trained by reconstructing masked patches of continuous video frames and audio spectrograms (masked autoencoding) and contrastive modeling to align video and audio. TVLT attains performance comparable to its text-based counterpart on various multimodal tasks, such as visual question answering, image retrieval, video retrieval, and multimodal sentiment analysis, with 28x faster inference speed and only 1/3 of the parameters. Our findings suggest the possibility of learning compact and efficient visual-linguistic representations from low-level visual and audio signals without assuming the prior existence of text. Our code and checkpoints are available at: https://github.com/zinengtang/TVLT

研究动机与目标

  • 开发一种从原始视觉和音频信号学习的视觉-语言模型,无需假设书面语言已存在。
  • 在视觉-语言表征学习中消除文本特异性组件(如自动语音识别(ASR)和分词)。
  • 通过使用统一的、模态无关的变换器架构,提升计算效率并增强模型紧凑性。
  • 探究是否能直接从低层次感知信号(如视频和音频)中学习到有效的视觉-语言表征。
  • 在无文本监督的情况下,评估模型在多模态任务(如视觉问答、检索和情感分析)上的性能。

提出的方法

  • TVLT 使用统一的变换器编码器和解码器,直接处理原始视频帧和音频频谱图,不引入模态特异性设计。
  • 通过掩码自编码(MAE)在视觉和音频补丁上进行预训练,重建连续视频帧和频谱图中的掩码区域。
  • 在预训练过程中应用对比学习,对齐视频和音频表征,增强跨模态理解能力。
  • 利用学习到的语音检测头,选择性地对检测到的语音段进行音频掩码,以最小的计算开销提升性能。
  • 使用联合编码器将视觉和音频输入在共享的变换器空间中处理,实现跨模态特征学习。
  • 为视频和音频重建使用参数共享的独立解码器,其在准确率和效率上均优于联合解码器。

实验结果

研究问题

  • RQ1统一的、模态无关的变换器能否在无文本监督的情况下,直接从原始视频和音频中学习到有效的视觉-语言表征?
  • RQ2移除 ASR 和分词等文本特异性组件是否能减少计算冗余并提升推理速度,同时不损失性能?
  • RQ3无文本模型在下游多模态任务(如 VQA 和检索)上的性能与基于文本的模型相比如何?
  • RQ4不同的音频掩码策略和预训练目标对下游任务准确率有何影响?
  • RQ5该模型能否有效捕捉非语言性声学线索,特别是在情感分类任务中?

主要发现

  • TVLT 在视频检索(MSR-VTT 上 R@1: 22.3)和 VQA(VQAv2 上准确率 58.6%)任务上达到具有竞争力的性能,与最先进基于文本的模型相当。
  • 模型参数量减少至其基于文本的对应模型的 1/3,同时在相同硬件配置下实现 28 倍的推理加速。
  • 对检测到的语音段进行音频掩码可提升所有基准测试的性能,在 MSR-VTT 上达到 22.3 的 R@1,在 VQAv2 上准确率达 58.6%。
  • 联合编码器优于模态特异性编码器,在 MSR-VTT 上达到 10.2 的 R@1,在 VQAv2 上准确率达 54.6%,证明了有效的跨模态表征学习。
  • 使用参数共享的独立解码器在性能(22.3 R@1,58.6% 准确率)上优于联合解码器,表明其在多模态重建优化方面更优。
  • 掩码自编码(MAE)与语音感知掩码(VAM)预训练目标的结合,实现了最佳的下游性能,优于单独使用任一目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。