Skip to main content
QUICK REVIEW

[论文解读] Fast-Slow Transformer for Visually Grounding Speech

Puyuan Peng, David Harwath|arXiv (Cornell University)|Sep 16, 2021
Speech and Audio Processing被引用 7
一句话总结

FaST-VGS 是一种基于 Transformer 的新型视觉对齐语音检索模型,将双编码器与交叉注意力架构统一于单一框架中,支持快速粗粒度检索与高精度细粒度检索。该模型在 FACC、SpokenCOCO 和 Places Audio 基准测试中均达到最先进性能,并在 ZeroSpeech 2021 挑战赛的语音与语义任务中展现出强大的零样本迁移能力。

ABSTRACT

We present Fast-Slow Transformer for Visually Grounding Speech, or FaST-VGS. FaST-VGS is a Transformer-based model for learning the associations between raw speech waveforms and visual images. The model unifies dual-encoder and cross-attention architectures into a single model, reaping the superior retrieval speed of the former along with the accuracy of the latter. FaST-VGS achieves state-of-the-art speech-image retrieval accuracy on benchmark datasets, and its learned representations exhibit strong performance on the ZeroSpeech 2021 phonetic and semantic tasks.

研究动机与目标

  • 开发一种基于视觉对齐的统一、高效且准确的语音-图像检索模型。
  • 弥合语音-图像与文本-图像检索系统之间的性能差距。
  • 探究从视觉监督中学习的自监督语音表征所编码的语言信息。
  • 通过端到端的粗粒度到细粒度推理,实现单一架构下的快速与高精度检索。

提出的方法

  • 模型采用双分支架构,基于卷积层和 Transformer 构建独立的音频与图像编码器。
  • 音频特征通过两阶段 Transformer 堆叠处理:高分辨率特征被下采样并重新编码,以实现语义抽象。
  • 使用 CLS 标记表示整个音频和图像序列,通过点积运算实现粗粒度相似性计算。
  • 细粒度相似性通过跨模态 Transformer 计算,该模块联合关注两种模态。
  • 粗粒度与细粒度相似性分数源自共享表征,支持统一的训练与推理。
  • 采用粗粒度到细粒度(CTF)训练策略,联合优化两种检索模式。
Fig. 1 : Architecture of the FaST-VGS model.
Fig. 1 : Architecture of the FaST-VGS model.

实验结果

研究问题

  • RQ1统一的 Transformer 模型能否同时实现快速与高精度的语音-图像检索?
  • RQ2从视觉对齐中学习的自监督语音表征在多大程度上捕捉了语音与语义结构?
  • RQ3该模型是否在基准语音-图像检索数据集上优于先前方法?
  • RQ4该模型能否在语音与语义任务的零样本评估中实现良好泛化?

主要发现

  • 在 SpokenCOCO 数据集上微调后,FaST-VGS 在 R@10 上达到 83.7% 的最先进性能;在 FACC 数据集上微调后,R@10 达到 89.5%。
  • 在 FACC 数据集上,尽管使用数据更少,FaST-VGS 在从 SpokenCOCO 训练并在 FACC 上微调后,仍优于先前最先进方法 MILAN。
  • 在 ZeroSpeech 2021 语义任务中,FaST-VGS 在 Librispeech 上取得 23.55 的得分,显著优于基线模型(15.09)。
  • 在 ABX 语音任务中,FaST-VGS 在全部四项评估中均优于高资源 VG 基线模型,尽管略逊于最佳非-VG 模型。
  • 在 FACC 数据集上,FaST-VGS 实现 79.9% 的 R@10 图像到语音检索性能,在 SpokenCOCO 上达到 87.0%,展现出强大的跨注意力性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。