Skip to main content
QUICK REVIEW

[论文解读] Talk, Don't Write: A Study of Direct Speech-Based Image Retrieval

Ramon Sanabria, Austin Waters|arXiv (Cornell University)|Apr 5, 2021
Multimodal Machine Learning Applications参考文献 36被引用 6
一句话总结

该论文提出了一种基于直接语音的图像检索方法,采用双编码器架构与自监督语音表征,其在Flickr Audio(R@1提升11.4%)和Places Audio(R@1提升25.8%)上实现了最先进性能。结果表明,端到端语音编码优于基于ASR的文本编码,尤其在带有口音或即兴口语场景中,通过消除转录错误并利用合成语音数据的强预训练,显著提升了性能。

ABSTRACT

Speech-based image retrieval has been studied as a proxy for joint representation learning, usually without emphasis on retrieval itself. As such, it is unclear how well speech-based retrieval can work in practice -- both in an absolute sense and versus alternative strategies that combine automatic speech recognition (ASR) with strong text encoders. In this work, we extensively study and expand choices of encoder architectures, training methodology (including unimodal and multimodal pretraining), and other factors. Our experiments cover different types of speech in three datasets: Flickr Audio, Places Audio, and Localized Narratives. Our best model configuration achieves large gains over state of the art, e.g., pushing recall-at-one from 21.8% to 33.2% for Flickr Audio and 27.6% to 53.4% for Places Audio. We also show our best speech-based models can match or exceed cascaded ASR-to-text encoding when speech is spontaneous, accented, or otherwise hard to automatically transcribe.

研究动机与目标

  • 评估直接语音驱动的图像检索相较于基于ASR的文本检索策略的实际有效性。
  • 探究不同语音与图像编码器架构、预训练方法及语音表征对检索性能的影响。
  • 确定端到端语音编码是否能超越级联的ASR + 文本编码,特别是在低资源或噪声语音场景中。
  • 为Localized Narratives数据集建立语音-图像检索的强基线,该数据集此前无相关结果。
  • 开源模型(Milan)以支持可复现性与多模态表征学习中的再利用。

提出的方法

  • 采用双编码器架构,为语音与图像模态分别使用独立可训练的编码器,将每种模态嵌入为固定长度向量。
  • 将自监督语音表征(如CPC-8k、wav2vec)作为语音编码器的输入,避免依赖ASR转录结果。
  • 在合成语音描述(Conceptual Spoken Captions)上进行多模态预训练,以对齐语音与图像表征,随后在真实数据集上进行微调。
  • 分别在ImageNet和Conceptual Captions上对图像塔与文本塔进行强预训练,以提升泛化能力。
  • 使用对比学习训练模型,采用对比损失函数,使正样本对(图像-语音)更接近,负样本对更远离。
  • 通过标准检索指标(特别是R@1)评估性能,涵盖具有不同语音特征的三个数据集。

实验结果

研究问题

  • RQ1在语音质量差或带有口音的语音场景中,直接语音编码是否能优于级联的ASR + 文本编码?
  • RQ2不同语音表征方法(如MFCC、wav2vec、CPC)在多样化语音领域中对检索性能有何影响?
  • RQ3在真实数据集(如印度英语)上微调时,使用合成语音(如美式英语TTS)预训练是否会导致性能下降?
  • RQ4模型容量、批量大小及预训练策略对不同规模与语音质量数据集的检索性能有何影响?
  • RQ5统一的端到端语音编码器是否能在此前未报告结果的基准(如Localized Narratives)上实现最先进性能?

主要发现

  • 最佳模型配置在Flickr Audio上达到33.2%的R@1,较之前最先进方法(21.8%)提升11.4个百分点。
  • 在Places Audio上,模型达到53.4%的R@1,较之前SOTA(27.6%)提升25.8个百分点。
  • 对于Localized Narratives数据集,该模型首次报告了语音到图像检索结果,R@1分别为53.4%(Places Audio)和33.2%(Flickr Audio)。
  • 在LocNarr(印度英语,ASR质量较低)上,直接语音编码优于ASR+文本编码,表明其对口音与不流畅口语具有更强鲁棒性。
  • 在PlacesAudio(美式英语,ASR质量高)上,模型性能与ASR基线相当,但在LocNarr上表现更优,说明在ASR质量较低时更具优势。
  • 在合成美式英语语音上预训练后,模型在印度英语语音(LocNarr)上性能下降,凸显了合成数据中的领域偏移问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。