[论文解读] Exploring Train and Test-Time Augmentations for Audio-Language Learning
本文提出 PairMix,一种新颖的音视频配对数据增强方法,通过结合波形级与梅尔频谱图级 Mixup 及文本拼接,提升音视频学习效果。此外,本文还引入 Multi-TTA,一种多层级测试时增强策略,通过聚合网络多个层级的预测结果,在音视频字幕任务中取得 47.5 的 SPIDEr 分数——相比基线模型相对提升 18.2%,在音视频字幕与检索任务中均实现显著性能提升。
In this paper, we aim to unveil the impact of data augmentation in audio-language multi-modal learning, which has not been explored despite its importance. We explore various augmentation methods at not only train-time but also test-time and find out that proper data augmentation can lead to substantial improvements. Specifically, applying our proposed audio-language paired augmentation PairMix, which is the first multi-modal audio-language augmentation method, outperforms the baselines for both automated audio captioning and audio-text retrieval tasks. To fully take advantage of data augmentation, we also present multi-level test-time augmentation (Multi-TTA) for the test-time. We successfully incorporate the two proposed methods and uni-modal augmentations and achieve 47.5 SPIDEr on audio captioning, which is an 18.2% relative increase over the baseline. In audio-text retrieval, the proposed methods also show an improvement in performance as well.
研究动机与目标
- 探究数据增强在音视频学习中的影响,尽管该领域潜力巨大但研究仍显不足。
- 针对现有音视频数据集规模有限(如 AudioCaps 仅约 40K 个样本)的问题,通过增强方法提升数据效率。
- 提出一种新颖的配对多模态增强方法 PairMix,确保训练过程中保留音视频间的关系。
- 探索并改进音视频模型中的测试时增强(TTA),该问题在以往研究中常被忽视。
- 开发一种通用且与模型架构无关的框架,提升音视频字幕与音视频文本检索任务的性能。
提出的方法
- PairMix 通过以概率方式在音频片段上应用波形级或梅尔频谱图级 Mixup,并拼接对应文本字幕,生成新的音视频配对样本。
- 该方法使用伯努利分布门控(γ)混合波形级与频谱图级 Mixup 的输出,确保增强样本的多样性。
- 文本增强通过选择输入配对的字幕进行拼接实现,保持语义连贯性。
- Multi-TTA 通过在多个中间层聚合预测结果,推广传统 TTA,提升鲁棒性与性能扩展性。
- 该框架采用多层级聚合策略,将不同层的预测结果取平均,且在测试时一致应用输入增强。
- 所有模型统一应用 SpecAugment,且超参数根据先前工作针对音视频字幕与检索任务进行调优。
实验结果
研究问题
- RQ1与单模态增强相比,配对音视频数据增强在音视频学习中的性能影响如何?
- RQ2像 PairMix 这类联合音视频增强方法是否能超越现有的仅音频或仅文本增强策略?
- RQ3测试时增强(TTA)是否能提升音视频任务性能?若能,如何优化以克服性能饱和问题?
- RQ4多层级 TTA(在多个网络层聚合预测)是否优于传统的单层 TTA?
- RQ5PairMix 与 Multi-TTA 在不进行架构修改或模型扩展的前提下,性能可提升至何种程度?
主要发现
- 使用单模态音频增强的 PairMix 在自动音视频字幕任务中达到 46.6 的 SPIDEr 分数,相比基线相对提升 15.9%,且在模型参数量仅为基线 5 倍的情况下超越此前最先进方法。
- 同时应用 PairMix 与 Multi-TTA 可实现 47.5 的 SPIDEr 分数,相比基线相对提升 18.2%,表明二者存在协同增益效应。
- 在音到文检索任务中,R@10 从 82.7% 提升至 87.2%;在文到音检索任务中,从 81.3% 提升至 83.2%。
- Multi-TTA 稳定优于传统 TTA,且在增强强度(τ)增加时仍能有效扩展性能,而单层 TTA 则出现性能饱和。
- 消融实验表明,PairMix 中在波形与梅尔频谱图两级采用概率 Mixup 的方式,优于固定层级或基于拼接的替代方案。
- PairMix 生成的字幕在捕捉重叠事件方面表现出更强鲁棒性,而基线模型与拼接式 PairMix 常常遗漏或错误表示此类事件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。