Skip to main content
QUICK REVIEW

[论文解读] A Whisper transformer for audio captioning trained with synthetic captions and transfer learning

Marek Kadlčík, Adam Hájek|arXiv (Cornell University)|May 15, 2023
Music and Audio Processing被引用 6
一句话总结

该论文提出了一种微调后的Whisper变换器用于音频字幕生成,利用AudioSet生成的合成字幕以及预训练语音转文本模型的迁移学习。通过在合成AudioSet字幕、AudioCaps和Clotho的混合数据上进行预训练,并在Clotho上使用层冻结进行微调,该方法在性能上达到当前最先进水平,最大模型(whisper-large-v2)在Clotho开发评估集上取得了0.2794的SPIDEr分数。

ABSTRACT

The field of audio captioning has seen significant advancements in recent years, driven by the availability of large-scale audio datasets and advancements in deep learning techniques. In this technical report, we present our approach to audio captioning, focusing on the use of a pretrained speech-to-text Whisper model and pretraining on synthetic captions. We discuss our training procedures and present our experiments' results, which include model size variations, dataset mixtures, and other hyperparameters. Our findings demonstrate the impact of different training strategies on the performance of the audio captioning model. Our code and trained models are publicly available on GitHub and Hugging Face Hub.

研究动机与目标

  • 通过从预训练的语音转文本模型迁移学习来提升音频字幕生成性能。
  • 探究基于AudioSet标签生成的合成字幕在预训练音频字幕模型中的有效性。
  • 评估模型规模、数据混合比例和正则化策略对字幕生成性能的影响。
  • 探索数据规模扩展和更强监督信号,以期在未来提升音频字幕性能。

提出的方法

  • 在音频字幕任务上微调预训练的Whisper编码器-解码器变换器,使用来自AudioSet的合成字幕以及AudioCaps和Clotho的人工标注字幕。
  • 通过遍历AudioSet的分层本体论,将标签映射为带父类前缀的自然语言描述,生成合成字幕。
  • 将音频预处理为16 kHz,并使用原始Whisper超参数的WhisperFeatureExtractor转换为对数梅尔频谱图。
  • 采用双前缀策略:标准Whisper前缀用于指定任务和语言,以及一个自定义前缀以指示数据集和字幕任务类型(字幕 vs 关键词)。
  • 在所有模型规模下,采用5个束宽的束搜索解码作为最优解码策略。
  • 在微调过程中应用层冻结,具体为冻结所有前馈层(fc1),以防止在较小的Clotho数据集上过拟合。

实验结果

研究问题

  • RQ1与仅微调相比,在AudioSet的合成字幕上进行预训练对音频字幕性能有何影响?
  • RQ2在预训练期间,合成(AudioSet)与人工标注(AudioCaps、Clotho)数据的最佳混合比例是多少?
  • RQ3模型规模如何影响音频字幕任务的性能?
  • RQ4在Clotho数据集上,哪种正则化策略——权重衰减、dropout或层冻结——能实现最佳泛化效果?
  • RQ5当用于生成合成字幕时,来自AudioSet Strong等数据集的时序强监督信号是否能进一步提升字幕质量?

主要发现

  • 最大模型whisper-large-v2在Clotho开发评估集上取得了最高性能,SPIDEr得分为0.2794。
  • 在合成AudioSet字幕、AudioCaps和Clotho(12:3:1)的混合数据上进行预训练,显著优于仅微调的设置。
  • 5束宽的束搜索在所有模型规模下均优于贪婪解码和更高束宽策略,SPIDEr得分最高。
  • 在微调过程中采用层冻结比权重衰减或dropout更能有效防止在较小的Clotho数据集上过拟合。
  • 在预训练期间对大型合成数据集(AudioSet子集)给予更高权重,有助于缓解过拟合并提升泛化能力。
  • 该模型在Clotho开发评估集上取得了SacreBLEU得分16.50和CIDEr得分0.4331,表明在多个指标上均表现优异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。