[论文解读] Investigating Local and Global Information for Automated Audio Captioning with Transfer Learning
本论文提出了一种用于自动音频字幕(AAC)的迁移学习框架,利用音频标记(AT)捕捉局部声音事件,利用声音场景分类(ASC)建模全局音频上下文。通过在AT(尤其是不平衡数据)上预训练基于CNN的音频编码器,该方法在Clotho和Audiocaps数据集的所有八个指标上均达到最先进性能,表明局部信息和抽象嵌入比全局上下文或时序建模更为关键。
Automated audio captioning (AAC) aims at generating summarizing descriptions for audio clips. Multitudinous concepts are described in an audio caption, ranging from local information such as sound events to global information like acoustic scenery. Currently, the mainstream paradigm for AAC is the end-to-end encoder-decoder architecture, expecting the encoder to learn all levels of concepts embedded in the audio automatically. This paper first proposes a topic model for audio descriptions, comprehensively analyzing the hierarchical audio topics that are commonly covered. We then explore a transfer learning scheme to access local and global information. Two source tasks are identified to respectively represent local and global information, being Audio Tagging (AT) and Acoustic Scene Classification (ASC). Experiments are conducted on the AAC benchmark dataset Clotho and Audiocaps, amounting to a vast increase in all eight metrics with topic transfer learning. Further, it is discovered that local information and abstract representation learning are more crucial to AAC than global information and temporal relationship learning.
研究动机与目标
- 探究音频字幕中常见的音频主题层次结构,区分局部(声音事件)与全局(声音场景、抽象知识)信息。
- 解决端到端AAC训练中的挑战,即编码器需在无显式监督的情况下学习多样化的听觉概念。
- 评估在源任务上进行预训练(AT用于局部信息,ASC用于全局信息)是否能提升下游AAC性能。
- 确定哪种预训练类型(局部vs.全局)以及哪种编码器架构(CNN vs. CRNN)对字幕质量的提升最为显著。
提出的方法
- 提出一种分层音频主题模型,将音频描述分类为局部主题(含实体、动词、物理属性的声音事件)和全局主题(场景位置、抽象推断、情感表达)。
- 通过在两个源任务上预训练共享音频编码器来应用迁移学习:使用音频标记(AT)捕捉局部声音事件,使用声音场景分类(ASC)建模全局声学环境。
- 使用预训练的AT或ASC模型参数初始化编码器主干网络,评估CNN10与CRNN5架构在提取抽象嵌入或时序动态方面的性能。
- 使用标准编码器-解码器架构(注意力GRU解码器)对预训练编码器进行端到端微调,以完成目标AAC任务。
- 在大规模数据集(不平衡与平衡的AT/ASC数据)上进行预训练,基于验证性能采用早停策略。
- 评估采用标准指标(BLEU@1-4、ROUGE、METEOR、CIDEr、SPICE),在Clotho和Audiocaps基准上使用束搜索(束大小=3)。
实验结果
研究问题
- RQ1局部与全局音频主题(如声音事件与声音场景)如何影响音频字幕的质量?
- RQ2在音频标记(AT)上进行预训练(用于局部信息)或在声音场景分类(ASC)上进行预训练(用于全局信息)是否能带来更好的自动音频字幕性能?
- RQ3当微调用于AAC时,CNN10(抽象嵌入)与CRNN5(时序建模)哪种编码器架构表现更优?
- RQ4预训练数据的规模与平衡性(如不平衡vs.平衡AT)在多大程度上影响下游字幕生成性能?
- RQ5在AAC中,抽象表征学习是否比建模声音事件之间的时序关系更为重要?
主要发现
- 在音频标记(AT)上进行预训练,尤其是使用不平衡数据,始终优于其他所有方法,在Clotho和Audiocaps的所有八个评估指标上均达到最先进性能。
- 采用AT预训练的CNN10架构表现最佳,表明抽象嵌入学习比时序建模对AAC更具优势。
- 局部信息(AT)比全局信息(ASC)更为关键,因为AT预训练在性能上始终优于ASC预训练,即使两者数据集规模相近(约60小时)。
- CRNN5在从零开始训练时优于CNN10,但在微调用于AAC时仅带来微小提升,表明时序建模的重要性低于特征抽象。
- 随着预训练数据量增加,性能稳步提升,尤其在AT任务上表现明显,证实大规模、多样化音频标记数据的知识蒸馏可显著提升字幕质量。
- 表现最佳的模型超越了此前最先进结果,包括Clotho数据集上的关键词预测(KWP)方法和Audiocaps数据集上的AudioSet VGGish特征方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。